A Liquid AI anunciou em 24 de setembro de 2026 o lançamento de um modelo draft experimental batizado DSpark, voltado a acelerar a inferência do seu modelo de visão e linguagem LFM2.5-VL-3B. A proposta é acrescentar um caminho de decodificação especulativa que troca um aumento pequeno no consumo de memória por ganhos maiores de velocidade, sem mexer na qualidade das saídas.
O anúncio foi publicado no blog da Hugging Face e dá continuidade aos drafters de texto LFM2.5-DSpark, apresentados recentemente pela companhia.
Os números divulgados são diretos. A decodificação fica até 3,13 vezes mais rápida em dispositivo e até 2,66 vezes mais rápida em uma GPU H100.
Em latência ponta a ponta, os ganhos chegam a 2,62x e 2,27x, respectivamente.
O preço dessa aceleração é um drafter com cerca de 280 milhões de parâmetros. Isso equivale a 8,9% adicionais sobre o modelo-alvo de 3 bilhões de parâmetros.
O suporte chega no primeiro dia para llama.cpp, MLX-VLM e SGLang.
Como funciona a decodificação especulativa em vlms
O drafter de visão reaproveita a mesma arquitetura dos drafters de texto da linha LFM2.5-DSpark. Ele captura os estados ocultos do modelo-alvo em um conjunto fixo de camadas selecionadas.
Usa essas informações como condição para propor um bloco de k tokens candidatos, que depois passam pela verificação do modelo maior.
A parte decisiva para o caso multimodal acontece antes dessas camadas. Patches de imagem e tokens de texto são projetados em uma representação compartilhada.
Com isso, o drafter opera sobre vetores de estado oculto de dimensionalidade idêntica, independentemente da modalidade de entrada. O algoritmo de inferência, portanto, não precisou ser alterado em relação aos modelos de texto.
Arquitetura enxuta e treinamento
O treinamento seguiu a receita do DSpark com uma mistura de dados de ajuste supervisionado de visão e linguagem. O peso maior ficou para as cargas de trabalho que a empresa espera atender.
A partir de ablações com 3, 4 e 5 camadas, a equipe chegou a um drafter simplificado, apenas de atenção, com 4 camadas e tamanho de bloco 9.
Foram 10 épocas sobre a mistura final, com a taxa de aceitação medida após cada uma. O indicador melhorou conforme mais tokens de treinamento foram usados, até atingir retornos decrescentes.
Na inferência, a recomendação é de bloco 8 ou 9, dependendo do hardware disponível.
A composição de parâmetros do drafter também foi detalhada. São 193,0 milhões no empilhamento do decodificador de 4 camadas, 21,0 milhões na projeção de estados ocultos e apenas 6,4 mil em normas e cabeça de confiança.
É esse conjunto enxuto que responde pelo acréscimo de 8,9% ao volume total do modelo implantado.
Desempenho medido em cpu e GPU
Os testes cobrem inferência local e em GPU. As duas configurações usam bloco DSpark de tamanho 8 e foram avaliadas em seis tarefas visuais distintas: VQA geral, VQA de texto, legendagem de imagens, VQA de gráficos, raciocínio complexo e conversa multiturno, seguindo o benchmark MMSpec.
Em dispositivo, com MLX rodando em um M5 Max, a decodificação ficou de 2,30x a 3,13x mais rápida conforme a tarefa. A latência ponta a ponta melhorou entre 1,56x e 2,62x.
Já com llama.cpp em um M3 Ultra, a decodificação avançou de 1,57x a 2,14x e o tempo total caiu entre 1,30x e 1,77x. No caso da GPU, o pico de decodificação é de 2,66x.
Por que isso importa
Modelos de visão e linguagem lidam com entradas pesadas. Cada imagem vira uma sequência de patches que precisa ser processada junto ao texto.
Qualquer ganho de eficiência nesse estágio se traduz rapidamente em custo menor por consulta e em respostas mais ágeis, especialmente em aplicações que rodam no próprio dispositivo do usuário, sem depender de servidores.
A aposta da Liquid AI é que vale a pena gastar um pouco mais de memória para ganhar velocidade sem sacrificar qualidade. Como o drafter representa menos de um décimo do tamanho do modelo-alvo, o trade-off tende a ser vantajoso em cenários com restrição de latência.
O resultado varia conforme o hardware e o tipo de tarefa.
Outro ponto relevante é a integração imediata com três ferramentas populares de execução: llama.cpp, MLX-VLM e SGLang. Isso reduz a barreira para desenvolvedores testarem o ganho em pipelines já existentes, sem reescrever a pilha de inferência.
O modelo, no entanto, é apresentado como experimental, o que sinaliza que ajustes e refinamentos podem vir nas próximas versões.







