Google Research, DeepMind e NYU apresentaram TurboQuant, e isso pode ser um dos trabalhos de infraestrutura mais importantes do ano em IA.

No papel, não parece muito empolgante: quantização vetorial, compressão de vetores de alta dimensão, garantias teóricas. Na prática, trata-se de duas coisas muito caras: KV-cache em grandes modelos de linguagem e busca vetorial.

Em ambos, o problema antigo é o mesmo. É preciso comprimir os dados o máximo possível, mas sem estragar a geometria dos vetores, ou seja, distâncias e produtos escalares. Se estragar, começam os problemas com atenção, recuperação, ranqueamento e qualidade da resposta do modelo.

É aí que o TurboQuant ataca.

Os autores afirmam que seu método se aproxima do limite teórico em taxa de distorção. Simplificando, do limite de quão bem esses vetores podem ser comprimidos em uma dada bitagem. Para um trabalho acadêmico, a tese já é forte.

Na maioria dos esquemas práticos, há um velho compromisso. Ou é necessário treinamento offline pesado, calibração e codebooks, ou o método é rápido e conveniente para online, mas a qualidade da compressão é mediana. O TurboQuant tenta deslocar esse compromisso.

E o problema não é apenas a perda de qualidade. O Google, em seu blog, escreve separadamente sobre outro detalhe desagradável da quantização vetorial clássica: a sobrecarga de memória. Você até economiza bits, mas depois é forçado a gastar parte dessa economia armazenando constantes de quantização em precisão total para pequenos blocos de dados. Segundo eles, essa sobrecarga pode adicionar mais 1-2 bits por número. Ou seja, parte do ganho é simplesmente consumida pela carga administrativa.

Nesse contexto, TurboQuant parece uma tentativa de resolver todo o pacote de problemas de uma vez: reduzir memória, eliminar sobrecarga desnecessária, não exigir treinamento ou fine-tuning e, ao mesmo tempo, não prejudicar as tarefas downstream.

É importante notar que o paper não reduz tudo ao MSE. Para modelos modernos, isso não é suficiente. Em atenção e recuperação, é crítico preservar o produto interno. Os autores mostram diretamente que um quantizador otimizado apenas para MSE pode dar uma estimativa enviesada do produto escalar. Por isso, eles têm um esquema de duas etapas: primeiro a compressão principal, depois uma correção de 1 bit do resíduo via QJL para remover o viés.

Traduzindo para uma linguagem normal, a ideia é simples: comprimir o vetor não é suficiente. É preciso fazer isso de modo que o modelo não comece a pensar um pouco diferente do que deveria.

Pelos resultados declarados, o quadro parece forte. No paper, os autores escrevem que, para KV-cache, alcançam neutralidade de qualidade em 3,5 bits por canal e apenas uma pequena degradação em 2,5 bits. No Needle-in-a-Haystack, segundo seus dados, o TurboQuant mantém a qualidade do modelo de precisão total com compressão 4x. No LongBench, a variante com 3,5 bits vai praticamente lado a lado com o cache completo no Llama-3.1-8B-Instruct.

Mas no blog do Google há, talvez, uma tese ainda mais importante. Lá, eles enfatizam que o TurboQuant consegue comprimir o KV-cache para 3 bits sem treinamento e fine-tuning e sem perda de qualidade em seus testes. Além disso, afirmam que o TurboQuant de 4 bits oferece até 8x de aceleração no cálculo dos logits de atenção em H100 em comparação com keys não quantizadas de 32 bits.

Isso é uma conversa direta sobre custo e velocidade de serving.

Não menos curiosa é a parte sobre busca vetorial. Os autores afirmam que o TurboQuant supera a Product Quantization e o RabitQ em recall, e o tempo de indexação é quase zero. Para sistemas que precisam armazenar e pesquisar em enormes índices de embeddings, isso é potencialmente muito dinheiro.

No entanto, é claro que não se deve perder a cabeça. Esta é uma história com afirmações muito fortes, portanto, a replicação externa é especialmente importante aqui. Frases como zero accuracy loss, near-optimal distortion e up to 8x sempre precisam ser verificadas nos detalhes da implementação, baseline e configurações do experimento.

Mas, no saldo líquido, a notícia é realmente grande.

Se a verificação externa confirmar pelo menos a maior parte do que foi afirmado, este será um dos trabalhos de infraestrutura mais importantes em IA dos últimos tempos.


❗️❗️❗️❗️❗️❗️❗️❗️ / Não proibido na Rússia