Google Research, DeepMind y NYU presentaron TurboQuant, y esto podría ser uno de los trabajos de infraestructura más importantes del año en IA.

En papel no parece demasiado emocionante: cuantización vectorial, compresión de vectores de alta dimensión, garantías teóricas. En la práctica, se trata de dos cosas muy costosas: KV-cache en modelos de lenguaje grandes y búsqueda vectorial.

En ambos casos, el problema es el mismo. Es necesario comprimir los datos lo máximo posible, pero sin estropear la geometría de los vectores, es decir, distancias y productos escalares. Si se estropea, empiezan los problemas con atención, recuperación, clasificación y calidad de respuesta del modelo.

Ahí es donde TurboQuant ataca.

Los autores afirman que su método se acerca casi al límite teórico en tasa de distorsión. En términos simples, al límite de cuán bien se pueden comprimir estos vectores con una determinada cantidad de bits. Para un trabajo académico, la tesis ya es sólida.

La mayoría de los esquemas prácticos tienen aquí un viejo compromiso. O se necesita un entrenamiento offline pesado, calibración y codebooks, o el método es rápido y conveniente para online, pero la calidad de compresión es mediocre. TurboQuant intenta desplazar este compromiso.

Además, el problema no es solo la pérdida de calidad. Google en su blog menciona otro detalle desagradable de la cuantización vectorial clásica: la sobrecarga de memoria. Ahorras bits, pero luego te ves obligado a gastar parte de ese ahorro en almacenar constantes de cuantización con precisión completa para pequeños bloques de datos. Según ellos, esta sobrecarga puede añadir 1-2 bits adicionales por número. Es decir, parte de la ganancia se consume por la carga administrativa.

En este contexto, TurboQuant parece un intento de resolver todo el paquete de problemas a la vez: reducir memoria, eliminar sobrecarga innecesaria, no requerir entrenamiento o ajuste fino, y no arruinar las tareas posteriores.

Es importante destacar que el artículo no se limita al MSE. Para los modelos modernos, esto no es suficiente. En atención y recuperación es crítico preservar el producto interno. Los autores muestran directamente que un cuantizador optimizado solo para MSE puede dar una estimación sesgada del producto escalar. Por eso tienen un esquema de dos pasos: primero compresión principal, luego corrección de 1 bit del residuo mediante QJL para eliminar el sesgo.

Traduciendo esto a lenguaje normal, la idea es simple: no basta con comprimir el vector. Hay que hacerlo de manera que el modelo después no empiece a pensar un poco diferente.

Según los resultados declarados, el panorama es sólido. En el artículo, los autores escriben que para KV-cache logran neutralidad de calidad con 3.5 bits por canal y solo una pequeña degradación con 2.5 bits. En Needle-in-a-Haystack, según sus datos, TurboQuant mantiene la calidad del modelo de precisión completa con compresión 4x. En LongBench, la versión de 3.5 bits va prácticamente a la par con el caché completo en Llama-3.1-8B-Instruct.

Pero en el blog de Google hay una tesis quizás aún más importante. Allí destacan que TurboQuant puede comprimir KV-cache a 3 bits sin entrenamiento ni ajuste fino y sin pérdida de calidad en sus pruebas. Además, afirman que TurboQuant de 4 bits proporciona hasta 8 veces de aceleración en el cálculo de logits de atención en H100 en comparación con claves no cuantizadas de 32 bits.

Esto es una conversación directa sobre el costo y la velocidad de servicio.

No menos interesante es la parte sobre búsqueda vectorial. Los autores afirman que TurboQuant supera a Product Quantization y RabitQ en recall, y el tiempo de indexación es casi nulo. Para sistemas que necesitan almacenar y buscar en enormes índices de embeddings, esto potencialmente significa mucho dinero.

Sin embargo, no hay que perder la cabeza. Esta es una historia con afirmaciones muy sólidas, por lo que la replicación externa es especialmente importante. Frases como zero accuracy loss, near-optimal distortion y up to 8x siempre deben verificarse en los detalles de implementación, líneas base y configuraciones del experimento.

Pero en resumen, la noticia es realmente grande.

Si la verificación externa confirma al menos la mayor parte de lo declarado, este será uno de los trabajos de infraestructura más importantes en IA de los últimos tiempos.


❗️❗️❗️❗️❗️❗️❗️❗️ / No prohibido en la Federación Rusa