Google Research, DeepMind, dan NYU memperkenalkan TurboQuant, dan ini bisa menjadi salah satu karya infrastruktur terpenting tahun ini di bidang AI.

Di atas kertas, tampaknya tidak terlalu menarik: vector quantization, kompresi vektor berdimensi tinggi, jaminan teoretis. Dalam praktiknya, ini menyangkut dua hal yang sangat mahal: KV-cache pada model bahasa besar dan vector search.

Di kedua area tersebut, masalah lamanya sama. Data perlu dikompresi sebanyak mungkin, tetapi tanpa merusak geometri vektor, yaitu jarak dan perkalian skalar. Jika rusak, akan timbul masalah dengan attention, retrieval, peringkat, dan kualitas respons model.

Di sinilah TurboQuant bekerja.

Penulis mengklaim bahwa metode mereka hampir mendekati batas teoretis dalam hal distortion rate. Sederhananya, batas seberapa baik vektor semacam itu dapat dikompresi pada bitrate tertentu. Untuk karya akademis, klaim ini sudah kuat.

Kebanyakan skema praktis memiliki kompromi lama. Entah memerlukan pelatihan offline yang berat, kalibrasi, dan codebook, atau metode yang cepat dan nyaman untuk online, tetapi kualitas kompresinya biasa saja. TurboQuant mencoba menggeser kompromi ini.

Masalahnya bukan hanya pada hilangnya kualitas. Google dalam blog mereka secara khusus menulis tentang detail lain yang tidak menyenangkan dari vector quantization klasik: memory overhead. Anda tampaknya menghemat bit, tetapi kemudian terpaksa menghabiskan sebagian dari penghematan itu untuk menyimpan quantization constants dalam presisi penuh untuk blok data kecil. Menurut mereka, overhead semacam itu dapat menambah 1-2 bit per angka. Artinya, sebagian keuntungan hanya dimakan oleh beban tambahan.

Dengan latar belakang ini, TurboQuant tampak seperti upaya untuk menyelesaikan seluruh paket masalah sekaligus: mengurangi memori, menghilangkan overhead yang tidak perlu, tidak memerlukan pelatihan atau fine-tuning, dan tidak merusak tugas downstream.

Yang juga penting, paper tidak mereduksi semuanya menjadi MSE. Untuk model modern, itu tidak cukup. Dalam attention dan retrieval, sangat penting untuk mempertahankan inner product. Penulis secara langsung menunjukkan bahwa quantizer yang dioptimalkan hanya untuk MSE dapat memberikan estimasi perkalian skalar yang bias. Oleh karena itu, mereka memiliki skema dua langkah: pertama kompresi utama, kemudian koreksi sisa 1-bit melalui QJL untuk menghilangkan bias.

Jika diterjemahkan ke bahasa biasa, idenya sederhana: mengompresi vektor saja tidak cukup. Ini harus dilakukan sedemikian rupa sehingga model setelahnya tidak mulai berpikir sedikit berbeda.

Berdasarkan hasil yang dilaporkan, gambarnya terlihat kuat. Dalam paper, penulis menulis bahwa untuk KV-cache, mereka mencapai quality neutrality pada 3,5 bit per saluran dan hanya degradasi kecil pada 2,5 bit. Dalam Needle-in-a-Haystack, menurut data mereka, TurboQuant mempertahankan kualitas model presisi penuh pada kompresi 4x. Pada LongBench, varian 3,5 bit berjalan hampir setara dengan full cache pada Llama-3.1-8B-Instruct.

Namun di blog Google, ada mungkin tesis yang lebih penting. Di sana mereka secara khusus menekankan bahwa TurboQuant dapat mengompresi KV-cache hingga 3 bit tanpa training dan fine-tuning dan tanpa penurunan kualitas pada pengujian mereka. Lebih lanjut, mereka mengklaim bahwa TurboQuant 4-bit memberikan akselerasi hingga 8x dalam menghitung attention logits pada H100 dibandingkan dengan key 32-bit unquantized.

Ini adalah pembicaraan langsung tentang biaya dan kecepatan serving.

Tidak kalah menarik adalah bagian tentang vector search. Penulis mengklaim bahwa TurboQuant mengungguli Product Quantization dan RabitQ dalam recall, dan waktu indeksasi hampir nol. Untuk sistem yang perlu menyimpan dan mencari indeks embedding yang sangat besar, ini berpotensi menghasilkan uang yang sangat besar.

Namun, tentu saja, jangan kehilangan akal sehat. Ini adalah cerita dengan klaim yang sangat kuat, sehingga replikasi eksternal sangat penting. Frasa seperti zero accuracy loss, near-optimal distortion, dan up to 8x selalu perlu diperiksa pada detail implementasi, baseline, dan pengaturan eksperimen.

Tapi pada intinya, berita ini memang besar.

Jika verifikasi eksternal mengonfirmasi setidaknya sebagian besar dari apa yang diklaim, ini akan menjadi salah satu karya infrastruktur terpenting dalam AI akhir-akhir ini.


❗️❗️❗️❗️❗️❗️❗️❗️ / Tidak dilarang di RF