
Google Research, DeepMind ve NYU, TurboQuant'ı tanıttı ve bu, AI alanında yılın en önemli altyapı çalışmalarından biri olabilir.
Kâğıt üzerinde pek heyecan verici görünmüyor: vektör niceleme, yüksek boyutlu vektörlerin sıkıştırılması, teorik garantiler. Pratikte ise iki çok pahalı şeyden bahsediyoruz: büyük dil modellerinde KV-cache ve vektör arama.
Her ikisinde de aynı eski sorun var. Verileri olabildiğince sıkıştırmak gerekiyor, ancak vektörlerin geometrisini, yani mesafeleri ve skaler çarpımları bozmamak gerekiyor. Bozulursa, dikkat, getirme, sıralama ve model yanıt kalitesinde sorunlar başlıyor.
İşte TurboQuant tam bu noktada devreye giriyor.
Yazarlar, yöntemlerinin distorsiyon oranında teorik sınıra neredeyse ulaştığını iddia ediyor. Basitçe söylemek gerekirse, belirli bir bit derinliğinde bu tür vektörlerin ne kadar iyi sıkıştırılabileceğinin sınırına yaklaşıyor. Akademik bir çalışma için bu güçlü bir iddia.
Çoğu pratik şemada burada eski bir ödünleşim var. Ya ağır çevrimdışı eğitim, kalibrasyon ve kod kitapları gerekiyor ya da yöntem çevrimiçi için hızlı ve kullanışlı, ancak sıkıştırma kalitesi düşük. TurboQuant bu ödünleşimi değiştirmeye çalışıyor.
Üstelik sorun sadece kalite kaybı değil. Google, blogunda klasik vektör nicelemenin bir başka can sıkıcı detayından bahsediyor: bellek yükü. Bitlerden tasarruf ediyorsunuz gibi görünüyor, ancak daha sonra bu tasarrufun bir kısmını küçük veri blokları için niceleme sabitlerini tam hassasiyette saklamak için harcamak zorunda kalıyorsunuz. Onlara göre, bu yük sayı başına 1-2 bit daha ekleyebiliyor. Yani kazancın bir kısmı ek yük tarafından tüketiliyor.
Bu arka planda TurboQuant, tüm sorun paketini aynı anda çözmeye yönelik bir girişim gibi görünüyor: belleği azaltmak, gereksiz ek yükü kaldırmak, eğitim veya ince ayar gerektirmemek ve aynı zamanda aşağı akış görevlerini bozmamak.
Ayrıca, makalenin her şeyi MSE'ye indirgememesi önemli. Modern modeller için bu yeterli değil. Dikkat ve getirmede iç çarpımı korumak kritiktir. Yazarlar, yalnızca MSE için optimize edilmiş bir niceleyicinin skaler çarpımın yanlı bir tahminini verebileceğini doğrudan gösteriyor. Bu nedenle iki aşamalı bir şemaları var: önce ana sıkıştırma, ardından QJL aracılığıyla kalanın 1 bitlik düzeltmesi, yanlılığı gidermek için.
Bunu normal dile çevirirsek, fikir basit: bir vektörü sıkıştırmak yeterli değil. Bunu, modelin daha sonra biraz farklı düşünmeye başlamayacağı şekilde yapmak gerekiyor.
Bildirilen sonuçlara göre tablo güçlü görünüyor. Makalede yazarlar, KV-cache için kanal başına 3,5 bitte kalite nötrlüğüne ulaştıklarını ve 2,5 bitte yalnızca küçük bir bozulma olduğunu yazıyor. Needle-in-a-Haystack'te, TurboQuant'ın 4 kat sıkıştırmada tam hassasiyetli model kalitesini koruduğunu belirtiyorlar. LongBench'te 3,5 bitlik sürüm, Llama-3.1-8B-Instruct'ta tam önbellekle neredeyse aynı seviyede.
Ancak Google'ın blogunda belki daha da önemli bir iddia var. Orada, TurboQuant'ın KV-cache'i eğitim ve ince ayar olmadan ve testlerinde kalite düşüşü olmadan 3 bit'e kadar sıkıştırabildiğini vurguluyorlar. Ayrıca, 4 bit TurboQuant'ın H100'de 32 bit nicelemesiz anahtarlara kıyasla dikkat logitlerini hesaplarken 8 kata kadar hızlanma sağladığını iddia ediyorlar.
Bu, doğrudan fiyat ve sunum hızıyla ilgili bir konuşma.
Vektör arama kısmı da daha az ilginç değil. Yazarlar, TurboQuant'ın geri çağırmada Product Quantization ve RabitQ'yu geçtiğini ve indeksleme süresinin neredeyse sıfır olduğunu iddia ediyor. Büyük gömme indekslerini depolaması ve araması gereken sistemler için bu potansiyel olarak çok büyük paralar demek.
Yine de, tabii ki, aklı başında olmak gerek. Bu, çok güçlü iddiaları olan bir hikaye, bu nedenle harici doğrulama özellikle önemli.
sıfır doğruluk kaybı, optimuma yakın bozulma ve 8 kata kadar gibi ifadeler her zaman uygulama ayrıntıları, temel çizgiler ve deney ayarları üzerinde kontrol edilmelidir.Ancak özünde haber gerçekten büyük.
Harici doğrulama, iddia edilenlerin en azından büyük bir kısmını doğrularsa, bu, AI'da son zamanların en önemli altyapı çalışmalarından biri olacak.
❗️❗️❗️❗️❗️❗️❗️❗️ / Rusya'da yasaklı değil
Yorumlar
0Henüz yorum yok.
Tartışmaya katılmak için giriş yapın.