Bu hikaye benim için X'in aniden her şeyi tüm dillere çevirmeye başlamasıyla başladı. Bir noktada kendimi şunu düşünürken buldum: Bunu bir "çevir" düğmesiyle değil de tüm platform seviyesinde yapmak ne kadara mal olur?

Tek tek gönderiler değil, kullanıcının tıklamasıyla değil, tüm akış. Bir gönderi veya yorum geldiğinde hemen modelden geçirilir, çeviriler veritabanına konur, indekslenir, kullanıcılara ve arama motorlarına sunulur.

Kağıt üzerinde bu çok güçlü görünüyor. Aynı içerik anında küresel hale geliyor. Herhangi bir başlık kendi dilinizde okunabiliyor, arama motorları farklı ülkeler için sayfalar alıyor, ürüne giriş genişliyor. Ancak sonra basit bir mühendislik sorusu ortaya çıkıyor: Bunun gerçek maliyeti nedir?

İlk tahmin: H100 ve büyük model alıyoruz

Önce en bariz yoldan gittim. DeepSeek seviyesinde güçlü bir evrensel model alıp H100'e koyuyoruz. Çünkü bu şu anda "maksimum kalite" istendiğinde standart yaklaşım. Ardından Reddit'teki gönderi akışını tahmin ettim. Günde yaklaşık 10 milyon gönderi ve yorum çıkıyor. Ortalama metin parçası kısa, yaklaşık 75 token. Sonuç olarak günde yaklaşık 800 milyon giriş tokeni. 10 dile çevrilirse bu yaklaşık 8 milyar çıkış tokenine dönüşüyor.

Bunu büyük bir LLM'nin gerçek performansına uygulamaya başladığınızda, hoş olmayan bir sonuç elde ediyorsunuz. Böyle bir akışı işlemek için yaklaşık 1100 adet H100 seviyesinde grafik kartı gerekiyor. Bu artık bir "GPU'lu sunucu" değil, tam teşekküllü bir veri merkezi.

Sadece grafik kartları yaklaşık 40 milyon dolara mal oluyor ve sunucular, ağ, soğutma ve diğer her şey dahil edildiğinde bu daha da artıyor. Bu noktada düşüncelerimde tamamen yanlış yolda olduğum anlaşılıyor.

Sonuç açık - modeli veya grafik kartlarını değiştiriyoruz.

Görev sadece çeviri ise, neden akıl yürütebilen, metin yazabilen ve diyalog simüle edebilen bir modele ihtiyacımız olsun? Araştırdım ve çeviri için özel yapay zeka modelleri olduğunu buldum. Örneğin, NLLB. Sadece çeviri üzerine eğitilmiş, daha hızlı ve daha ucuz çalışıyor.

Ve burada ekonomi çarpıcı bir şekilde değişiyor. Böyle bir model H100'de değil, çok daha sıradan kartlarda rahatça çalışıyor:

RTX 4090, L40S, A10, A100.

Üretim için en uygunu L40S görünüyor. Bu normal bir sunucu kartı, fiyatı uzay değil ve aynı zamanda iyi bir iş hacmi sağlıyor. Yeniden hesaplama sonucunda, bin H100 yerine yaklaşık 250 L40S'lik bir kümeye ihtiyacımız olduğu ortaya çıkıyor. Bu hala büyük bir ölçek. Ancak bu artık OpenAI seviyesinde bir hikaye değil. Bu sadece hesaplanabilir ve toplanabilir pahalı bir altyapı.

Bu ne kadar tutar?

Aynı 250 L40S'i alıyoruz. Bir kart yaklaşık 7 bin dolara mal oluyor. Sadece GPU'lar yaklaşık 1.75 milyon dolarlık maliyet veriyor.

Ancak pratikte kart tek başına var olmaz. Sunucular, CPU, bellek, diskler, ağ, raflar ve güç gerekir. Genellikle bu, üstüne yaklaşık aynı miktarda, ancak biraz daha ucuzdur. Sonuç olarak tüm küme için yaklaşık 2.5 milyon dolar elde ediyoruz. Bu kaba bir tahmin, ancak büyüklük sırası anlaşılır.

Şimdi elektrik. Bir L40S 350 W'a kadar tüketiyor. Diğer her şey dahil küme toplamda yaklaşık 180 kW çıkıyor. Ayda bu yaklaşık 130 bin kWh. Veri merkezi ortalama fiyatından hesaplarsak, ayda yaklaşık 25 bin euro elde edilir. Ve burada ilginç bir nokta var: elektrik ana sorun gibi görünmüyor. Ana para donanım alımına gidiyor.

Peki 10 dil gerekli mi?

Bu aşamada, maliyetin ana itici gücünün dil sayısı olduğu benim için açık hale geldi. Her yeni dil yükü doğrusal olarak artırıyor. Ancak trafik doğrusal olarak artmıyor. İlk diller, konuşmacı sayısına göre büyük bir etki sağlıyor, ardından azalan getiri geliyor; örneğin, konuşmacı sayısı sadece birkaç milyon olan ve İngilizce penetrasyon oranı %97 olan Fince'ye çevirmek kesinlikle karlı değil. Bu nedenle 10 dil almamaya, hangilerinin gerçekten maksimum kapsama sağladığını düşünmeye karar verdim. Seçim konuşmacı sayısına göre yapıldı, ilk sıralar şöyle: İngilizce, İspanyolca, Portekizce, Fransızca, Rusça, Hintçe ve Endonezce. Ayrıca her yerde Almanca var, ancak kapsamın en büyük olmadığını (120 milyon) ve Almanya'da İngilizce penetrasyon oranının çok yüksek olduğunu gördüm, bu nedenle bunu kesinlikle önceliklendirmemek gerekir. Bu, kapsam açısından ne sağlıyor?

Bu dilleri konuşanların tamamını, ikinci dil olarak kullananlar da dahil olmak üzere kabaca hesaplarsak, oldukça etkileyici bir rakam elde edilir. İngilizce yaklaşık 1.4 milyar, Hintçe yaklaşık 600 milyon (evet, Hindistan'daki herkes Hintçe konuşmuyor), İspanyolca yaklaşık 560 milyon, Fransızca yaklaşık 300 milyon, Rusça yaklaşık 250 milyon, Portekizce yaklaşık 260 milyon, Endonezce yaklaşık 200 milyon. Bu rakamları basitçe toplamak mümkün değil çünkü kesişmeler var. Ancak bunu benzersiz kapsama dönüştürürsek, yaklaşık 3.5 milyar kişi elde edilir. Bu, tüm internetin yaklaşık %65'i.

7 dil için yeniden hesaplama

Hesaplama 10 dilden 7 dile geçtiğinde, yük yaklaşık üçte bir oranında düştü. Buna bağlı olarak küme de küçülüyor. 250 kart yerine yaklaşık 180 L40S elde ediyoruz.

Parasal olarak:

  • GPU yaklaşık 1.25 milyon dolar
  • tam küme yaklaşık 2 milyon dolar

Elektrik olarak:

  • ayda yaklaşık 90 bin kWh
  • ayda yaklaşık 18 bin euro

Yani potansiyel kapsamın küçük bir kısmı kaybediliyor, ancak altyapıdan büyük ölçüde tasarruf ediliyor.

Bu Reddit için karlı mı?

Özetle ekonomi oldukça basit görünüyor. Böyle bir sistemin başlatılması yaklaşık 2 milyon dolara mal olacak, artı bakım ve elektrik için yılda yaklaşık 0.5 milyon dolar. Reddit ölçeğindeki bir şirket için bu, harcanamayacak paralar değil, sorun sadece getiride.

Ve buradaki getiri öncelikle trafikte. Çeviri, yerel dillerde aramaya erişim sağlar ve çok sayıda kullanıcı için giriş engelini kaldırır. Bu sadece birkaç yüzde büyüme sağlasa bile, bu on milyonlarca ekstra görüntüleme ve sonuç olarak yılda milyonlarca dolar reklam geliri anlamına gelir. Normal bir uygulamada bu, katlanarak geri dönüşü olan bir yatırım gibi görünüyor.

Bu nedenle, şirketten çok yakın bir gelecekte böyle bir adım göreceğimizi düşünüyorum.