Cerita ini dimulai setelah X tiba-tiba mulai menerjemahkan semuanya ke semua bahasa. Pada suatu saat saya berpikir: berapa biaya sebenarnya untuk melakukan hal seperti ini, jika dilakukan bukan dengan tombol "terjemahkan", tetapi di tingkat seluruh platform?
Bukan postingan individu, bukan pengguna yang menekan tombol, tetapi seluruh aliran. Postingan atau komentar muncul - langsung diproses melalui model, terjemahan disimpan di database, diindeks, diberikan kepada pengguna dan mesin pencari.
Di atas kertas, ini terlihat sangat kuat. Konten yang sama langsung menjadi global. Thread apa pun dapat dibaca dalam bahasa Anda sendiri, mesin pencari mendapatkan halaman untuk berbagai negara, pintu masuk ke produk menjadi lebih luas. Namun kemudian muncul pertanyaan teknik sederhana: berapa biaya sebenarnya?
Perkiraan Pertama: Ambil H100 dan Model Besar
Pertama, saya mengambil jalur yang paling jelas. Ambil model universal yang kuat setingkat DeepSeek dan jalankan di H100. Hanya karena ini adalah pendekatan standar saat ini ketika menginginkan "kualitas maksimal". Kemudian saya memperkirakan aliran postingan di Reddit. Sekitar 10 juta postingan dan komentar muncul per hari. Rata-rata teks pendek, sekitar 75 token. Hasilnya, sekitar 800 juta token input per hari. Jika diterjemahkan ke 10 bahasa, ini menjadi sekitar 8 miliar token output.
Ketika Anda mulai menerapkan ini pada kinerja nyata LLM besar, hasilnya tidak menyenangkan. Untuk memproses aliran seperti itu, diperlukan sekitar 1100 kartu grafis level H100. Ini bukan lagi "server dengan GPU", ini adalah pusat data yang lengkap.
Dari segi uang, hanya kartu grafis saja sekitar 40 juta dolar, dan dengan mempertimbangkan server, jaringan, pendinginan, dan lainnya, ini menjadi lebih besar. Pada titik ini, menjadi jelas bahwa saya benar-benar salah arah dalam pemikiran saya.
Kesimpulannya jelas - ganti model atau kartu grafis.
Jika tugasnya hanya terjemahan, mengapa kita membutuhkan model yang bisa berpikir, menulis teks, dan mensimulasikan dialog? Saya mencari dan menemukan bahwa ada model AI khusus untuk terjemahan. Misalnya, NLLB. Model ini dilatih khusus untuk terjemahan, bekerja lebih cepat dan lebih murah.
Dan di sini ekonominya berubah drastis. Model seperti ini dengan mudah berjalan bukan di H100, tetapi di kartu yang jauh lebih biasa:
RTX 4090, L40S, A10, A100.
Optimal untuk produksi adalah L40S. Ini adalah kartu server yang normal, harganya tidak selangit, dan memberikan throughput yang baik. Setelah perhitungan ulang, alih-alih seribu H100, kita membutuhkan klaster sekitar 250 L40S. Ini masih skala besar. Tapi ini bukan lagi cerita level OpenAI. Ini hanya infrastruktur mahal yang bisa dihitung dan dirakit.
Berapa Biayanya?
Ambil 250 L40S yang sama. Satu kartu berharga sekitar 7 ribu dolar. Hanya GPU memberikan biaya sekitar 1,75 juta dolar.
Namun dalam praktiknya, kartu tidak berdiri sendiri. Diperlukan server, CPU, memori, disk, jaringan, rak, dan daya. Biasanya ini kira-kira sama di atasnya, tetapi sedikit lebih murah. Hasilnya, kita mendapatkan sekitar 2,5 juta dolar untuk seluruh klaster. Ini perkiraan kasar, tetapi urutannya jelas.
Sekarang listrik. Satu L40S mengonsumsi hingga 350 W. Total klaster dengan mempertimbangkan semua yang lain sekitar 180 kW. Per bulan, ini sekitar 130 ribu kWh. Jika dihitung dengan harga rata-rata pusat data, hasilnya sekitar 25 ribu euro per bulan. Dan di sini ada poin menarik: listrik tidak terlihat sebagai masalah utama. Uang utama justru digunakan untuk pembelian perangkat keras.
Apakah Perlu 10 Bahasa?
Pada tahap ini, menjadi jelas bagi saya bahwa pendorong utama biaya adalah jumlah bahasa. Setiap bahasa baru secara linear meningkatkan beban. Namun lalu lintas tidak tumbuh secara linear. Bahasa pertama berdasarkan jumlah penutur memberikan efek yang sangat besar, selanjutnya terjadi penurunan hasil, menerjemahkan, misalnya, ke bahasa Finlandia, yang penuturnya hanya beberapa juta, dan tingkat penetrasi bahasa Inggris 97%, menjadi sama sekali tidak menguntungkan. Oleh karena itu, saya memutuskan untuk tidak mengambil 10 bahasa, tetapi memikirkan bahasa mana yang benar-benar memberikan jangkauan maksimal. Pilihan didasarkan pada jumlah penutur, peringkatnya terlihat seperti ini: Inggris, Spanyol, Portugis, Prancis, Rusia, Hindi, dan Indonesia. Juga ada bahasa Jerman di mana-mana, tetapi saya melihat jangkauannya tidak terlalu besar (120 juta), sementara tingkat penetrasi bahasa Inggris di Jerman sangat tinggi, yang berarti ini pasti tidak menjadi prioritas. Apa yang diberikan ini dalam hal jangkauan?
Jika kita menghitung secara kasar semua penutur bahasa-bahasa ini, termasuk mereka yang menggunakannya sebagai bahasa kedua, kita mendapatkan angka yang cukup besar. Inggris sekitar 1,4 miliar, Hindi sekitar 600 juta (ya, tidak semua orang di India berbicara Hindi), Spanyol sekitar 560 juta, Prancis sekitar 300 juta, Rusia sekitar 250 juta, Portugis sekitar 260 juta, Indonesia sekitar 200 juta. Angka-angka ini tidak bisa dijumlahkan begitu saja karena ada tumpang tindih. Namun jika dikonversi ke jangkauan unik, hasilnya sekitar 3,5 miliar orang. Ini sekitar 65% dari seluruh internet.
Perhitungan Ulang untuk 7 Bahasa
Ketika perhitungan beralih dari 10 bahasa menjadi 7, beban turun sekitar sepertiga. Dengan demikian, klaster juga mengecil. Alih-alih 250 kartu, kita mendapatkan sekitar 180 L40S.
Dari segi uang:
- GPU sekitar 1,25 juta dolar
- klaster penuh sekitar 2 juta dolar
Untuk listrik:
- sekitar 90 ribu kWh per bulan
- sekitar 18 ribu euro per bulan
Artinya, sebagian kecil dari jangkauan potensial hilang, tetapi kita menghemat banyak infrastruktur.
Apakah Ini Menguntungkan bagi Reddit?
Pada intinya, ekonominya terlihat cukup sederhana. Meluncurkan sistem seperti itu akan menelan biaya sekitar 2 juta dolar, ditambah sekitar 0,5 juta dolar per tahun untuk pemeliharaan dan listrik. Bagi perusahaan sebesar Reddit, ini bukanlah uang yang tidak bisa dibelanjakan, pertanyaannya hanya pada pengembaliannya.
Dan pengembaliannya terutama pada lalu lintas. Terjemahan membuka akses ke pencarian dalam bahasa lokal dan menghilangkan hambatan masuk bagi sejumlah besar pengguna. Bahkan jika ini hanya memberikan beberapa persen pertumbuhan, ini sudah menjadi puluhan juta tampilan tambahan dan, sebagai hasilnya, jutaan dolar pendapatan iklan per tahun. Dengan implementasi yang tepat, ini terlihat seperti investasi dengan pengembalian berlipat ganda.
Oleh karena itu, saya pikir kita akan melihat langkah seperti itu dari perusahaan dalam waktu dekat.
Komentar
0Belum ada komentar.
Masuk untuk ikut berdiskusi.