Cette histoire a commencé pour moi après que X a soudainement commencé à tout traduire dans toutes les langues. À un moment donné, je me suis surpris à penser : combien coûte réellement une telle chose si on ne la fait pas avec un bouton « traduire », mais au niveau de toute la plateforme ?
Pas des publications individuelles, pas un utilisateur qui clique, mais tout le flux. Un post ou un commentaire apparaît - on le passe immédiatement dans le modèle, on met les traductions en base de données, on les indexe, on les livre aux utilisateurs et aux moteurs de recherche.
Sur le papier, cela semble très puissant. Le même contenu devient immédiatement global. N'importe quel fil peut être lu dans votre langue, les moteurs de recherche obtiennent des pages pour différents pays, l'entrée dans le produit s'élargit. Mais ensuite se pose une simple question d'ingénierie : combien cela coûte-t-il réellement ?
Première estimation : prenons H100 et un grand modèle
D'abord, j'ai suivi la voie la plus évidente. Prenons un modèle universel puissant de niveau DeepSeek et mettons-le sur H100. Simplement parce que c'est l'approche standard actuelle quand on veut « une qualité maximale ». Ensuite, j'ai estimé le flux de posts sur Reddit. Environ 10 millions de posts et commentaires apparaissent par jour. Le texte moyen est court, environ 75 tokens. Au total, cela donne environ 800 millions de tokens d'entrée par jour. Si on traduit en 10 langues, cela se transforme en environ 8 milliards de tokens de sortie.
Quand on commence à superposer cela aux performances réelles d'un grand LLM, on obtient un résultat désagréable. Pour traiter un tel flux, il faut environ 1100 cartes graphiques de niveau H100. Ce n'est plus un « serveur avec GPU », c'est un véritable centre de données.
En termes d'argent, rien que les cartes graphiques coûtent environ 40 millions de dollars, et avec les serveurs, le réseau, le refroidissement et tout le reste, cela devient encore plus. À ce moment-là, il devient clair que je ne suis pas du tout allé dans la bonne direction dans mes réflexions.
La conclusion est évidente : changeons de modèle ou de cartes graphiques.
Si la tâche est seulement la traduction, pourquoi avons-nous besoin d'un modèle qui sait raisonner, écrire des textes et simuler un dialogue ? J'ai cherché sur Google et j'ai trouvé qu'il existe des modèles d'IA spécialisés pour la traduction. Par exemple, NLLB. Il est entraîné spécifiquement pour la traduction, fonctionne plus rapidement et est moins cher.
Et là, l'économie change radicalement. Un tel modèle tourne facilement non pas sur H100, mais sur des cartes beaucoup plus courantes :
RTX 4090, L40S, A10, A100.
Pour la production, le L40S semble optimal. C'est une carte serveur normale, pas un prix cosmique, et elle offre un bon débit. Après recalcul, on obtient qu'au lieu de mille H100, nous avons besoin d'un cluster d'environ 250 L40S. C'est toujours une grande échelle. Mais ce n'est plus une histoire de niveau OpenAI. C'est simplement une infrastructure coûteuse que l'on peut calculer et assembler.
Combien cela coûte-t-il ?
Prenons les mêmes 250 L40S. Une carte coûte environ 7 000 dollars. Rien que les GPU donnent environ 1,75 million de dollars de coûts.
Mais en pratique, une carte n'existe pas seule. Il faut des serveurs, CPU, mémoire, disques, réseau, baies et alimentation. En général, cela représente à peu près la même chose en plus, mais un peu moins cher. Au final, on obtient environ 2,5 millions de dollars pour l'ensemble du cluster. C'est une estimation grossière, mais l'ordre de grandeur est clair.
Maintenant, l'électricité. Un L40S consomme jusqu'à 350 W. Au total, le cluster, en tenant compte de tout le reste, consomme environ 180 kW. Par mois, cela représente environ 130 000 kWh. Si on calcule au prix moyen d'un centre de données, on obtient environ 25 000 euros par mois. Et ici, un point intéressant : l'électricité ne semble pas être le problème principal. L'argent principal va dans l'achat du matériel.
Faut-il vraiment 10 langues ?
À ce stade, il m'est devenu évident que le principal moteur du coût est le nombre de langues. Chaque nouvelle langue augmente linéairement la charge. Mais le trafic n'augmente pas linéairement. Les premières langues en nombre de locuteurs donnent un effet énorme, ensuite le rendement diminue. Traduire, par exemple, en finnois, où il n'y a littéralement que quelques millions de locuteurs et où le taux de pénétration de l'anglais est de 97 %, devient totalement non rentable. J'ai donc décidé de ne pas prendre 10 langues, mais de réfléchir à celles qui donnent réellement la couverture maximale. Le choix s'est fait sur le nombre de locuteurs, le top ressemble à ceci : Anglais, Espagnol, Portugais, Français, Russe, Hindi et Indonésien. Il y a aussi l'Allemand partout, mais j'ai regardé : la couverture n'est pas la plus grande (120 millions), et le taux de pénétration de l'anglais en Allemagne est très élevé, donc on peut certainement ne pas le mettre en priorité. Qu'est-ce que cela donne en termes de couverture ?
Si on compte grossièrement tous les locuteurs de ces langues, y compris ceux qui les utilisent comme deuxième langue, on obtient un chiffre assez impressionnant. Anglais environ 1,4 milliard, Hindi environ 600 millions (oui, tout le monde en Inde ne parle pas hindi), Espagnol environ 560 millions, Français environ 300 millions, Russe environ 250 millions, Portugais environ 260 millions, Indonésien environ 200 millions. On ne peut pas simplement additionner ces chiffres car il y a des chevauchements. Mais si on ramène cela à une couverture unique, on obtient environ 3,5 milliards de personnes. Cela représente environ 65 % de l'ensemble d'Internet.
Recalcul pour 7 langues
Quand le calcul est passé de 10 langues à 7, la charge a chuté d'environ un tiers. En conséquence, le cluster diminue aussi. Au lieu de 250 cartes, on obtient environ 180 L40S.
En termes d'argent :
- GPU environ 1,25 million de dollars
- cluster complet environ 2 millions de dollars
Pour l'électricité :
- environ 90 000 kWh par mois
- environ 18 000 euros par mois
On perd donc une petite partie de la couverture potentielle, mais on économise beaucoup sur l'infrastructure.
Est-ce rentable pour Reddit ?
En fin de compte, l'économie semble assez simple. Le lancement d'un tel système coûterait environ 2 millions de dollars, plus environ 0,5 million par an pour la maintenance et l'électricité. Pour une entreprise de la taille de Reddit, ce n'est pas de l'argent qu'on ne peut pas dépenser, la question est seulement le retour.
Et le retour ici est principalement dans le trafic. La traduction ouvre l'accès à la recherche dans les langues locales et supprime la barrière d'entrée pour un grand nombre d'utilisateurs. Même si cela ne donne que quelques pourcents de croissance, cela se transforme en dizaines de millions de vues supplémentaires et, par conséquent, en millions de dollars de revenus publicitaires par an. Avec une mise en œuvre normale, cela ressemble à un investissement à retour multiple.
C'est pourquoi je pense que nous verrons une telle étape de la part de l'entreprise dans un avenir très proche.
Commentaires
0Aucun commentaire pour le moment.