Esta história começou para mim depois que o X de repente começou a traduzir tudo para todos os idiomas. Em algum momento, me peguei pensando: quanto custa uma coisa dessas, se não for feita com um botão "traduzir", mas a nível de plataforma inteira?

Não posts individuais, não usuário por clique, mas sim todo o fluxo. Apareceu um post ou comentário - já passou pelo modelo, colocou as traduções no banco de dados, indexou, entregou aos usuários e aos mecanismos de busca.

No papel, parece muito poderoso. O mesmo conteúdo se torna global imediatamente. Qualquer tópico pode ser lido no seu idioma, os mecanismos de busca recebem páginas para diferentes países, a entrada no produto se torna mais ampla. Mas surge uma questão simples de engenharia: quanto isso realmente custa?

Primeira estimativa: pegamos H100 e um modelo grande

Primeiro, segui o caminho mais óbvio. Pegamos um modelo universal poderoso nível DeepSeek e o colocamos em H100. Simplesmente porque essa é a abordagem padrão atualmente, quando se quer "máxima qualidade". Depois, estimei o fluxo de posts no Reddit. Cerca de 10 milhões de posts e comentários aparecem por dia. O trecho médio de texto é curto, cerca de 75 tokens. No total, são cerca de 800 milhões de tokens de entrada por dia. Se traduzir para 10 idiomas, isso se transforma em cerca de 8 bilhões de tokens de saída.

Quando você começa a aplicar isso ao desempenho real de um LLM grande, obtém um resultado desagradável. Para processar esse fluxo, são necessárias cerca de 1100 placas de vídeo nível H100. Isso não é mais um "servidor com GPU", é um data center completo.

Em termos de dinheiro, apenas as placas de vídeo custam cerca de 40 milhões de dólares, e considerando servidores, rede, refrigeração e todo o resto, isso se torna ainda maior. Nesse momento, fica claro que eu estava indo na direção errada nas minhas reflexões.

A conclusão é óbvia - trocamos o modelo ou as placas de vídeo.

Se a tarefa é apenas tradução, por que precisamos de um modelo que sabe raciocinar, escrever textos e simular diálogo? Pesquisei e descobri que existem modelos de IA especializados em tradução. Por exemplo, NLLB. Ele é treinado especificamente para tradução, funciona mais rápido e é mais barato.

E a economia muda drasticamente. Esse modelo roda tranquilamente não em H100, mas em placas muito mais comuns:

RTX 4090, L40S, A10, A100.

O ideal para produção parece ser o L40S. É uma placa de servidor normal, não é um absurdo de preço e oferece um bom throughput. Após recalcular, obtemos que, em vez de mil H100, precisamos de um cluster de cerca de 250 L40S. Ainda é uma grande escala. Mas não é mais uma história nível OpenAI. É apenas uma infraestrutura cara, que pode ser calculada e montada.

Quanto custa isso?

Pegamos os mesmos 250 L40S. Uma placa custa cerca de 7 mil dólares. Apenas as GPUs custam cerca de 1,75 milhão de dólares.

Mas, na prática, a placa não existe sozinha. São necessários servidores, CPU, memória, discos, rede, racks e energia. Normalmente, isso custa aproximadamente o mesmo valor, mas um pouco mais barato. No final, obtemos cerca de 2,5 milhões de dólares para todo o cluster. É uma estimativa aproximada, mas a ordem de grandeza está clara.

Agora a eletricidade. Um L40S consome até 350 W. No total, o cluster, considerando todo o resto, consome cerca de 180 kW. Por mês, isso é aproximadamente 130 mil kWh. Se calcularmos pelo preço médio de data center, obtemos cerca de 25 mil euros por mês. E aqui está um ponto interessante: a eletricidade não parece ser o principal problema. O dinheiro principal vai para a compra do hardware.

E são necessários 10 idiomas?

Nesta fase, ficou óbvio para mim que o principal impulsionador do custo é o número de idiomas. Cada novo idioma aumenta linearmente a carga. Mas o tráfego não cresce linearmente. Os primeiros idiomas em número de falantes nativos dão um efeito enorme, depois vem o retorno decrescente. Traduzir, por exemplo, para o finlandês, onde há literalmente alguns milhões de falantes nativos e o nível de penetração do inglês é de 97%, torna-se absolutamente não lucrativo. Portanto, decidi não pegar 10 idiomas, mas pensar quais realmente oferecem a máxima cobertura. A escolha foi baseada no número de falantes nativos, o topo fica assim:  Inglês, Espanhol, Português, Francês, Russo, Hindi e Indonésio. Também há o Alemão em toda parte, mas vi que a cobertura não é a maior (120 milhões), e o nível de penetração do Inglês na Alemanha é muito alto, então isso definitivamente não pode ser prioridade. O que isso dá em termos de cobertura?

Se contarmos aproximadamente todos os falantes desses idiomas, incluindo aqueles que os usam como segunda língua, obtemos um número bastante impressionante. Inglês cerca de 1,4 bilhão, Hindi cerca de 600 milhões (sim, nem todos na Índia falam Hindi), Espanhol cerca de 560 milhões, Francês cerca de 300 milhões, Russo cerca de 250 milhões, Português cerca de 260 milhões, Indonésio cerca de 200 milhões. Simplesmente somar esses números não pode, porque há sobreposições. Mas se reduzirmos a uma cobertura única, obtemos aproximadamente 3,5 bilhões de pessoas. Isso é cerca de 65% de toda a internet.

Recálculo para 7 idiomas

Quando o cálculo passou de 10 idiomas para 7, a carga caiu cerca de um terço. Consequentemente, o cluster também diminui. Em vez de 250 placas, obtemos cerca de 180 L40S.

Em termos de dinheiro:

  • GPU cerca de 1,25 milhão de dólares
  • cluster completo cerca de 2 milhões de dólares

Em termos de eletricidade:

  • aproximadamente 90 mil kWh por mês
  • cerca de 18 mil euros por mês

Ou seja, perde-se uma pequena parte da cobertura potencial, mas economiza-se muito em infraestrutura.

Vale a pena para o Reddit?

No final das contas, a economia parece bastante simples. A implantação de tal sistema custará cerca de 2 milhões de dólares, mais cerca de 0,5 milhão por ano em manutenção e eletricidade. Para uma empresa do porte do Reddit, não é um dinheiro que não possa ser gasto, a questão é apenas o retorno.

E o retorno aqui está principalmente no tráfego. A tradução abre acesso à pesquisa em idiomas locais e remove a barreira de entrada para um enorme número de usuários. Mesmo que isso dê apenas alguns por cento de crescimento, isso já se transforma em dezenas de milhões de visualizações adicionais e, como consequência, milhões de dólares em receita publicitária por ano. Com uma implementação normal, parece um investimento com retorno múltiplo.

Portanto, acho que veremos esse passo da empresa em um futuro muito próximo.