Esta historia comenzó para mí después de que X de repente empezara a traducir todo a todos los idiomas. En algún momento me sorprendí pensando: ¿cuánto cuesta realmente algo así si no se hace con un botón de “traducir”, sino a nivel de toda la plataforma?
No publicaciones individuales, no usuario que presiona, sino todo el flujo. Aparece una publicación o comentario, se pasa inmediatamente por el modelo, se guardan las traducciones en la base de datos, se indexan, se entregan a los usuarios y a los motores de búsqueda.
En el papel se ve muy potente. El mismo contenido se vuelve global de inmediato. Cualquier hilo se puede leer en tu idioma, los motores de búsqueda obtienen páginas para diferentes países, la entrada al producto se amplía. Pero luego surge una simple pregunta de ingeniería: ¿cuánto cuesta realmente?
Primera estimación: tomamos H100 y un modelo grande
Primero seguí el camino más obvio. Tomamos un modelo universal potente del nivel de DeepSeek y lo colocamos en H100. Simplemente porque este es el enfoque estándar actual cuando se quiere “la máxima calidad”. Luego estimé el flujo de publicaciones en Reddit. Cada día aparecen alrededor de 10 millones de publicaciones y comentarios. El fragmento de texto promedio es corto, digamos unos 75 tokens. En total, obtenemos aproximadamente 800 millones de tokens de entrada por día. Si traducimos a 10 idiomas, esto se convierte en aproximadamente 8 mil millones de tokens de salida.
Cuando empiezas a aplicar esto al rendimiento real de un LLM grande, obtienes un resultado desagradable. Para procesar tal flujo, se necesitan alrededor de 1100 tarjetas de video del nivel H100. Esto ya no es un “servidor con GPU”, es un centro de datos completo.
En términos de dinero, solo las tarjetas de video cuestan aproximadamente 40 millones de dólares, y teniendo en cuenta servidores, red, refrigeración y todo lo demás, se vuelve aún más. En ese momento, me di cuenta de que no iba por buen camino en mis reflexiones.
La conclusión es obvia: cambiamos el modelo o las tarjetas de video.
Si la tarea es solo traducción, ¿para qué necesitamos un modelo que pueda razonar, escribir textos y simular un diálogo? Busqué en Google y encontré que existen modelos de IA especializados para traducción. Por ejemplo, NLLB. Está entrenado específicamente para traducción, funciona más rápido y es más barato.
Y aquí la economía cambia drásticamente. Este modelo se ejecuta fácilmente no en H100, sino en tarjetas mucho más comunes:
RTX 4090, L40S, A10, A100.
Óptimo para producción parece ser L40S. Es una tarjeta de servidor normal, no es un disparate de precio y ofrece un buen rendimiento. Después del recálculo, resulta que en lugar de mil H100, necesitamos un clúster de aproximadamente 250 L40S. Esto sigue siendo una escala grande. Pero ya no es una historia del nivel de OpenAI. Es simplemente una infraestructura costosa que se puede calcular y montar.
¿Cuánto cuesta?
Tomamos las mismas 250 L40S. Una tarjeta cuesta aproximadamente 7 mil dólares. Solo las GPU suman alrededor de 1.75 millones de dólares en costos.
Pero en la práctica, la tarjeta no existe por sí sola. Se necesitan servidores, CPU, memoria, discos, red, racks y alimentación. Por lo general, esto cuesta aproximadamente lo mismo, pero un poco menos. En total, obtenemos aproximadamente 2.5 millones de dólares para todo el clúster. Es una estimación aproximada, pero el orden está claro.
Ahora la electricidad. Una L40S consume hasta 350 W. En total, el clúster, teniendo en cuenta todo lo demás, consume aproximadamente 180 kW. Al mes, esto es aproximadamente 130 mil kWh. Si calculamos al precio promedio de un centro de datos, obtenemos alrededor de 25 mil euros al mes. Y aquí hay un punto interesante: la electricidad no parece ser el problema principal. El dinero principal se destina a la compra del hardware.
¿Y son necesarios 10 idiomas?
En esta etapa, me resultó obvio que el principal impulsor del costo es la cantidad de idiomas. Cada nuevo idioma aumenta linealmente la carga. Pero el tráfico no crece linealmente. Los primeros idiomas por número de hablantes dan un efecto enorme, luego viene un rendimiento decreciente; traducir, por ejemplo, al finés, donde hay literalmente unos pocos millones de hablantes y el nivel de penetración del inglés es del 97%, se vuelve absolutamente no rentable. Por lo tanto, decidí no tomar 10 idiomas, sino pensar cuáles realmente dan la máxima cobertura. La elección se basó en el número de hablantes, el top se ve así: Inglés, Español, Portugués, Francés, Ruso, Hindi e Indonesio. También está el Alemán en todas partes, pero vi que la cobertura no es la más grande (120 millones), mientras que el nivel de penetración del Inglés en Alemania es muy alto, por lo que definitivamente no se puede priorizar. ¿Qué cobertura da esto?
Si calculamos aproximadamente a todos los hablantes de estos idiomas, incluidos aquellos que los usan como segundo idioma, obtenemos una cifra bastante impresionante. Inglés alrededor de 1.4 mil millones, Hindi alrededor de 600 millones (sí, no todos en la India hablan Hindi), Español alrededor de 560 millones, Francés alrededor de 300 millones, Ruso alrededor de 250 millones, Portugués alrededor de 260 millones, Indonesio alrededor de 200 millones. Simplemente sumar estas cifras no se puede porque hay superposiciones. Pero si lo llevamos a una cobertura única, obtenemos aproximadamente 3.5 mil millones de personas. Esto es alrededor del 65% de todo Internet.
Recálculo para 7 idiomas
Cuando el cálculo pasó de 10 idiomas a 7, la carga se redujo aproximadamente en un tercio. En consecuencia, el clúster también se reduce. En lugar de 250 tarjetas, obtenemos aproximadamente 180 L40S.
En términos de dinero:
- GPU alrededor de 1.25 millones de dólares
- clúster completo alrededor de 2 millones de dólares
En electricidad:
- aproximadamente 90 mil kWh al mes
- alrededor de 18 mil euros al mes
Es decir, se pierde una pequeña parte de la cobertura potencial, pero se ahorra mucho en infraestructura.
¿Vale la pena para Reddit?
En resumen, la economía parece bastante simple. Poner en marcha un sistema de este tipo costará aproximadamente 2 millones de dólares, más alrededor de 0.5 millones al año en mantenimiento y electricidad. Para una empresa del tamaño de Reddit, no es dinero que no se pueda gastar, la cuestión está en el retorno.
Y el retorno aquí está principalmente en el tráfico. La traducción abre el acceso a la búsqueda en idiomas locales y elimina la barrera de entrada para una gran cantidad de usuarios. Incluso si esto da solo un pequeño porcentaje de crecimiento, ya se convierte en decenas de millones de visitas adicionales y, como resultado, millones de dólares en ingresos publicitarios al año. Con una implementación normal, parece una inversión con un retorno múltiple.
Por lo tanto, creo que veremos este paso de la empresa en un futuro muy cercano.
Comentarios
0Aún no hay comentarios.