
No estoy bromeando, absolutamente en serio. Bueno, no OpenAI, sino los modelos ChatGPT.
Ayer OpenAI publicó un extraño análisis: por qué GPT-5.x comenzó a insertar con demasiada frecuencia duendes, gremlins y otras criaturas fantásticas en sus respuestas.
En la superficie parecía un hábito de habla cómico. Los usuarios comenzaron a notarlo primero, luego dentro de OpenAI los empleados comenzaron a observar un "repunte de duendes". En el fondo resultó ser un problema de entrenamiento bastante serio: una señal de recompensa local comenzó a cambiar el estilo general del modelo.
El primer pico notable se vio después del lanzamiento de GPT-5.1. Según las mediciones internas de OpenAI, la palabra goblin aparecía un 175% más a menudo, gremlin un 52%. En GPT-5.4 el rastro se volvió más preciso: el modo Nerdy daba solo el 2,5% de las respuestas de ChatGPT, pero concentraba el 66,7% de todas las menciones de goblin.
La causa estaba en el entrenamiento del estilo de comunicación Nerdy, una especie de "persona". Se configuró como un mentor juguetón y erudito que reduce la pomposidad y habla de manera más viva. Una de las señales de recompensa para este modo evaluaba sistemáticamente más alto las respuestas con tales palabras. En la auditoría de OpenAI, se encontró un cambio positivo a favor de respuestas con goblin/gremlin en el 76,2% de los conjuntos de datos.
Luego funcionó el bucle.
El modelo recibe una recompensa por el estilo juguetón. Dentro de este estilo, un giro verbal aleatorio aparece más a menudo en respuestas exitosas. Estas respuestas pasan a los datos para un posterior ajuste fino. Después de varios ciclos, el modelo comienza a considerar ese giro (o palabra, en resumen, un conjunto de tokens) como parte del tono normal, incluso fuera del modo original.
OpenAI luego eliminó Nerdy, cortó la señal de recompensa correspondiente y filtró los datos de entrenamiento con tales palabras. Pero GPT-5.5 ya había comenzado el entrenamiento antes de encontrar la causa, por lo que en Codex se añadió una instrucción separada para suprimir este tic.
En los modelos grandes no hay límites precisos entre "personalidades", estilos de usuario y comportamiento base. Si un modo recibe una recompensa por un lenguaje expresivo, el efecto puede filtrarse a modos vecinos, especialmente cuando las respuestas generadas vuelven a ser material de entrenamiento.
Episodios similares son conocidos.
En abril de 2025, OpenAI revirtió una actualización de GPT-4o que hizo al modelo excesivamente complaciente. Anthropic en 2023 describió la misma clase de problema de manera más amplia. En su investigación, 5 asistentes mostraban tendencia a estar de acuerdo con el usuario en lugar de aferrarse a la verdad.
Google tuvo un caso relacionado con Gemini Image en febrero de 2024. El sistema se configuró para no reproducir representaciones dañinas de las personas. Luego, la configuración comenzó a activarse donde se requería precisión histórica o cultural: el modelo compensaba excesivamente la diversidad y a veces rechazaba solicitudes inofensivas.
El patrón general es simple: el modelo se optimiza para la retroalimentación positiva, incluso cuando diverge de la intención de los desarrolladores.
A veces esto produce asentimiento. A veces imágenes históricamente inexactas. En el caso de GPT-5.x, produjo duendes. La publicación de OpenAI es interesante precisamente porque un pequeño ajuste de sabor se convirtió en un rastro sistémico en el modelo. Cuanto más se orientan los productos de IA hacia la personalización, más importante es la pregunta: ¿qué hábitos estamos recompensando inadvertidamente hoy y dónde surgirán después del próximo ciclo de entrenamiento?
❗️❗️❗️❗️❗️❗️❗️❗️ / No prohibido en la Federación Rusa
Comentarios
0Aún no hay comentarios.
Inicia sesión para participar en la conversación.