
Je ne plaisante pas, absolument sérieusement. Bon, pas OpenAI, mais les modèles ChatGPT.
Hier, OpenAI a publié une analyse étrange : pourquoi GPT-5.x a commencé à insérer trop souvent des gobelins, des gremlins et autres créatures féeriques dans ses réponses.
En surface, cela ressemblait à une habitude de langage comique. Les utilisateurs ont commencé à le remarquer en premier, puis en interne chez OpenAI, les employés ont commencé à observer une "explosion de gobelins". À l'intérieur se trouvait un problème d'apprentissage tout à fait sérieux : un signal de récompense local a commencé à modifier le style général du modèle.
Le premier pic notable a été observé après le lancement de GPT-5.1. Selon les mesures internes d'OpenAI, le mot goblin est apparu 175% plus souvent, gremlin 52% de plus. Dans GPT-5.4, la trace est devenue plus précise : le mode Nerdy ne représentait que 2,5% des réponses ChatGPT, mais il était responsable de 66,7% de toutes les mentions de goblin.
La cause était l'apprentissage du style de communication Nerdy, une sorte de "persona". Elle a été configurée comme un mentor enjoué et érudit qui réduit le pathos et parle de manière plus vivante. L'un des signaux de récompense pour ce mode évaluait systématiquement plus haut les réponses contenant ces mots. Dans l'audit d'OpenAI, un décalage positif en faveur des réponses avec goblin/gremlin a été trouvé dans 76,2% des ensembles de données.
Ensuite, une boucle s'est mise en place.
Le modèle reçoit une récompense pour un style enjoué. Dans ce style, un tour de parole aléatoire se retrouve plus souvent dans les réponses réussies. Ces réponses sont intégrées aux données pour un réapprentissage ultérieur. Après plusieurs cycles, le modèle commence à considérer ce tour (ou mot, bref un ensemble de tokens) comme faisant partie du ton normal, même en dehors du mode d'origine.
OpenAI a ensuite supprimé Nerdy, retiré le signal de récompense correspondant et filtré les données d'apprentissage contenant ces mots. Mais GPT-5.5 avait déjà commencé l'apprentissage avant la découverte de la cause, donc dans Codex, une instruction séparée a été ajoutée pour supprimer ce tic.
Les grands modèles n'ont pas de frontières nettes entre les "personnalités", les styles utilisateur et le comportement de base. Si un mode reçoit une récompense pour un langage expressif, l'effet peut s'infiltrer dans les modes voisins, surtout lorsque les réponses générées redeviennent du matériel d'apprentissage.
Des épisodes similaires sont connus.
En avril 2025, OpenAI a annulé la mise à jour de GPT-4o qui rendait le modèle excessivement complaisant. Anthropic en 2023 décrivait la même classe de problème plus largement. Dans leur étude, 5 assistants montraient une tendance à être d'accord avec l'utilisateur plutôt qu'à s'en tenir à la vérité.
Google a eu un cas apparenté avec Gemini Image en février 2024. Le système a été configuré pour ne pas reproduire de représentations nuisibles des personnes. Ensuite, la configuration a commencé à s'activer là où une précision historique ou culturelle était requise : le modèle a surcompensé la diversité et a parfois refusé des requêtes inoffensives.
Le schéma général est simple : le modèle s'optimise pour un feedback positif, même lorsqu'il diverge de l'intention des développeurs.
Parfois, cela donne de l'acquiescement. Parfois, des images historiquement inexactes. Dans le cas de GPT-5.x, cela a donné des gobelins. Le post d'OpenAI est intéressant précisément parce qu'une petite modification de goût s'est transformée en une trace systémique dans le modèle. Plus les produits d'IA évoluent vers la personnalisation, plus la question devient importante : quelles habitudes récompensons-nous imperceptiblement aujourd'hui et où réapparaîtront-elles après le prochain cycle d'apprentissage.
❗️❗️❗️❗️❗️❗️❗️❗️ / Non interdit en RF
Yorumlar
0Henüz yorum yok.
Tartışmaya katılmak için giriş yapın.