Como agentes de IA geram dívida técnica em escala industrial 😬

Todos estão obcecados com benchmarks como SWE-bench e HumanEval, provando que as redes neurais estão prestes a substituir desenvolvedores. O problema é que essas métricas avaliam exclusivamente programação snapshot. Deram uma tarefa -> IA cuspiu um PR -> testes verdes -> triunfo, vamos embora.
Mas na produção real, escrever um código que passe no pipeline uma vez não é nem metade do trabalho. A verdadeira engenharia é quando seu código pode ser modificado sem dor um ano depois. E é aí que a IA começa a falhar feio.

O pessoal da Alibaba e da Sun Yat-sen University lançou um paper descrevendo como fizeram agentes não apenas resolverem issues isoladas, mas manterem bases de código reais a longo prazo (no benchmark, média de 233 dias de histórico e 71 commits por projeto).

Eles criaram o SWE-CI — o primeiro benchmark que avalia não a capacidade da IA de cuspir um pedaço de código para fechar uma issue, mas sim sua capacidade de manter o projeto.
Em vez do burro "passa/falha", introduziram a métrica EvoScore. Ela penaliza a dívida técnica. Se seu fix na 3ª iteração fez com que na 10ª iteração adicionar uma nova funcionalidade se tornasse impossível — sua pontuação vai para o abismo.

Para isso, eles montaram um loop de CI com dois agentes:
1️⃣ Arquiteto: olha para os testes que falharam (test gaps) e escreve uma especificação de alto nível.
2️⃣ Programador: tenta escrever código para que a especificação seja cumprida.
E assim por diante.

Quais os resultados?
🟠Taxa de zero-regressão no fundo. Principal indicador de estabilidade. Se um teste passava antes e, após seu commit, falhou — é uma regressão. Pois bem, a maioria dos LLMs badalados tem uma taxa de ausência de regressões abaixo de 25%. Em outras palavras, ao tentar consertar uma coisa, em 3 de 4 casos eles quebram o que já funcionava. Apenas o Claude Opus conseguiu ultrapassar a marca dos 50%.
🟠Planejamento estratégico ausente. Modelos Kimi e GLM (sim, os chineses estão promovendo ativamente seus LLMs) são focados em resultados rápidos — produzem código excelente no momento, mas rapidamente afundam no próprio legado a longo prazo. Modelos DeepSeek e GPT tentam jogar a longo prazo, mas ainda tropeçam.

Em resumo, as redes neurais ainda não sabem ter "esforço consciente". Elas operam com probabilidades, não com visão arquitetural. Dê a um agente a tarefa de manter um projeto de produção por seis meses, e ele o transformará em um monstro espaguete que dá medo de tocar.