
Como agentes de IA geram dívida técnica em escala industrial 😬
Todos estão obcecados com benchmarks como SWE-bench e HumanEval, provando que as redes neurais estão prestes a substituir desenvolvedores. O problema é que essas métricas avaliam exclusivamente programação snapshot. Deram uma tarefa -> IA cuspiu um PR -> testes verdes -> triunfo, vamos embora.
Mas na produção real, escrever um código que passe no pipeline uma vez não é nem metade do trabalho. A verdadeira engenharia é quando seu código pode ser modificado sem dor um ano depois. E é aí que a IA começa a falhar feio.
O pessoal da Alibaba e da Sun Yat-sen University lançou um paper descrevendo como fizeram agentes não apenas resolverem issues isoladas, mas manterem bases de código reais a longo prazo (no benchmark, média de 233 dias de histórico e 71 commits por projeto).
Eles criaram o SWE-CI — o primeiro benchmark que avalia não a capacidade da IA de cuspir um pedaço de código para fechar uma issue, mas sim sua capacidade de manter o projeto.
Em vez do burro "passa/falha", introduziram a métrica EvoScore. Ela penaliza a dívida técnica. Se seu fix na 3ª iteração fez com que na 10ª iteração adicionar uma nova funcionalidade se tornasse impossível — sua pontuação vai para o abismo.
Para isso, eles montaram um loop de CI com dois agentes:
1️⃣
Arquiteto: olha para os testes que falharam (test gaps) e escreve uma especificação de alto nível.2️⃣
Programador: tenta escrever código para que a especificação seja cumprida.E assim por diante.
Quais os resultados?
🟠Taxa de zero-regressão no fundo. Principal indicador de estabilidade. Se um teste passava antes e, após seu commit, falhou — é uma regressão. Pois bem, a maioria dos LLMs badalados tem uma taxa de ausência de regressões abaixo de 25%. Em outras palavras, ao tentar consertar uma coisa, em 3 de 4 casos eles quebram o que já funcionava. Apenas o Claude Opus conseguiu ultrapassar a marca dos 50%.
🟠Planejamento estratégico ausente. Modelos Kimi e GLM (sim, os chineses estão promovendo ativamente seus LLMs) são focados em resultados rápidos — produzem código excelente no momento, mas rapidamente afundam no próprio legado a longo prazo. Modelos DeepSeek e GPT tentam jogar a longo prazo, mas ainda tropeçam.
Em resumo, as redes neurais ainda não sabem ter "esforço consciente". Elas operam com probabilidades, não com visão arquitetural. Dê a um agente a tarefa de manter um projeto de produção por seis meses, e ele o transformará em um monstro espaguete que dá medo de tocar.
Comentários
0Ainda não há comentários.
Entre para participar da conversa.