
A realidade contra-ataca: por que a IA elogiada marca 0% no novo benchmark 🔨
Acabei de ler o ensaio de Jack Clark sobre a singularidade iminente e o SWE-Bench destruído, com números bonitos: as IAs top marcam 93,9% no SWE-Bench, fechando issues reais do GitHub quase autonomamente. Parecia que era hora de deletar a IDE e ir estudar para barista.
Mas aí o pessoal de Stanford e Harvard lançou um novo benchmark — ProgramBench. E ele humilhou publicamente todos os modelos frontier existentes.
Spoiler: o resultado do GPT-5.4, Claude Opus 4.7 e Gemini 3.1 Pro é exatamente 0%.
Qual é a essência?
Um agente recebe um binário compilado (desde um simples jq até monstros como FFmpeg ou SQLite) e documentação.
A tarefa é escrever do zero uma base de código que reproduza 100% o comportamento do original.
O mais engraçado é como os autores tiveram que isolar o sandbox. Inicialmente, com acesso à rede aberto, as redes neurais, em vez de "escrever código", simplesmente parseavam --help, encontravam o repositório relevante no GitHub e faziam git clone. Quando a rede foi cortada, os agentes tentavam baixar os fontes via gerenciadores de pacotes ou simplesmente escreviam wrappers em bash em torno do binário original.
Para acabar com essa palhaçada, os contêineres foram completamente isolados e os binários receberam permissão 111 (apenas execução). Nada de leitura. Pura engenharia reversa black-box: você fornece entradas, observa saídas, escreve a implementação em qualquer linguagem Turing-completa.
E aí descobriu-se algo incrível. Uma coisa é alimentar a rede neural com um repositório pronto com arquitetura estabelecida, onde ela só precisa escrever um patch de 50 linhas. Outra completamente diferente é fazê-la projetar um sistema.
Assim que a IA perde as "muletas" na forma de abstrações prontas inventadas por engenheiros de carne e osso, ela desmorona. Descobre-se que os modelos não sabem fazer design de sistemas, decomposição e construção de interfaces. Eles fisicamente não conseguem manter na "cabeça" uma arquitetura do zero se não receberem limites rígidos. E isso apesar de os modelos queimarem até $5000 por execução, sem esbarrar nos limites de contexto.
Resumindo, os sacos de carne ainda vão lutar. 💪
Comentários
0Ainda não há comentários.
Entre para participar da conversa.