
First Blood: IA finalmente quebrou o ProgramBench 🩸
Recentemente escrevi que os tão falados agentes de IA quebraram no benchmark ProgramBench, onde era necessário recriar um binário do zero, tendo apenas permissões de execução. Todos tiveram orgulhosos 0%.
Pois é, a porteira se abriu. O pessoal lançou uma atualização: a nova GPT-5.5 (xhigh) foi a primeira a resolver a tarefa inicial — reverteu completamente e escreveu um clone funcional do utilitário
cmatrix.Mas o mais interessante neste relatório não é o fato da solução em si, mas como diferentes modelos abordaram a tarefa. É literalmente um corte transversal de como diferentes categorias de desenvolvedores pensam.
🤡 Claude Opus 4.7
Ele decidiu escrever em C. Descobriu que no Docker não há arquivos de cabeçalho
ncurses.h. O que Claude faz? Ele não desiste. Ele analisa binários do sistema via ldconfig e nm -D, escreve manualmente curses_decls.h com mais de 100 linhas com typedefs e linka tudo isso ao runtime. Engenharia de sistema absolutamente genial.E então ele falha em 19 testes. Por quê?
Ele verificava a validade da cor inserida usando
strcmp em vez de strcasecmp. A entrada GREEN ou Red quebrava a lógica. O modelo gastou 178 chamadas de API ($10.74), montou uma combinação complexíssima via linker dinâmico, mas errou na comparação de strings sem normalizar para o mesmo caso.🧠 GPT 5.5
O agente verifica o Docker, tenta compilar um arquivo C de teste e vê que não há headers para
ncurses.Suas lógica? "Dane-se, vou escrever em Python".
Engraçado que os autores do benchmark tiveram que remover um teste para validar a vitória do Python.
No binário C original, ao inserir um número gigante, o programa caía em integer overflow. A variável transbordava, o delay se tornava minúsculo, e a matrix voava na velocidade máxima. Os autores do benchmark consideravam isso uma "feature".
📱 A versão em Python da GPT-5.5 parseou honestamente o número (graças à aritmética de precisão arbitrária do Python, que ignora limites) e foi honestamente para
time.sleep(1e22). A plataforma, como esperado, cuspiu OverflowError: timestamp out of range.O bug do
atoi() em C era apresentado como comportamento do sistema, mas o Python colocou tudo no lugar.Quanto tempo daremos para conquistar este benchmark?
Comentários
0Ainda não há comentários.