17 de setembro de 2026 · 2 fontes independentes
Essa atualização eleva o padrão de avaliação, focando em tarefas que exigem dias de trabalho de engenheiros humanos, indo além de correções simples de código.
Na nova versão, os modelos foram avaliados com uma abordagem de pontuação contínua, e o GPT-6 Astra se destacou na resolução das tarefas propostas.
Apesar de ser o criador do benchmark, o modelo de IA da própria empresa teve o pior desempenho na nova rodada de testes.
Essa nova versão inclui tarefas como construir aplicativos do zero e converter aplicativos cross-platform, medindo habilidades que vão além de simples…
Confirmado por