O AGENTICO
DeepSWE
conceito · 4 menções
O que as fontes disseram sobre DeepSWE
O DeepSWE é um benchmark de tarefas para agentes. No V4 Pro, a pontuação subiu de 12.8 para 62.7, superando o Claude Opus 4.8 em alguns testes. Já o Ox Alpha atingiu 80% em uma amostra de 10 tarefas, mas na rodada completa de 113 tarefas o desempenho caiu para aproximadamente o nível do GPT-5.6-sol mid.
Menções

Em execuções completas com 113 tarefas do DeepSWE, o Ox Alpha ficou aproximadamente no mesmo nível do GPT-5.6 Sol mid, e não muito à frente.
Corrige a impressão inicial: em teste completo, o modelo não supera claramente os concorrentes.

Em um teste inicial com 10 tarefas do benchmark DeepSWE, o Ox Alpha atingiu 80% de resolução, superando Claude Fable 5 (65%) e GPT-5.6 Sol (52%).
Registra o desempenho viral inicial do modelo em subconjunto do DeepSWE.

O desempenho do Ox Alpha no benchmark DeepSWE, que viralizou com 80% em uma amostra de 10 tarefas, não se manteve na rodada completa de 113 tarefas, onde o modelo ficou aproximadamente no nível do GPT-5.6-sol mid.
A diferença entre a amostra pequena e a rodada completa mostra a importância de validação robusta antes de considerar um modelo superior aos concorrentes, evitando conclusões precipitadas.

Nos benchmarks de agentes, o V4 Pro apresentou grandes melhorias: o Terminal Bench 2.1 subiu de 72.1 para 87.9 e o DeepSWE de 12.8 para 62.7, superando o Claude Opus 4.8 em alguns testes.
Os resultados mostram avanço significativo no desempenho para tarefas agênticas, aproximando-se dos líderes do mercado.
Todo dia, só o que dois veículos independentes confirmaram — no seu feed.