Sábado, 29 de agosto de 2026

O AGENTICO

o futuro da IA, todo dia, num clique

Voltar

DeepSWE

conceito · 4 menções

O que as fontes disseram sobre DeepSWE

O DeepSWE é um benchmark de tarefas para agentes. No V4 Pro, a pontuação subiu de 12.8 para 62.7, superando o Claude Opus 4.8 em alguns testes. Já o Ox Alpha atingiu 80% em uma amostra de 10 tarefas, mas na rodada completa de 113 tarefas o desempenho caiu para aproximadamente o nível do GPT-5.6-sol mid.

Menções

  • Em execuções completas com 113 tarefas do DeepSWE, o Ox Alpha ficou aproximadamente no mesmo nível do GPT-5.6 Sol mid, e não muito à frente.

    Corrige a impressão inicial: em teste completo, o modelo não supera claramente os concorrentes.

    ver evento

  • Em um teste inicial com 10 tarefas do benchmark DeepSWE, o Ox Alpha atingiu 80% de resolução, superando Claude Fable 5 (65%) e GPT-5.6 Sol (52%).

    Registra o desempenho viral inicial do modelo em subconjunto do DeepSWE.

    ver evento

  • O desempenho do Ox Alpha no benchmark DeepSWE, que viralizou com 80% em uma amostra de 10 tarefas, não se manteve na rodada completa de 113 tarefas, onde o modelo ficou aproximadamente no nível do GPT-5.6-sol mid.

    A diferença entre a amostra pequena e a rodada completa mostra a importância de validação robusta antes de considerar um modelo superior aos concorrentes, evitando conclusões precipitadas.

    ver evento

  • Nos benchmarks de agentes, o V4 Pro apresentou grandes melhorias: o Terminal Bench 2.1 subiu de 72.1 para 87.9 e o DeepSWE de 12.8 para 62.7, superando o Claude Opus 4.8 em alguns testes.

    Os resultados mostram avanço significativo no desempenho para tarefas agênticas, aproximando-se dos líderes do mercado.

    ver evento

Todo dia, só o que dois veículos independentes confirmaram — no seu feed.

Siga @oagentico →