O AGENTICO
Voltar
Terminal Bench 2.1
conceito · 1 menção
Menções

Nos benchmarks de agentes, o V4 Pro apresentou grandes melhorias: o Terminal Bench 2.1 subiu de 72.1 para 87.9 e o DeepSWE de 12.8 para 62.7, superando o Claude Opus 4.8 em alguns testes.
Os resultados mostram avanço significativo no desempenho para tarefas agênticas, aproximando-se dos líderes do mercado.
Todo dia, só o que dois veículos independentes confirmaram — no seu feed.