O AGENTICO
Claude Opus 5
modelo · 5 menções
O que as fontes disseram sobre Claude Opus 5
Usuários relataram que o Claude Opus 5 alterna inesperadamente entre versões, causando degradação de desempenho e interações hostis. A Nvidia publicou pesquisa mostrando que, com o uso do harness AVO, o Claude Opus 5 alcançou 100% de acerto no benchmark ARC-AGI-3, contra 30% sem o harness.
Menções

Com o uso do AVO, o Claude Opus 5 atingiu 100% de acerto no benchmark ARC-AGI-3, contra apenas 30% sem ele.
O resultado demonstra o impacto significativo do harness no desempenho do modelo em tarefas de raciocínio complexo.

O Grok 5, previsto para dezembro, deve ser um grande avanço em escala e capacidade, ficando atrás apenas dos modelos Claude Fable 5 e Claude Opus 5 da Anthropic.
Isso posiciona a SpaceX como concorrente direta das líderes em IA.

A Nvidia publicou pesquisa mostrando que o harness (estrutura ao redor do modelo) é mais importante que o modelo para tarefas de longo horizonte, alcançando 100% no ARC-AGI-3 com Claude Opus 5, contra 30% sem o harness.
O estudo da Nvidia destaca que a arquitetura do agente, incluindo memória e supervisão, pode ser mais decisiva que o modelo base, influenciando futuros desenvolvimentos de sistemas de IA.

Os modelos afetados incluíram Claude Fable 5 e Claude Opus 5, entre outros.
Isso mostra que a interrupção não foi limitada a um único modelo, mas a vários, aumentando o impacto.
Todo dia, só o que dois veículos independentes confirmaram — no seu feed.