O AGENTICO
ARC-AGI-3
conceito · 8 menções
O que as fontes disseram sobre ARC-AGI-3
O ARC-AGI-3 é um benchmark composto por jogos de quebra-cabeça 2D, nos quais os agentes devem aprender a jogar sem instruções explícitas. As fontes relataram que o GPT-5.5 obteve apenas 0,4% de pontuação, enquanto o GPT-5.6 Sol alcançou 7,8% antes da ativação das configurações 'retained reasoning' e 'compaction', que triplicaram suas pontuações e reduziram os tokens de saída em 6 vezes no conjunto de tarefas públicas. Além disso, pesquisas da Nvidia indicam que o harness é mais importante que o modelo para tarefas de longo horizonte, com o Claude Opus 5 atingindo 100% no benchmark com o uso do AVO, contra 30% sem ele.
Menções

Com o uso do AVO, o Claude Opus 5 atingiu 100% de acerto no benchmark ARC-AGI-3, contra apenas 30% sem ele.
O resultado demonstra o impacto significativo do harness no desempenho do modelo em tarefas de raciocínio complexo.

A Nvidia publicou pesquisa mostrando que o harness (estrutura ao redor do modelo) é mais importante que o modelo para tarefas de longo horizonte, alcançando 100% no ARC-AGI-3 com Claude Opus 5, contra 30% sem o harness.
O estudo da Nvidia destaca que a arquitetura do agente, incluindo memória e supervisão, pode ser mais decisiva que o modelo base, influenciando futuros desenvolvimentos de sistemas de IA.

O benchmark ARC-AGI-3 é composto por jogos de quebra-cabeça 2D, nos quais os agentes devem aprender a jogar sem instruções explícitas.
Compreender a natureza do benchmark ajuda a avaliar a validade dos resultados de modelos de IA.

O modelo GPT-5.5 obteve apenas 0,4% de pontuação no mesmo benchmark, quase sem conseguir jogar os jogos do dataset.
Esse resultado mostra a disparidade de desempenho entre versões do modelo em tarefas de raciocínio espacial.

A ativação das configurações 'retained reasoning' e 'compaction' triplicou as pontuações do GPT-5.6 Sol no ARC-AGI-3 e reduziu os tokens de saída em 6 vezes no conjunto de tarefas públicas.
Isso demonstra que benchmarks podem ser influenciados por escolhas de configuração, além das capacidades intrínsecas do modelo.

O modelo GPT-5.6 Sol obteve apenas 7,8% de pontuação no benchmark ARC-AGI-3 antes da ativação das configurações de API.
Esse número baixo contrasta com as capacidades do modelo em outros desafios, mostrando como configurações de API podem impactar resultados.

O modelo GPT-5.5 obteve apenas 0,4% de pontuação no benchmark ARC-AGI-3, quase sem conseguir jogar os jogos do dataset.
Esse dado contextualiza a dificuldade do benchmark e ressalta a melhoria alcançada pelo GPT-5.6 Sol após a otimização, evidenciando a importância de ajustes finos para tarefas específicas.

A ativação das configurações 'retained reasoning' e 'compaction' triplicou as pontuações do GPT-5.6 Sol no benchmark ARC-AGI-3 e reduziu os tokens de saída em 6 vezes.
Esse ajuste mostra que o desempenho de modelos de IA pode ser drasticamente melhorado sem alterar o próprio modelo, apenas configurando parâmetros de API, o que tem grandes implicações para o uso prático de tais sistemas.
Todo dia, só o que dois veículos independentes confirmaram — no seu feed.