Sábado, 29 de agosto de 2026

O AGENTICO

o futuro da IA, todo dia, num clique

Voltar

ARC-AGI-3

conceito · 8 menções

O que as fontes disseram sobre ARC-AGI-3

O ARC-AGI-3 é um benchmark composto por jogos de quebra-cabeça 2D, nos quais os agentes devem aprender a jogar sem instruções explícitas. As fontes relataram que o GPT-5.5 obteve apenas 0,4% de pontuação, enquanto o GPT-5.6 Sol alcançou 7,8% antes da ativação das configurações 'retained reasoning' e 'compaction', que triplicaram suas pontuações e reduziram os tokens de saída em 6 vezes no conjunto de tarefas públicas. Além disso, pesquisas da Nvidia indicam que o harness é mais importante que o modelo para tarefas de longo horizonte, com o Claude Opus 5 atingindo 100% no benchmark com o uso do AVO, contra 30% sem ele.

Menções

  • Com o uso do AVO, o Claude Opus 5 atingiu 100% de acerto no benchmark ARC-AGI-3, contra apenas 30% sem ele.

    O resultado demonstra o impacto significativo do harness no desempenho do modelo em tarefas de raciocínio complexo.

    ver evento

  • A Nvidia publicou pesquisa mostrando que o harness (estrutura ao redor do modelo) é mais importante que o modelo para tarefas de longo horizonte, alcançando 100% no ARC-AGI-3 com Claude Opus 5, contra 30% sem o harness.

    O estudo da Nvidia destaca que a arquitetura do agente, incluindo memória e supervisão, pode ser mais decisiva que o modelo base, influenciando futuros desenvolvimentos de sistemas de IA.

    ver evento

  • O benchmark ARC-AGI-3 é composto por jogos de quebra-cabeça 2D, nos quais os agentes devem aprender a jogar sem instruções explícitas.

    Compreender a natureza do benchmark ajuda a avaliar a validade dos resultados de modelos de IA.

    ver evento

  • O modelo GPT-5.5 obteve apenas 0,4% de pontuação no mesmo benchmark, quase sem conseguir jogar os jogos do dataset.

    Esse resultado mostra a disparidade de desempenho entre versões do modelo em tarefas de raciocínio espacial.

    ver evento

  • A ativação das configurações 'retained reasoning' e 'compaction' triplicou as pontuações do GPT-5.6 Sol no ARC-AGI-3 e reduziu os tokens de saída em 6 vezes no conjunto de tarefas públicas.

    Isso demonstra que benchmarks podem ser influenciados por escolhas de configuração, além das capacidades intrínsecas do modelo.

    ver evento

  • O modelo GPT-5.6 Sol obteve apenas 7,8% de pontuação no benchmark ARC-AGI-3 antes da ativação das configurações de API.

    Esse número baixo contrasta com as capacidades do modelo em outros desafios, mostrando como configurações de API podem impactar resultados.

    ver evento

  • O modelo GPT-5.5 obteve apenas 0,4% de pontuação no benchmark ARC-AGI-3, quase sem conseguir jogar os jogos do dataset.

    Esse dado contextualiza a dificuldade do benchmark e ressalta a melhoria alcançada pelo GPT-5.6 Sol após a otimização, evidenciando a importância de ajustes finos para tarefas específicas.

    ver evento

  • A ativação das configurações 'retained reasoning' e 'compaction' triplicou as pontuações do GPT-5.6 Sol no benchmark ARC-AGI-3 e reduziu os tokens de saída em 6 vezes.

    Esse ajuste mostra que o desempenho de modelos de IA pode ser drasticamente melhorado sem alterar o próprio modelo, apenas configurando parâmetros de API, o que tem grandes implicações para o uso prático de tais sistemas.

    ver evento

Todo dia, só o que dois veículos independentes confirmaram — no seu feed.

Siga @oagentico →