Sábado, 29 de agosto de 2026

O AGENTICO

o futuro da IA, todo dia, num clique

Voltar

Configurações de API triplicam pontuação do GPT-5.6 Sol no ARC-AGI-3

2 fontesdesde 29 de julho de 20262 artigos

O artigo da OpenAI revela que ativar as configurações 'retained reasoning' e 'compaction' triplicou as pontuações do GPT-5.6 Sol no benchmark ARC-AGI-3 e reduziu os tokens de saída em 6 vezes. Já o artigo da Anthropic apresenta o método Contextual Retrieval, que reduz falhas de recuperação em RAG em até 67% quando combinado com reranking.

Resumo

  • A ativação das configurações 'retained reasoning' e 'compaction' triplicou as pontuações do GPT-5.6 Sol no benchmark ARC-AGI-3 e reduziu os tokens de saída em 6 vezes.

    Esse ajuste mostra que o desempenho de modelos de IA pode ser drasticamente melhorado sem alterar o próprio modelo, apenas configurando parâmetros de API, o que tem grandes implicações para o uso prático de tais sistemas.

  • O modelo GPT-5.5 obteve apenas 0,4% de pontuação no benchmark ARC-AGI-3, quase sem conseguir jogar os jogos do dataset.

    Esse dado contextualiza a dificuldade do benchmark e ressalta a melhoria alcançada pelo GPT-5.6 Sol após a otimização, evidenciando a importância de ajustes finos para tarefas específicas.

  • O método Contextual Retrieval reduz em 49% as falhas de recuperação em sistemas RAG e, quando combinado com reranking, a redução chega a 67%.

    Essa melhoria na recuperação de informações é fundamental para sistemas que dependem de bases de conhecimento, como chatbots de suporte e análises jurídicas, aumentando a precisão das respostas.

  • O método Contextual Retrieval utiliza duas sub-técnicas: Contextual Embeddings e Contextual BM25.

    Essas sub-técnicas permitem que o modelo considere o contexto completo das informações durante a recuperação, evitando perdas de contexto que são comuns em métodos tradicionais de RAG.

  • O modelo GPT-5.6 Sol obteve apenas 7,8% de pontuação no benchmark ARC-AGI-3 antes da ativação das configurações de API.

    Esse número baixo contrasta com as capacidades do modelo em outros desafios, mostrando como configurações de API podem impactar resultados.

  • A ativação das configurações 'retained reasoning' e 'compaction' triplicou as pontuações do GPT-5.6 Sol no ARC-AGI-3 e reduziu os tokens de saída em 6 vezes no conjunto de tarefas públicas.

    Isso demonstra que benchmarks podem ser influenciados por escolhas de configuração, além das capacidades intrínsecas do modelo.

  • O modelo GPT-5.5 obteve apenas 0,4% de pontuação no mesmo benchmark, quase sem conseguir jogar os jogos do dataset.

    Esse resultado mostra a disparidade de desempenho entre versões do modelo em tarefas de raciocínio espacial.

  • O benchmark ARC-AGI-3 é composto por jogos de quebra-cabeça 2D, nos quais os agentes devem aprender a jogar sem instruções explícitas.

    Compreender a natureza do benchmark ajuda a avaliar a validade dos resultados de modelos de IA.

  • O método Contextual Retrieval reduz as falhas de recuperação em sistemas RAG em 49% e, quando combinado com reranking, a redução chega a 67%.

    Esse avanço melhora significativamente a precisão de sistemas que dependem de recuperação de conhecimento, como chatbots e assistentes.

Todo dia, só o que dois veículos independentes confirmaram — no seu feed.

Siga @oagentico →