O AGENTICO
Configurações de API triplicam pontuação do GPT-5.6 Sol no ARC-AGI-3
2 fontesdesde 29 de julho de 20262 artigos
O artigo da OpenAI revela que ativar as configurações 'retained reasoning' e 'compaction' triplicou as pontuações do GPT-5.6 Sol no benchmark ARC-AGI-3 e reduziu os tokens de saída em 6 vezes. Já o artigo da Anthropic apresenta o método Contextual Retrieval, que reduz falhas de recuperação em RAG em até 67% quando combinado com reranking.


Resumo
A ativação das configurações 'retained reasoning' e 'compaction' triplicou as pontuações do GPT-5.6 Sol no benchmark ARC-AGI-3 e reduziu os tokens de saída em 6 vezes.
Esse ajuste mostra que o desempenho de modelos de IA pode ser drasticamente melhorado sem alterar o próprio modelo, apenas configurando parâmetros de API, o que tem grandes implicações para o uso prático de tais sistemas.
O modelo GPT-5.5 obteve apenas 0,4% de pontuação no benchmark ARC-AGI-3, quase sem conseguir jogar os jogos do dataset.
Esse dado contextualiza a dificuldade do benchmark e ressalta a melhoria alcançada pelo GPT-5.6 Sol após a otimização, evidenciando a importância de ajustes finos para tarefas específicas.
O método Contextual Retrieval reduz em 49% as falhas de recuperação em sistemas RAG e, quando combinado com reranking, a redução chega a 67%.
Essa melhoria na recuperação de informações é fundamental para sistemas que dependem de bases de conhecimento, como chatbots de suporte e análises jurídicas, aumentando a precisão das respostas.
O método Contextual Retrieval utiliza duas sub-técnicas: Contextual Embeddings e Contextual BM25.
Essas sub-técnicas permitem que o modelo considere o contexto completo das informações durante a recuperação, evitando perdas de contexto que são comuns em métodos tradicionais de RAG.
O modelo GPT-5.6 Sol obteve apenas 7,8% de pontuação no benchmark ARC-AGI-3 antes da ativação das configurações de API.
Esse número baixo contrasta com as capacidades do modelo em outros desafios, mostrando como configurações de API podem impactar resultados.
A ativação das configurações 'retained reasoning' e 'compaction' triplicou as pontuações do GPT-5.6 Sol no ARC-AGI-3 e reduziu os tokens de saída em 6 vezes no conjunto de tarefas públicas.
Isso demonstra que benchmarks podem ser influenciados por escolhas de configuração, além das capacidades intrínsecas do modelo.
O modelo GPT-5.5 obteve apenas 0,4% de pontuação no mesmo benchmark, quase sem conseguir jogar os jogos do dataset.
Esse resultado mostra a disparidade de desempenho entre versões do modelo em tarefas de raciocínio espacial.
O benchmark ARC-AGI-3 é composto por jogos de quebra-cabeça 2D, nos quais os agentes devem aprender a jogar sem instruções explícitas.
Compreender a natureza do benchmark ajuda a avaliar a validade dos resultados de modelos de IA.
O método Contextual Retrieval reduz as falhas de recuperação em sistemas RAG em 49% e, quando combinado com reranking, a redução chega a 67%.
Esse avanço melhora significativamente a precisão de sistemas que dependem de recuperação de conhecimento, como chatbots e assistentes.
Todo dia, só o que dois veículos independentes confirmaram — no seu feed.