Quinta-feira, 24 de setembro de 2026

O AGENTICO

o futuro da IA, todo dia, num clique

Voltarver como story →

GPT-6 Astra pilota drone e supera Claude Fable 5.1 em benchmarks

2 fontesdesde 13 de setembro de 20263 artigos

OpenAI lançou o GPT-6 Astra, seu modelo mais capaz, com novos benchmarks de agentes mostrando vitória sobre concorrentes. Em testes da Andon Labs, o Astra foi o primeiro modelo a superar a linha de base humano-AI em todos os subtarefas do Drone-Bench. Perplexity e outras empresas já adotaram o modelo, relatando ganhos de eficiência com menos supervisão humana.

Resumo

  • GPT-6 Astra foi o primeiro modelo a vencer todas as cinco subtarefas do Drone-Bench, incluindo escrever código para que um drone autonomamente encontre e siga uma pessoa específica.

    Isso mostra um avanço em capacidades de agentes autônomos com sistemas físicos.

  • No benchmark de negócios Vending-Bench, Astra acumulou saldo médio final de US$ 15.515, quase três vezes o resultado de Claude Fable 5.1.

    Demonstra a capacidade do modelo de gerenciar tarefas de longo prazo de forma eficaz e lucrativa.

  • GPT-6 Astra atingiu 57,9% no Terminal-Bench 4.0, superando GPT-5.6 Sol (37,3%) e Claude Fable 5.1 (55,8%), com custo menor por tarefa.

    Indica eficiência em tarefas de terminal, um dos principais usos práticos para desenvolvedores.

  • Perplexity confia no GPT-6 Astra para escrever comunicações, editar software e monitorar sistemas de produção com muito menos verificação humana.

    Mostra adoção do modelo em empresas reais para tarefas críticas, reduzindo necessidade de supervisão.

  • Johnny Ho, cofundador da Perplexity, disse que o Astra é o primeiro modelo que consegue executar um loop completo de escrever mensagens, mudar sistemas ao vivo e monitorar software de produção de forma confiável.

    Oferece uma declaração direta de um executivo sobre a confiabilidade do modelo em fluxos de trabalho complexos.

Citações

  • Johnny Ho, cofounder and chief strategy officer at the answer engine company, described the shift in a September 14 case study published by OpenAI News.

    Johnny Ho, cofundador e diretor de estratégia da Perplexity

Todo dia, só o que dois veículos independentes confirmaram — no seu feed.

Siga @oagentico →