GPT-6 Astra pilota drone e supera Claude Fable 5.1 em benchmarks

13 de setembro de 2026 · 2 fontes independentes

GPT-6 Astra foi o primeiro modelo a vencer todas as cinco subtarefas do Drone-Bench, incluindo escrever código para que um drone autonomamente encontre e siga uma pessoa específica.

Isso mostra um avanço em capacidades de agentes autônomos com sistemas físicos.

No benchmark de negócios Vending-Bench, Astra acumulou saldo médio final de US$ 15.515, quase três vezes o resultado de Claude Fable 5.1.

Demonstra a capacidade do modelo de gerenciar tarefas de longo prazo de forma eficaz e lucrativa.

GPT-6 Astra atingiu 57,9% no Terminal-Bench 4.0, superando GPT-5.6 Sol (37,3%) e Claude Fable 5.1 (55,8%), com custo menor por tarefa.

Indica eficiência em tarefas de terminal, um dos principais usos práticos para desenvolvedores.

Perplexity confia no GPT-6 Astra para escrever comunicações, editar software e monitorar sistemas de produção com muito menos verificação humana.

Mostra adoção do modelo em empresas reais para tarefas críticas, reduzindo necessidade de supervisão.

Johnny Ho, cofundador da Perplexity, disse que o Astra é o primeiro modelo que consegue executar um loop completo de escrever mensagens, mudar sistemas ao vivo e monitorar software de produção de…

Oferece uma declaração direta de um executivo sobre a confiabilidade do modelo em fluxos de trabalho complexos.

Confirmado por

  • StartupHub.ai
  • The Decoder
Ler no O agêntico