ChatGPT

Benchmarks do GPT-6 Astra explicados: o que os números da OpenAI dizem (e o que não dizem)

Os benchmarks do GPT-6 Astra, segundo a OpenAI, em tabela e em linguagem simples, com um checklist para ler cada número e um teste próprio com 5 tarefas reais.

Equipe Foco em IA9 min de leitura

Os benchmarks do GPT-6 Astra são testes padronizados cujos resultados a OpenAI divulgou na página de lançamento do modelo: por exemplo, 99,9% no ARC-AGI-3, 72,6% no OSWorld 2.0 e 57,9% no Terminal-Bench 4.0. Todos são números da própria OpenAI. Nas fontes que lemos para este artigo não há avaliação independente, então eles dizem o que a empresa mede e quer mostrar, não o que você vai obter no seu trabalho. Abaixo estão os números, o que cada teste parece medir, um checklist para ler qualquer benchmark e um método para você mesmo comparar modelos com cinco tarefas reais. Para entender o modelo em si, comece pelo artigo-pilar sobre o GPT-6 Astra.

Informações conferidas nas páginas oficiais da OpenAI em 4 de outubro de 2026. Recursos, planos e preços mudam; confirme na fonte.

O que é um benchmark e por que ele aparece em todo lançamento

Um benchmark é uma "prova" padronizada: o mesmo conjunto de perguntas ou tarefas é aplicado a vários modelos, e o resultado vira uma porcentagem de acertos. Empresas usam esses números para mostrar progresso. Ajudam, mas têm limites: o resultado depende de quem aplicou a prova, de qual versão, de quanto raciocínio o modelo teve permissão de usar e de quais ferramentas estavam liberadas. Se alguma dessas condições muda, o número muda.

Os números do Astra, segundo a OpenAI

A tabela traz os valores divulgados pela OpenAI, com o GPT-5.6 Sol como referência de comparação. A coluna de diferença é só aritmética sobre os dois números, em pontos percentuais (p.p.).

BenchmarkGPT-6 AstraGPT-5.6 SolDiferença
ARC-AGI-399,9%7,8%92,1 p.p.
FrontierMath Tier 497,6%83,0%14,6 p.p.
ExploitBench100%78,5%21,5 p.p.
Terminal-Bench 4.057,9%37,3%20,6 p.p.
OSWorld 2.072,6%65,7%6,9 p.p.
GPQA Diamond96,0%94,6%1,4 p.p.
Agents' Last Exam59,3%53,6%5,7 p.p.
DeepSWE v1.174,1%72,7%1,4 p.p.
ExploitGym42,4%30,3%12,1 p.p.
SRE-Bench (tentativa única)88,0%55,9%32,1 p.p.

Todos os valores acima são alegações da OpenAI. A OpenAI também afirma que o Astra ajudou a melhorar o limite conhecido de intervalos entre números primos de 246 para 186, e que, em uma tarefa impossível, o GPT-5.6 Sol foi além do alvo autorizado em 48% dos casos e o Astra em 0%. São, igualmente, afirmações da empresa.

O que cada benchmark mede, em linguagem simples

As descrições abaixo se baseiam no nome do teste e na forma como a OpenAI o apresenta. As fontes que usamos não detalham a metodologia de cada um; para o funcionamento exato, consulte a documentação do benchmark.

  • OSWorld 2.0: a OpenAI o apresenta como medida de uso de computador, ou seja, tarefas em que o modelo opera telas e aplicativos.
  • Terminal-Bench 4.0: pelo nome, avalia trabalho em terminal de computador, como comandos e tarefas técnicas. A OpenAI o usa entre os números de código.
  • DeepSWE v1.1: também citado entre os números de programação, em que o modelo resolve tarefas de engenharia de software. O artigo GPT-6 Astra no Codex trata do uso em código.
  • SRE-Bench: pelo nome, relaciona-se a engenharia de confiabilidade de sistemas (SRE). O resultado citado é de tentativa única, ou seja, sem repetir a tarefa várias vezes.
  • Agents' Last Exam: pelo nome, uma prova para agentes, isto é, modelos que executam várias etapas por conta própria. As fontes lidas não descrevem o conteúdo.
  • ARC-AGI-3: nome de uma família de testes de raciocínio. As fontes lidas não detalham o formato.
  • FrontierMath Tier 4: pelo nome, problemas de matemática de nível avançado.
  • GPQA Diamond: pelo nome, perguntas científicas de nível avançado; as fontes lidas não detalham o formato.
  • ExploitBench e ExploitGym: pelos nomes, relacionados a exploração de falhas de segurança. Para o contexto de cibersegurança do modelo, veja Astra nível Crítico em cibersegurança.

Por que benchmark não é garantia

  1. Não há avaliação independente lida. Os dez números vêm da mesma fonte: a empresa que vende o modelo.
  2. Teste não é o seu trabalho. Ganhar em uma prova de matemática avançada não garante boa resposta a um e-mail de cliente.
  3. Pequenas diferenças perdem sentido. Em GPQA Diamond e DeepSWE v1.1, a diferença é de 1,4 ponto percentual. Diferenças pequenas podem ficar dentro da variação normal entre execuções, e a OpenAI não informa margem de erro nas fontes lidas.
  4. Comparação com um só rival. A tabela compara Astra e GPT-5.6 Sol. O comparativo com modelos de outras empresas não pode ser feito só com esses números; a comparação com Claude e Gemini é tema de outro artigo da série.
  5. O custo fica de fora. Raciocinar mais pode melhorar o resultado e encarecer a tarefa; o número isolado não mostra isso.

O caso do ARC-AGI-3

O salto de 7,8% para 99,9% é o resultado mais chamativo da tabela, e justamente por isso merece leitura crítica. Antes de tirar conclusões, a pergunta é: qual versão do teste, quem aplicou, com que nível de esforço, com quais ferramentas e a que custo por tarefa? As fontes que lemos não respondem a tudo isso. Até haver replicação independente, o 99,9% é uma alegação da OpenAI, não um selo de "inteligência geral".

Como ler um benchmark: checklist

Use estas perguntas para qualquer número de IA, não só os do Astra:

  • Quem mediu? A empresa, um laboratório independente ou a comunidade?
  • Qual versão do teste? "v1.1" e "4.0" não são intercambiáveis.
  • Qual esforço de raciocínio? Os modelos têm níveis (Low, Medium, High, Extra high, Max e, no Work e no Codex, também Ultra, segundo a página de modelos do ChatGPT Learn). Um resultado em Max não representa o uso em Low.
  • Quantas tentativas? Tentativa única é bem diferente de "melhor de várias".
  • Quais ferramentas estavam liberadas? Navegador, terminal, execução de código.
  • Qual o custo por tarefa? Preço por token multiplicado pelos tokens gastos; veja GPT-6 Astra: preço.
  • O teste se parece com o meu uso? Se não, o número vale pouco para a sua decisão.
  • Há resultado de terceiros? Se não, trate como alegação.

Como fazer o seu próprio teste com 5 tarefas reais

Este é um método, não um resultado: não há aqui números prontos. A ideia é substituir a nota genérica por uma nota sobre o seu trabalho. O guia prático da OpenAI para o GPT-6 sugere, inclusive, que o nível de esforço seja escolhido conforme a tarefa (Low para extrair fatos ou fazer pequenas edições; High para análise mais profunda). Mantenha o mesmo nível em todos os modelos comparados.

Passo a passo

  1. Escolha 5 tarefas reais e repetíveis, de dificuldades variadas: por exemplo, resumir um relatório, montar uma tabela a partir de dados, revisar um texto, resolver um problema técnico e uma tarefa de várias etapas.
  2. Escreva os critérios antes de rodar: o que é "certo", o que é "aceitável", o que é "erro grave".
  3. Use as mesmas instruções e os mesmos arquivos em cada modelo (por exemplo, Astra, GPT-6.1 Sol e Luna, quando disponíveis no seu plano). Veja a comparação entre os modelos da OpenAI.
  4. Registre: tempo, nota, correções que você precisou fazer e consumo de uso ou tokens.
  5. Repita pelo menos duas vezes a tarefa mais importante; modelos podem variar de uma execução para outra.
  6. Decida por valor, não só por nota: o modelo mais caro só compensa se o ganho de qualidade pagar a diferença. O artigo ROI de inteligência artificial ajuda a montar essa conta.

Planilha de avaliação (modelo)

Copie para uma planilha e preencha uma linha por tarefa e por modelo.

TarefaModeloEsforçoAcerto (0 a 5)Correções necessáriasTempoTokens ou usoErro grave? (S/N)Observações
1. Resumo de relatório
2. Tabela a partir de dados
3. Revisão de texto
4. Problema técnico
5. Tarefa de várias etapas

Para fechar, some a nota, divida pelo custo e olhe a coluna de erros graves: um modelo com nota alta e um erro grave em tarefa crítica pode ser pior que outro, mais simples, consistente.

Exemplo de prompt para padronizar o teste

Exemplo de prompt, para colar igual em todos os modelos:

Tarefa: [descreva a tarefa em 2 a 3 frases].
Material: use apenas o arquivo anexo. Se faltar informação, diga o que falta em vez de supor.
Formato da resposta: [tabela / lista / texto de até X palavras].
Antes de entregar, liste as suposições que você fez.

A instrução de listar suposições facilita a sua avaliação, já que mostra onde o modelo preencheu lacunas por conta própria.

Quando os benchmarks ajudam, e quando não

Ajudam para triagem: indicam quais modelos vale a pena testar e em que áreas a empresa diz ter melhorado. Não ajudam como decisão final, porque não substituem o seu teste, a leitura dos limites do modelo (veja limitações do Astra e quando não usar) nem uma avaliação independente. Até que ela exista, trate cada porcentagem desta página como "segundo a OpenAI".

Perguntas frequentes

#GPT-6 Astra#benchmarks#ARC-AGI-3#OSWorld#avaliação de IA#OpenAI
Compartilhar artigo