O modelo o3 da OpenAI fica aquém de suas próprias alegações de benchmark

- A OpenAI afirmou que seu modelo o3 poderia resolver mais de 25% dos problemas do FrontierMath, mas novos testes da Epoch AI revelam que a versão pública consegue resolver cerca de 10%.
- Prêmio ARC e um engenheiro da OpenAI confirmam que o modelo lançado é uma versão mais leve e rápida, otimizada para uso em chat.
- Empresas rivais, incluindo xAI e Meta, também enfrentam escrutínio por resultados inflados em benchmarks.
O mais recente LLM da OpenAI, o3, está enfrentando escrutínio após testes independentes mostrarem que ele resolveu um número muito menor de problemas matemáticos difíceis do que a empresa inicialmente afirmou.
Quando a OpenAI apresentou o3 em dezembro, executivos disseram que o modelo poderia responder “pouco mais de um quarto” dos problemas no FrontierMath, um conjunto notoriamente difícil de quebra-cabeças matemáticos de nível de pós-graduação.
O melhor concorrente, acrescentaram, estava estagnado perto de 2%. “Hoje, todas as ofertas disponíveis têm menos de 2%”, disse o diretor de pesquisa Mark Chen durante o ao vivo do o3 e o3 mini. “Estamos vendo, com o o3 em configurações agressivas de computação em tempo de teste, somos capazes de obter mais de 25%.”
TechCrunch reportou que o resultado foi obtido pela OpenAI em uma versão do o3 que usava mais poder de computação do que o modelo que a empresa lançou na semana passada.
Na sexta-feira, o instituto de pesquisa Epoch AI, que criou o FrontierMath, publicou sua própria pontuação para o o3 público.
A OpenAI lançou o3, seu tão aguardado modelo de raciocínio, junto com o o4-mini, um modelo menor e mais barato que sucede o3-mini.
Avaliamos os novos modelos em nosso conjunto de benchmarks de matemática e ciências. Resultados no thread! pic.twitter.com/5gbtzkEy1B
— Epoch AI (@EpochAIResearch) Abril 18, 2025
Usando uma edição atualizada de 290 questões do benchmark, a Epoch colocou o modelo em cerca de 10%.
O resultado corresponde a uma figura de limite inferior no artigo técnico de dezembro da OpenAI, e a Epoch alertou que a discrepância pode ser devido a várias razões.
“A diferença entre nossos resultados e os da OpenAI pode ser devido à OpenAI avaliar com um scaffold interno mais poderoso, usando mais computação em tempo de teste, ou porque esses resultados foram executados em um subconjunto diferente do FrontierMath”, escreveu a Epoch .
O FrontierMath é projetado para medir o progresso em direção ao raciocínio matemático avançado. O conjunto público de dezembro de 2024 continha 180 problemas, enquanto a atualização privada de fevereiro de 2025 expandiu o pool para 290.
Mudanças na lista de perguntas e na quantidade de poder de computação permitido em tempo de teste podem causar grandes oscilações nas porcentagens relatadas.
A OpenAI confirmou que o modelo o3 público usa menos computação do que a versão de demonstração
Evidências de que o o3 comercial está faltando também vieram de testes pela ARC Prize Foundation, que tentou uma versão anterior e maior. O lançamento público “é um modelo diferente… ajustado para uso em chat/produto”, postou a ARC Price Foundation no X, acrescentando que “todas as camadas de computação do o3 lançadas são menores do que a versão que analisamos.”
O funcionário da OpenAI Wenda Zhou ofereceu uma explicação semelhante durante um ao vivo na semana passada. O sistema de produção, disse ele, era “mais otimizado para casos de uso do mundo real” e velocidade. “Fizemos [otimizações] para tornar o modelo mais eficiente em termos de custos [e] mais útil em geral”, disse Zhou, reconhecendo possíveis “disparidades” no benchmark.
Dois modelos menores da empresa, o3-mini-high e o recém-anunciado o4-mini, já superaram o3 no FrontierMath, e a OpenAI diz que uma variante o3-pro melhor chegará nas próximas semanas.
Ainda assim, isso mostra como os títulos de benchmark podem ser enganosos. Em janeiro, a Epoch foi criticada por atrasar a divulgação do financiamento da OpenAI até depois da estreia do o3. Mais recentemente, a startup xAI de Elon Musk foi acusada de apresentar gráficos que superestimavam as capacidades de seu modelo Grok 3.
Observadores do setor dizem que essas controvérsias de benchmark estão se tornando uma ocorrência na indústria de IA, à medida que as empresas correm para capturar manchetes com novos modelos.
Se você está lendo isso, já está à frente. Mantenha-se assim com nosso boletim informativo.
Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar quaisquer decisões de investimento.

Noor Bazmi
Noor Bazmi contribui para a equipe de notícias da Cryptopolitan, equipada com graduação em Estudos de Mídia. Noor cobre notícias sobre blockchain, criptomoedas, inteligência artificial, Big Tech, mercados de veículos elétricos, economia global e mudanças nas políticas governamentais. Ela está cursando marketing para se conectar com audiências globais.
















