Qwen3 da Alibaba desbancia R1 da DeepSeek, agora lidera modelos de IA de código aberto

- A família de modelos de IA Qwen3 da Alibaba superou o R1 da DeepSeek para se tornar o melhor modelo de código aberto do mundo em áreas como instrução de linguagem, matemática, programação e análise de dados.
- O Qwen3 é barato de usar, pois custa apenas US$ 0,55 por 1 milhão de tokens para ser executado.
- Fabricantes de chips americanos, Nvidia e Intel, começaram a apoiar o Qwen3.
A nova família de modelos de IA Qwen3 da Alibaba superou o R1 da DeepSeek para se tornar o melhor modelo de código aberto do mundo. De acordo com relatórios, o Qwen3 teve melhor desempenho do que o R1 em testes que medem as capacidades de modelos de IA de código aberto em áreas como instrução de linguagem, matemática, codificação e análise de dados.
A família Qwen3 foi lançada na semana passada pela unidade de computação em nuvem da Alibaba. Ela tem oito modelos melhorados com entre 600 milhões e 235 bilhões de parâmetros. No aprendizado de máquina, parâmetros são as variáveis em um sistema de IA enquanto ele está sendo treinado.
De acordo com Plataforma LiveBench, uma plataforma independente que testa grandes modelos de linguagem, antes desses novos testes, o R1 da DeepSeek havia sido o melhor modelo de IA de código aberto do mundo desde seu lançamento em janeiro. Mas não mais.
Empresas dos EUA e da China correm para adotar Qwen 3
A ascensão do Qwen3 nas classificações do LiveBench mostra o quão rapidamente a IA está se desenvolvendo na China. A indústria tecnológica chinesa cresceu muito graças a ferramentas de código aberto. O código de método de código aberto da Alibaba permitiu que outros desenvolvedores de software de terceiros compartilhassem o design, corrigissem links quebrados ou tornassem o programa mais poderoso.
No entanto, os resultados gerais do LiveBench mostraram que o Qwen3 não era tão bom quanto o o3 da OpenAI, o Gemini Pro 2.5 do Google e o Claude 3.7 da Anthropic, que são os melhores modelos de IA de código fechado do mundo. O LiveBench diz que o o3-mini, o modelo de IA mais popular da OpenAI, foi o melhor do mundo em geral. A Microsoft apoia a OpenAI.
Para cada 1 milhão de tokens, custa $10 para executar o o3. Por outro lado, o Qwen3 é mais barato de usar, pois custa apenas $0,55 por 1 milhão de tokens para ser executado. Como o Qwen3 é mais barato e funciona melhor, muitas empresas disseram que apoiariam o mais recente modelo de IA da Alibaba assim que fosse lançado.
A Huawei Technologies, a Moore Threads, a Cambricon Technologies e a Hygon Information Technology são todas empresas de chips que disseram que apoiarão o Qwen3.
Na terça-feira passada, a Cambricon disse que otimizou com sucesso o Qwen3 para ser executado rapidamente em suas unidades de processamento gráfico. Isso foi feito porque os desenvolvedores de IA nas Filipinas queriam chips fabricados na China.
O Qwen3 também está sendo usado nos serviços de computação em nuvem da Hyperbolic e da Fireworks.ai, duas empresas de infraestrutura de IA. As fabricantes de chips americanas Nvidia e Intel começaram a apoiar o Qwen3.
Muitos grandes data centers na China, como os de Pequim, Xangai, Hangzhou e nas províncias de Hubei, Jilin e noroeste de Shaanxi, também disseram que usarão os modelos de IA Qwen de terceira geração da Alibaba. A Rede de Supercomputação da China também adotou o Qwen3. Esta rede conecta mais de 20 data centers em 20 cidades em 14 províncias.
CEO da Anthropic diz que a DeepSeek foi "um pouco exagerada"
Em um evento empresarial, um dos cofundadores da Anthropic, a empresa que criou os modelos de IA Claude, disse que a DeepSeek ainda está "seis a oito meses atrás do que as empresas de fronteira dos EUA estão." Ele também disse que a recente agitação em torno da startup chinesa foi "talvez um pouco exagerada."
DeepSeek chamou a atenção em todo o mundo no final de dezembro de 2024 e no início de janeiro de 2025 ao compartilhar dois modelos de IA de código aberto avançados, V3 e R1. Esses modelos foram criados por uma pequena fração do custo e da capacidade de computação que as grandes empresas de tecnologia normalmente precisam para projetos de LLM.
Não está claro quando a DeepSeek lançará a próxima geração de seus modelos. A empresa sediada em Hangzhou lançou discretamente seu Prover-V2 de 671 bilhões de parâmetros no final abril. Esta foi uma atualização de seu modelo especializado para lidar com provas matemáticas. No entanto, ela não disse nada sobre o progresso de seu tão aguardado modelo de raciocínio R2.
As mentes mais inteligentes do setor de criptomoedas já leem nosso boletim informativo. Quer entrar? Junte-se a eles.
Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar quaisquer decisões de investimento.

Florence Muchai
Florence cobre notícias sobre criptoativos, jogos, tecnologia e IA há 6 anos. Sua graduação em Estudos de Computação na Meru University of Science and Technology e em Gestão de Desastres e Diplomacia Internacional no MMUST equipam-na plenamente com habilidades linguísticas, de observação e técnicas. Florence trabalhou no VAP Group e como editora em várias casas de mídia de criptoativos.
















