A DeepSeek da China lança modelo de IA de próxima geração para rivalizar com o GPT-5. Mas será que é bom o suficiente?

Foto de Solen Feyissa em Unsplash.
- O DeepSeek lançou seu novo modelo V3.2-Exp na segunda-feira, com foco em velocidade, redução de custos e capacidade de processar grandes volumes de dados.
- O modelo introduz a Atenção Esparsa do DeepSeek, que ignora dados irrelevantes para melhorar a eficiência e reduzir os custos pela metade.
- Especialistas alertam que a atenção esparsa pode remover informações importantes e reduzir a confiabilidade, apesar de seus benefícios.
A criança prodígio da tecnologia chinesa DeepSeek lançou um novo modelo experimental, V3.2-Exp, como parte de sua tentativa de desafiar a dominância americana na IA. O lançamento ocorreu na segunda-feira e foi divulgado pela primeira vez por meio de uma postagem no Hugging Face, um fórum de IA popular.
A DeepSeek afirma que esta última versão se baseia em seu modelo atual, V3.1-Terminus, mas com uma ênfase maior na velocidade, custo e gerenciamento de memória.
De acordo com Adina Yakefu, líder da comunidade chinesa do Hugging Face, o modelo apresenta algo chamado DeepSeek Sparse Attention, ou DSA, que ela disse “torna a IA melhor no manuseio de documentos longos e conversas”, ao mesmo tempo em que reduz os custos operacionais pela metade.
Se você lembra, há cerca de um ano, a DeepSeek caiu e agitou as coisas ao lançar seu primeiro modelo, o R1, sem aviso prévio. Esse modelo mostrou que era possível treinar um modelo de linguagem grande usando menos chips e muito menos poder de computação. Ninguém esperava que uma equipe chinesa conseguisse fazer isso sob essas restrições. Com o V3.2-Exp, o objetivo não mudou: menos hardware, mais desempenho.
Adiciona DeepSeek Sparse Attention e reduz o custo de execução da IA
A DSA é o grande recurso neste modelo. Ela muda a forma como a IA escolhe quais informações procurar. Em vez de digitalizar tudo, a DeepSeek treina o modelo para se concentrar apenas no que parece útil para a tarefa. Adina explicou que o benefício aqui é duplo: “eficiência” e “redução de custos.”
Ao pular dados irrelevantes, o modelo se move mais rápido e requer menos energia. Ela disse que o modelo foi projetado pensando na colaboração de código aberto.
Nick Patience, que lidera a pesquisa de IA no The Futurum Group, disse à CNBC que o modelo tem o potencial de abrir ferramentas de IA poderosas para desenvolvedores que não podem pagar por modelos mais caros. “Deveria tornar o modelo mais rápido e mais econômico de usar, sem uma queda perceptível no desempenho”, disse Nick. Mas isso não significa que não haja riscos.
A forma como a DeepSeek usa a atenção esparsa é como as companhias aéreas escolhem rotas de voo. Pode haver centenas de maneiras de chegar de um lugar a outro, mas apenas algumas fazem sentido. O modelo filtra o ruído e se concentra no que importa — ou pelo menos no que ele acha que importa.
Mas isso vem com preocupações. Ekaterina Almasque, que cofundou a BlankPage Capital, explicou de forma simples: “Então, basicamente, você elimina coisas que acha que não são importantes.” Mas o problema, disse ela, é que não há garantia de que o modelo esteja eliminando as coisas certas.
Ekaterina, que apoiou empresas como Dataiku, Darktrace e Graphcore, alertou que cortar custos pode criar problemas mais tarde. “Eles [modelos de atenção esparsa] perderam muitas nuances”, disse ela. “E então a verdadeira pergunta é: eles tinham o mecanismo certo para excluir dados não importantes, ou existe um mecanismo excluindo dados realmente importantes, e então o resultado será muito menos relevante?”
Conecta-se a chips chineses e libera código aberto
Apesar dessas preocupações, a DeepSeek insiste que o V3.2-Exp tem desempenho tão bom quanto o V3.1-Terminus. O modelo também pode ser executado diretamente em chips chineses domésticos, como Ascend e Cambricon, sem necessidade de configurações extras. Isso é fundamental no esforço mais amplo da China de construir IA com hardware nacional e reduzir a dependência de tecnologia estrangeira. “Pronto para uso”, disse Adina, a DeepSeek funciona com esses chips.
A empresa também tornou o código completo e as ferramentas do modelo públicos. Isso significa que qualquer pessoa pode baixar, executar, modificar ou construir sobre o V3.2-Exp. Essa medida está alinhada com a estratégia de código aberto da DeepSeek, mas levanta outra questão: patentes. Como o modelo é aberto e a ideia central, atenção esparsa, existe desde 2015, a DeepSeek não pode bloqueá-la legalmente.
“A abordagem não é super nova”, disse Ekaterina. Para ela, a única parte defensável da tecnologia é a forma como a DeepSeek escolhe o que manter e o que ignorar.
É aí que está a verdadeira competição agora. Não apenas em criar modelos mais inteligentes, mas em torná-los mais rápidos, mais baratos e mais enxutos — sem estragar os resultados. Até a DeepSeek chamou esta versão de “um passo intermediário em direção à nossa arquitetura de próxima geração”, o que sugere que eles já estão trabalhando em algo maior.
Nick disse que o modelo mostra que a eficiência agora é tão importante quanto o poder bruto. E Adina acredita que a empresa tem um jogo de longo prazo em mente. “A DeepSeek está jogando o jogo de longo prazo para manter a comunidade investida em seu progresso”, disse ela. “As pessoas sempre buscarão o que é barato, confiável e eficaz.”
As mentes mais inteligentes do setor de criptomoedas já leem nosso boletim informativo. Quer entrar? Junte-se a eles.

Jai Hamid
Jai Hamid cobre criptomoedas, mercados de ações, tecnologia, economia global e eventos geopolíticos que afetam os mercados há 6 anos. Ela trabalhou com publicações focadas em blockchain, incluindo AMB Crypto, Coin Edition e CryptoTale, em análises de mercado, grandes empresas, regulamentação e tendências macroeconômicas. Formada na London School of Journalism, ela compartilhou insights sobre o mercado de criptomoedas três vezes em uma das principais redes de TV da África.
















