ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

Chips Nvidia H20 e H200 ajudam a alimentar modelo de IA treinado inteiramente em dados sintéticos chineses

PorJai HamidJai Hamid 3 min de leitura
Nvidia H20 e H200 ajudam a alimentar modelos de IA treinados inteiramente em conjuntos de dados sintéticos chineses.
  • Tsinghua e Microsoft treinaram um modelo de codificação de IA completo usando apenas dados sintéticos, sem entradas do mundo real em nenhuma etapa.

  • O modelo utilizou chips Nvidia H20 e H200 e superou modelos de codificação maiores, apesar de ter menos parâmetros e menos dados.

  • A China também apresentou um chip ACCEL baseado em luz que atingiu 4,6 PFLOPS, consumindo milhões de vezes menos energia do que os chips de IA existentes.

A Universidade Tsinghua e a Microsoft Research Asia treinaram um modelo de IA completo usando apenas dados falsos. Nenhuma amostra do mundo real.

Todo o conjunto de dados foi gerado artificialmente por meio de um novo pipeline chamado SynthSmith, e o sistema funcionou em chips Nvidia do início ao fim. A equipe não apenas realizou um teste de novidade. Eles construíram um modelo funcional com 7 bilhões de parâmetros que superou modelos muito maiores treinados em dados humanos.

Seu artigo, publicado em 11 de janeiro no arXiv, afirma que o X-Coder que treinaram superou modelos de codificação com 14 bilhões de parâmetros, mesmo sem nunca ter visto texto do mundo real.

“Uma análise aprofundada revela que as leis de escala se mantêm em nosso conjunto de dados sintético”, escreveram os pesquisadores. Esta equipe incluía nomes da Universidade Tsinghua, Microsoft Research Asia e Universidade de Wuhan.

Pesquisadores usam chips Nvidia para pular dados do mundo real inteiramente

A configuração de treinamento dependia fortemente do hardware da Nvidia. Para o ajuste fino supervisionado, eles usaram 128 chips Nvidia H20 por 220 horas seguidas. Depois disso, mudaram para 32 chips H200 por mais sete dias completos para lidar com a fase de aprendizado por reforço. Essas não foram escolhas aleatórias. O H20 é ajustado para inferência, e o H200 é construído para treinamento de alto nível. Estes são os chips mais poderosos disponíveis para empresas chinesas no momento, graças às isenções de controle de exportação aprovadas pela administração Trump depois que Nvidia fez lobby intenso para torná-los disponíveis na China.

Os pesquisadores disseram que o próprio pipeline não era o problema quando se tratava de escalabilidade. Era tudo sobre poder de computação.

Wu Jie, o autor principal e estudante de mestrado na Tsinghua, disse que a verdadeira razão pela qual não levaram o pipeline a modelos de 100 bilhões ou trilhão de parâmetros foi simplesmente: “restrições computacionais, e não limitações do próprio pipeline.”

Ao liberar o código publicamente, eles esperam que outros possam construir sobre o projeto sem precisar pagar custos massivos de treinamento. O artigo também aponta uma tendência na IA.

Agora, espera-se que os modelos “pensem” em prazos mais longos e lidem com raciocínio complexo, o que aumentou a necessidade de muito mais computação durante a inferência, não apenas no treinamento.

Equipe chinesa constrói chip mais rápido usando tecnologia de fabricação antiga

Separadamente, um novo chip chamado ACCEL foi construído por cientistas chineses usando partículas de luz, não eletricidade. O chip (abreviação de All-Analogue Chip Combining Electronics and Light) foi testado em laboratório e atingiu 4,6 PFLOPS.

Isso é 3.000 vezes mais rápido que o A100 da Nvidia, e o chip chinês usou 4 milhões de vezes menos energia. Isso o torna um dos chips de IA mais eficientes já feitos para tarefas específicas, como reconhecimento de imagens ou direção autônoma.

Ele não substituirá CPUs ou chips de smartphones ainda, mas a equipe acredita que pode funcionar em wearables, veículos elétricos ou fábricas inteligentes.

O chip foi construído usando um processo de 20 anos pela Semiconductor Manufacturing International Corporation. Evitou a necessidade de máquinas de litografia avançada que a China ainda não tem acesso.

“O deployment de sistemas de computação fotônica costumava ser um desafio devido ao design estrutural complicado e à vulnerabilidade a ruídos e erros do sistema”, disse a Tsinghua em um artigo.

O chip evita isso combinando eletrônica fotônica e analógica em um novo framework. Ele não lida com tarefas de computação geral como compressão de arquivos, mas é ótimo para visão de IA e sensoriamento em baixa luminosidade.

Um detalhe insano: a energia que leva para executar chips modernos por uma hora poderia manter o ACCEL funcionando por 500 anos. Essa baixa demanda de energia também facilita lidar com problemas de calor, que limitam o quão pequenos os chips podem ficar.

As funções do chip incluem identificação de tráfego, imagem em baixa luminosidade e visão em tempo real, usando a luz ambiente diretamente no processo de sensoriamento. A equipe disse que não é um chip de propósito geral, mas preenche uma necessidade muito específica.

O financiamento veio do Programa Nacional de P&D e da Fundação Nacional de Ciências Naturais da China. Uma empresa de chips de Pequim chamada MakeSens, cofundada por um dos pesquisadores, esteve envolvida e lançou recentemente um chip analógico de baixo consumo também.

Dai Qionghai, da Tsinghua, um dos líderes do projeto, disse que construir uma nova arquitetura de computação foi apenas o primeiro passo.

“O desafio mais importante é levar essa nova arquitetura a aplicações práticas, resolvendo necessidades nacionais e públicas importantes, o que é nossa responsabilidade.”

A equipe não disse nada sobre quando este chip pode chegar ao mercado.

Se você está lendo isso, já está à frente. Mantenha-se assim com nosso boletim informativo.

Compartilhe este artigo
Jai Hamid

Jai Hamid

Jai Hamid cobre criptomoedas, mercados de ações, tecnologia, economia global e eventos geopolíticos que afetam os mercados há 6 anos. Ela trabalhou com publicações focadas em blockchain, incluindo AMB Crypto, Coin Edition e CryptoTale, em análises de mercado, grandes empresas, regulamentação e tendências macroeconômicas. Formada na London School of Journalism, ela compartilhou insights sobre o mercado de criptomoedas três vezes em uma das principais redes de TV da África.

MAIS … NOTÍCIAS