ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

Cerebras desafia a Nvidia lançando um serviço de inferência de IA

PorAamir SheikhAamir Sheikh 3 min de leitura
Cerebras sobe 190% na estreia, com valor de mercado ultrapassando US$ 100 bilhões

Cerebras lança serviços de inferência em IA com chips Waffer Scale Engine.

  • A Cerebras, uma fabricante de chips inovadora, apresentou seu próprio serviço de inferência de IA.
  • A empresa utilizará seus mais recentes chips Wafer Scale Engine, que são mais rápidos que as GPUs tradicionais.
  • A Crebras está oferecendo o serviço a um preço muito mais acessível: 10 centavos por milhão de tokens.

A Cerebras Systems anunciou na terça-feira uma solução de inferência de IA para desenvolvedores. De acordo com a empresa, é uma solução de inferência muito mais rápida, 20 vezes mais rápida que as ofertas da Nvidia.

A Cerebras fornecerá acesso a seus chips maiores para executar aplicativos de IA, que, segundo a empresa, também são mais baratos que as GPUs da Nvidia. As GPUs padrão da indústria Nvidia são frequentemente acessadas por meio de provedores de serviços em nuvem para executar grandes modelos de linguagem, como o ChatGPT. Obter acesso geralmente não é fácil para muitas pequenas empresas e é caro. 

A Cerebras afirma que seus novos chips podem entregar desempenho além das GPUs

A inferência de IA é o processo de operar um modelo de IA já treinado para obter uma saída, como respostas de chatbots e resolução de diferentes tarefas. Os serviços de inferência são a espinha dorsal dos aplicativos de IA de hoje, pois dependem deles para operações diárias para facilitar os usuários.

A Cerebras disse que a inferência é o segmento de mais rápido crescimento da indústria de IA, representando 40% de todas as cargas de trabalho relacionadas à IA na computação em nuvem. O CEO da Cerebras, Andrew Feldman, disse que os chips de grande porte da empresa entregam mais desempenho do que uma GPU. As GPUs não podem alcançar esse nível, disse ele. Feldman estava falando à Reuters em uma entrevista.

Ele acrescentou:

“Estamos fazendo isso com a maior precisão e oferecendo pelo menor preço.” Fonte: Reuters.

O CEO disse que os serviços de inferência de IA existentes não são satisfatórios para todos os clientes. Ele disse a um grupo separado de repórteres em São Francisco que a empresa está “vendo todo tipo de interesse” em soluções mais rápidas e econômicas. 

Até agora, a Nvidia dominou o mercado de computação de IA com seus chips padrão-ouro e o ambiente de programação Compute Unified Device Architecture (CUDA). Isso ajudou a Nvidia a manter os desenvolvedores dentro de seu ecossistema, fornecendo uma vasta gama de ferramentas.

Os chips Cerbras têm 7000 vezes mais memória do que as GPUs H100 da Nvidia

A Cerebras disse que seu serviço de inferência de alta velocidade é um ponto de virada para a indústria de IA. Os novos chips da empresa, que são do tamanho de pratos de jantar, são chamados de Wafer Scale Engines. Eles podem processar 1000 tokens por segundo, o que a empresa disse ser comparável à introdução da internet de banda larga.

De acordo com a empresa, os novos chips entregam diferentes quantidades de saída para vários modelos de IA. Para o Llama 3.1 8B, os novos chips podem processar até 1800 tokens por segundo, enquanto para o Llama 3.1 70B, podem processar 450 tokens por segundo.

A Cerebras está oferecendo serviços de inferência a 10 centavos por um milhão de tokens, o que é menos do que os baseados em GPUs. Normalmente, abordagens alternativas comprometem a precisão pelo desempenho, de acordo com crenças da indústria, enquanto os novos chips da Cerebras são capazes de manter a precisão, de acordo com alegações da empresa.

A Cerebras disse que oferecerá produtos de inferência de IA em diferentes formatos. A empresa planeja introduzir um serviço de inferência por meio de sua nuvem e uma chave de desenvolvedor. A empresa também venderá os novos chips para clientes de data center e para aqueles que desejam operar seus próprios sistemas.

Os novos chips Wafer Scale Engine possuem seus próprios módulos integrados de resfriamento e entrega de energia e fazem parte de um sistema de data center da Cerebras chamado CS-3. De acordo com diferentes relatórios, o sistema Cerebras CS-3 é a espinha dorsal do serviço de inferência da empresa.

O sistema possui 7000 vezes mais capacidade de memória do que as GPUs Nvidia H100. Isso também resolve o problema fundamental da largura de banda de memória, que muitos fabricantes de chips estão tentando abordar.

A Cerbras também está trabalhando para se tornar uma empresa de capital aberto. Para isso, ela apresentou um prospecto confidencial à Securities and Exchange Commission (SEC) este mês.

Se você está lendo isso, já está à frente. Mantenha-se assim com nosso boletim informativo.

Compartilhe este artigo

Aviso Legal. As informações fornecidas não constituem aconselhamento de investimento. Cryptopolitan.com não assume responsabilidade por quaisquer investimentos realizados com base nas informações fornecidas nesta página. Recomendamos fortemente a realização de pesquisa independente e/ou consulta com um profissional qualificado antes de tomar quaisquer decisões de investimento.

Aamir Sheikh

Aamir Sheikh

Aamir é um jornalista de tecnologia com quase seis anos de experiência nos setores de criptomoedas e tecnologia. Formou-se na MAJ University com um MBA em Finanças e Marketing. Atualmente trabalha na Cryptopolitan, onde relata os últimos desenvolvimentos nos mercados de criptomoedas e previsões de preços.

MAIS … NOTÍCIAS