ÚLTIMAS NOTÍCIAS
SELECIONADO PARA VOCÊ

A Amazon usa chips de escala de wafer da Cerebras para acelerar modelos de IA na AWS

PorJai HamidJai Hamid 3 min de leitura
Amazon vai pressionar a OpenAI com o próximo modelo de IA de raciocínio
  • A Amazon Web Services implantará chips da Cerebras em seus data centers no âmbito de um acordo plurianual de inferência de IA.

  • A configuração combina servidores Amazon Trainium, sistemas Cerebras CS-3 e rede EFA no Amazon Bedrock.

  • A Amazon utilizará o Trainium para o pré-processamento (prefill) e a Cerebras para a decodificação (decode) para acelerar as respostas de IA.

A Amazon Web Services anunciou na sexta-feira que colocará processadores da Cerebras em seus data centers sob uma parceria multianual focada em inferência de IA.

O acordo dá à Amazon uma nova maneira de acelerar como os modelos de IA respondem a prompts, escrevem código e lidam com solicitações de usuários em tempo real. A AWS disse que usará a tecnologia da Cerebras, incluindo o Wafer-Scale Engine, para tarefas de inferência.

As empresas não divulgaram os termos financeiros. A configuração está planejada para o Amazon Bedrock dentro dos data centers da AWS, posicionando a parceria diretamente dentro de um dos principais produtos de IA da Amazon.

A AWS disse que o sistema combinará servidores alimentados por Amazon Trainium, sistemas Cerebras CS-3 e a rede Elastic Fabric Adapter da Amazon.

Mais tarde este ano, a AWS também planeja oferecer os principais modelos de linguagem de código aberto e o Amazon Nova no hardware da Cerebras. David Brown, vice-presidente de Serviços de Computação e ML da AWS, disse que a velocidade ainda é um grande problema na inferência de IA, especialmente para ajuda de codificação em tempo real e aplicativos interativos.

David disse: “A inferência é onde a IA entrega valor real aos clientes, mas a velocidade continua sendo um gargalo crítico para cargas de trabalho exigentes, como assistência de codificação em tempo real e aplicativos interativos.”

A Amazon divide o pré-processamento e a decodificação em chips separados

A AWS disse que o design usa um método chamado desagregação de inferência. Isso significa dividir a inferência de IA em duas partes. A primeira parte é o processamento do prompt, também chamado de pré-processamento (prefill). A segunda parte é a geração de saída, também chamada de decodificação (decode).

A AWS disse que as duas tarefas se comportam de maneira muito diferente. O pré-processamento é paralelo, intensivo em computação e precisa de largura de banda de memória moderada. A decodificação é serial, menos intensiva em computação e muito mais dependente da largura de banda de memória. A decodificação também consome a maior parte do tempo nesses casos, porque cada token de saída deve ser produzido um por um.

É por isso que a AWS está atribuindo hardware diferente para cada etapa. O Trainium lidará com o pré-processamento. O Cerebras CS-3 lidará com a decodificação.

A AWS disse que a rede EFA de baixa latência e alta largura de banda conectará ambos os lados para que o sistema possa funcionar como um único serviço, enquanto cada processador se concentra em uma tarefa separada.

David disse: “O que estamos construindo com a Cerebras resolve isso: ao dividir a carga de trabalho de inferência entre o Trainium e o CS-3 e conectá-los com o Elastic Fabric Adapter da Amazon, cada sistema faz o que faz de melhor. O resultado será uma inferência uma ordem de magnitude mais rápida e com desempenho superior ao disponível hoje.”

A AWS também disse que o serviço será executado no AWS Nitro System, que é a camada base para sua infraestrutura de nuvem.

Isso significa que os sistemas Cerebras CS-3 e as instâncias alimentadas por Trainium devem operar com a mesma segurança, isolamento e consistência que os clientes da AWS já utilizam.

A Amazon impulsiona o Trainium com mais força enquanto a Nvidia enfrenta outra ameaça

O anúncio também dá à Amazon outra oportunidade de impulsionar o Trainium contra chips da Nvidia, AMD e outras grandes empresas de chips. A AWS descreve o Trainium como seu chip de IA interno, projetado para desempenho escalável e eficiência de custos em treinamento e inferência.

A AWS disse que dois grandes laboratórios de IA já estão comprometidos com isso. A Anthropic nomeou a AWS como sua parceira principal de treinamento e usa o Trainium para treinar e implantar modelos. A OpenAI consumirá 2 gigawatts de capacidade do Trainium por meio da infraestrutura da AWS para o Ambiente de Runtime com Estado, modelos de fronteira e outras cargas de trabalho avançadas.

A AWS acrescentou que o Trainium3 tem visto uma forte adoção desde seu lançamento recente, com clientes de vários setores comprometendo grandes capacidades.

A Cerebras está lidando com o lado da decodificação da configuração. A AWS disse que o CS-3 é dedicado à aceleração de decodificação, o que lhe dá mais espaço para tokens de saída rápidos. A Cerebras diz que o CS-3 é o sistema de inferência de IA mais rápido do mundo e oferece milhares de vezes maior largura de banda de memória do que a GPU mais rápida.

A empresa disse que os modelos de raciocínio agora representam uma parte maior do trabalho de inferência e geram mais tokens por solicitação à medida que trabalham na resolução de problemas. A Cerebras também disse que a OpenAI, a Cognition, a Mistral e outras usam seus sistemas para cargas de trabalho exigentes, especialmente codificação agêntica.

Andrew Feldman, fundador e diretor executivo da Cerebras Systems, disse: “Parceria com a AWS para construir uma solução de inferência desagregada trará a inferência mais rápida para uma base de clientes global.”

Andrew acrescentou: “Todas as empresas ao redor do mundo poderão se beneficiar de uma inferência extremamente rápida dentro de seu ambiente AWS existente.”

O acordo adiciona mais pressão sobre a Nvidia, que em dezembro assinou um acordo de licenciamento de US$ 20 bilhões com a Groq e planeja revelar na próxima semana um novo sistema de inferência usando a tecnologia da Groq.

Não apenas leia notícias sobre criptomoedas. Entenda-as. Inscreva-se em nossa newsletter. É grátis.

Compartilhe este artigo
Jai Hamid

Jai Hamid

Jai Hamid cobre criptomoedas, mercados de ações, tecnologia, economia global e eventos geopolíticos que afetam os mercados há 6 anos. Ela trabalhou com publicações focadas em blockchain, incluindo AMB Crypto, Coin Edition e CryptoTale, em análises de mercado, grandes empresas, regulamentação e tendências macroeconômicas. Formada na London School of Journalism, ela compartilhou insights sobre o mercado de criptomoedas três vezes em uma das principais redes de TV da África.

MAIS … NOTÍCIAS