ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Amazon utiliza chips de escala de oblea de Cerebras para potenciar los modelos de IA en AWS

PorJai HamidJai Hamid 3 min de lectura
Amazon presionará a OpenAI con su próximo modelo de IA de razonamiento
  • Amazon Web Services implementará chips de Cerebras en sus centros de datos bajo un acuerdo plurianual de inferencia de IA.

  • La configuración combina servidores Amazon Trainium, sistemas Cerebras CS-3 y red EFA en Amazon Bedrock.

  • Amazon utilizará Trainium para el prellenado y Cerebras para la decodificación, acelerando así las respuestas de IA.

Amazon Web Services anunció el viernes que instalará procesadores de Cerebras en sus centros de datos bajo una asociación plurianual centrada en la inferencia de IA.

El acuerdo le da a Amazon una nueva forma de acelerar cómo los modelos de IA responden a los prompts, escriben código y manejan las solicitudes de usuarios en tiempo real. AWS dijo que utilizará la tecnología de Cerebras, incluido el Wafer-Scale Engine, para tareas de inferencia.

Las empresas no compartieron los términos financieros. La configuración está planificada para Amazon Bedrock dentro de los centros de datos de AWS, situando la asociación directamente dentro de uno de los principales productos de IA de Amazon.

AWS dijo que el sistema combinará servidores impulsados por Amazon Trainium, sistemas Cerebras CS-3 y la red de Adaptador de Fabricación Elástica (Elastic Fabric Adapter) de Amazon.

Más tarde este año, AWS también planea ofrecer los principales modelos de lenguaje grande de código abierto y Amazon Nova en hardware de Cerebras. David Brown, vicepresidente de Servicios de Cómputo y ML en AWS, dijo que la velocidad sigue siendo un problema importante en la inferencia de IA, especialmente para la ayuda de codificación en tiempo real y las aplicaciones interactivas.

David dijo: "La inferencia es donde la IA ofrece un valor real a los clientes, pero la velocidad sigue siendo un cuello de botella crítico para cargas de trabajo exigentes como la asistencia de codificación en tiempo real y las aplicaciones interactivas".

Amazon divide el prellenado y la decodificación en chips separados

AWS dijo que el diseño utiliza un método llamado desacoplamiento de la inferencia (inference disaggregation). Esto significa dividir la inferencia de IA en dos partes. La primera parte es el procesamiento del prompt, también llamado prellenado (prefill). La segunda parte es la generación de salida, también llamada decodificación (decode).

AWS dijo que las dos tareas se comportan de manera muy diferente. El prellenado es paralelo, intensivo en cómputo y necesita un ancho de banda de memoria moderado. La decodificación es serial, menos intensiva en cómputo y mucho más dependiente del ancho de banda de memoria. La decodificación también toma la mayor parte del tiempo en estos casos porque cada token de salida debe producirse uno por uno.

Por eso, AWS está asignando hardware diferente a cada etapa. Trainium manejará el prellenado. Cerebras CS-3 manejará la decodificación.

AWS dijo que la red EFA de baja latencia y alto ancho de banda conectará ambos lados para que el sistema pueda funcionar como un solo servicio mientras cada procesador se enfoca en una tarea separada.

David dijo: "Lo que estamos construyendo con Cerebras resuelve eso: al dividir la carga de trabajo de inferencia entre Trainium y CS-3, y conectarlos con el Adaptador de Fabricación Elástica de Amazon, cada sistema hace lo que mejor sabe hacer. El resultado será una inferencia un orden de magnitud más rápida y con un rendimiento superior a lo disponible hoy".

AWS también dijo que el servicio se ejecutará en el Sistema AWS Nitro, que es la capa base de su infraestructura en la nube.

Esto significa que se espera que los sistemas Cerebras CS-3 y las instancias impulsadas por Trainium operen con la misma seguridad, aislamiento y consistencia que los clientes de AWS ya utilizan.

Amazon impulsa Trainium con más fuerza mientras Nvidia enfrenta otra amenaza

El anuncio también le da a Amazon otra oportunidad para impulsar Trainium frente a los chips de Nvidia, AMD y otras grandes empresas de chips. AWS describe Trainium como su chip de IA de fabricación propia, diseñado para un rendimiento escalable y eficiencia de costos en el entrenamiento y la inferencia.

AWS dijo que dos grandes laboratorios de IA ya se han comprometido con él. Anthropic ha nombrado a AWS su socio principal de entrenamiento y utiliza Trainium para entrenar y desplegar modelos. OpenAI consumirá 2 gigavatios de capacidad de Trainium a través de la infraestructura de AWS para el Entorno de Runtime con Estado, modelos de vanguardia y otras cargas de trabajo avanzadas.

AWS agregó que Trainium3 ha visto una fuerte adopción desde su lanzamiento reciente, con clientes de diversas industrias comprometiendo una capacidad importante.

Cerebras está manejando el lado de la decodificación de la configuración. AWS dijo que CS-3 está dedicado a la aceleración de la decodificación, lo que le da más espacio para tokens de salida rápidos. Cerebras dice que CS-3 es el sistema de inferencia de IA más rápido del mundo y ofrece un ancho de banda de memoria miles de veces mayor que la GPU más rápida.

La empresa dijo que los modelos de razonamiento ahora representan una parte mayor del trabajo de inferencia y generan más tokens por solicitud a medida que trabajan a través de problemas. Cerebras también dijo que OpenAI, Cognition, Mistral y otros utilizan sus sistemas para cargas de trabajo exigentes, especialmente la codificación agéntica.

Andrew Feldman, fundador y director ejecutivo de Cerebras Systems, dijo: "Aliarse con AWS para construir una solución de inferencia desacoplada traerá la inferencia más rápida a una base de clientes global".

Andrew agregó: "Cada empresa en todo el mundo podrá beneficiarse de una inferencia extremadamente rápida dentro de su entorno AWS existente".

El acuerdo añade más presión a Nvidia, que en diciembre firmó un acuerdo de licencia de $20.000 millones con Groq y planea presentar la próxima semana un nuevo sistema de inferencia que utiliza la tecnología de Groq.

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Comparte este artículo
Jai Hamid

Jai Hamid

Jai Hamid ha estado cubriendo criptomonedas, mercados bursátiles, tecnología, la economía global y los eventos geopolíticos que afectan a los mercados durante los últimos 6 años. Ha trabajado con publicaciones centradas en blockchain, incluidas AMB Crypto, Coin Edition y CryptoTale, en análisis de mercado, grandes empresas, regulación y tendencias macroeconómicas. Se graduó en la London School of Journalism y ha compartido tres veces sus conocimientos sobre el mercado de criptomonedas en una de las principales cadenas de televisión de África.

MÁS … NOTICIAS