Cerebras desafía a Nvidia lanzando un servicio de inferencia de IA

Cerebras introduce servicios de inferencia de IA con chips Waffer Scale Engine.
- Cerebras, un innovador fabricante de chips, ha presentado su propio servicio de inferencia de IA.
- La empresa utilizará sus últimos chips Wafer Scale Engine, que son más rápidos que las GPU tradicionales.
- Crebras ofrece este servicio a un precio mucho más accesible: 10 centavos por millón de tokens.
Cerebras Systems anunció una solución de inferencia de IA para desarrolladores el martes. Según afirma la empresa, es una solución de inferencia mucho más rápida, 20 veces más rápida que las ofertas de Nvidia.
Cerebras proporcionará acceso a sus chips más grandes para ejecutar aplicaciones de IA, que, según la empresa, también son más baratos que las GPU de Nvidia. Las GPU de Nvidia, estándar en la industria, a menudo se acceden a través de proveedores de servicios en la nube para ejecutar modelos de lenguaje grandes como ChatGPT. Obtener acceso no suele ser fácil para muchas pequeñas empresas y es costoso.
Cerebras afirma que sus nuevos chips pueden ofrecer un rendimiento superior al de las GPU
La inferencia de IA es el proceso de operar un modelo de IA ya entrenado para obtener una salida, como respuestas de chatbots y resolución de diferentes tareas. Los servicios de inferencia son la columna vertebral de las aplicaciones de IA actuales, ya que dependen de ellos para las operaciones diarias para facilitar a los usuarios.
Cerebras dijo que la inferencia es el segmento de más rápido crecimiento en la industria de la IA, ya que representa el 40 % de todas las cargas de trabajo relacionadas con la IA en la computación en la nube. El director ejecutivo de Cerebras, Andrew Feldman, dijo que los chips de gran tamaño de la empresa ofrecen más rendimiento que una GPU. Las GPU no pueden lograr este nivel, dijo. Feldman estaba hablando con Reuters en una entrevista.
Añadió,
"Lo hacemos con la mayor precisión y lo ofrecemos al precio más bajo." Fuente: Reuters.
El director ejecutivo dijo que los servicios de inferencia de IA existentes no son satisfactorios para todos los clientes. Le dijo a un grupo separado de reporteros en San Francisco que la empresa está "viendo todo tipo de interés" en soluciones más rápidas y rentables.
Hasta ahora, Nvidia ha dominado el mercado de computación de IA con sus chips de estándar dorado y el entorno de programación Compute Unified Device Architecture (CUDA). Esto ha ayudado a Nvidia a mantener a los desarrolladores dentro de su ecosistema proporcionando una amplia gama de herramientas.
Los chips Cerbras tienen 7000 veces más memoria que las GPU H100 de Nvidia
Cerebras dijo que su servicio de inferencia de alta velocidad es un punto de inflexión para la industria de la IA. Los nuevos chips de la empresa, que son tan grandes como platos de cena, se llaman Wafer Scale Engines. Pueden procesar 1000 tokens por segundo, lo que la empresa dijo que es comparable a la introducción de Internet de banda ancha.
Según la empresa, los nuevos chips entregan diferentes cantidades de salida para varios modelos de IA. Para Llama 3.1 8B, los nuevos chips pueden procesar hasta 1800 tokens por segundo, mientras que para Llama 3.1 70B, pueden procesar 450 tokens por segundo.
Cerebras está ofreciendo servicios de inferencia a 10 centavos por cada millón de tokens, lo cual es menos que los basados en GPU. Por lo general, los enfoques alternativos comprometen la precisión por rendimiento, según las creencias de la industria, mientras que los nuevos chips de Cerebras son capaces de mantener la precisión, según afirman la empresa.
Cerebras dijo que ofrecerá productos de inferencia de IA en diferentes formas. La empresa planea introducir un servicio de inferencia a través de su nube y una clave de desarrollador. La firma también venderá los nuevos chips a clientes de centros de datos y a aquellos que deseen operar sus propios sistemas.
Los nuevos chips Wafer Scale Engine tienen sus propios módulos integrados de refrigeración y suministro de energía y forman parte de un sistema de centro de datos de Cerebras llamado CS-3. Según diferentes informes, el sistema Cerebras CS-3 es la columna vertebral del servicio de inferencia de la empresa.
El sistema cuenta con 7000 veces más capacidad de memoria que las GPU H100 de Nvidia. Esto también resuelve el problema fundamental del ancho de banda de memoria, que muchos fabricantes de chips están intentando abordar.
Cerbras también está trabajando para convertirse en una empresa cotizada en bolsa. Para ello, ha presentado un prospecto confidencial ante la Comisión de Bolsa y Valores de EE. UU. (SEC) este mes.
Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.
Aviso de responsabilidad. La información proporcionada no es un consejo de trading. Cryptopolitan.com no asumimos responsabilidad alguna por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente la investigación independiente y/o la consulta con un profesional calificado antes de tomar cualquier decisión de inversión.

Aamir Sheikh
Aamir es un periodista tecnológico con casi seis años de experiencia en los sectores de criptomonedas y tecnología. Se graduó de la Universidad MAJ con un MBA en Finanzas y Marketing. Ahora trabaja con Cryptopolitan, donde informa sobre los últimos desarrollos en los mercados de criptomonedas y predicciones de precios.
















