ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

Nvidia H20 y H200 ayudan a impulsar el entrenamiento de modelos de IA completamente en conjuntos de datos sintéticos chinos

PorJai HamidJai Hamid 3 min de lectura
Nvidia H20 y H200 ayudan a impulsar un modelo de IA entrenado completamente con conjuntos de datos sintéticos chinos.
  • Tsinghua y Microsoft entrenaron un modelo completo de codificación con IA utilizando únicamente datos sintéticos, sin ninguna entrada del mundo real en ninguna etapa.

  • El modelo utilizó chips Nvidia H20 y H200 y superó a modelos de codificación más grandes a pesar de tener menos parámetros y menos datos.

  • China también presentó un chip ACCEL basado en luz que alcanzó 4,6 PFLOPS mientras usaba millones de veces menos energía que los chips de IA existentes.

La Universidad Tsinghua y Microsoft Research Asia entrenaron un modelo de IA completo utilizando únicamente datos falsos. Sin muestras del mundo real en absoluto.

Todo el conjunto de datos fue generado artificialmente a través de una nueva tubería llamada SynthSmith, y el sistema funcionó en chips Nvidia de principio a fin. El equipo no solo realizó una prueba de novedad. Construyeron un modelo funcional con 7.000 millones de parámetros que superó a modelos mucho más grandes entrenados con datos humanos.

Su artículo, publicado el 11 de enero en arXiv, afirma que el X-Coder que entrenaron superó a los modelos de codificación con 14.000 millones de parámetros, aunque nunca vio texto del mundo real.

«El análisis en profundidad revela que las leyes de escalado se mantienen en nuestro conjunto de datos sintéticos», escribieron los investigadores. Este equipo incluía nombres de la Universidad Tsinghua, Microsoft Research Asia y la Universidad de Wuhan.

Los investigadores utilizan chips Nvidia para saltarse completamente los datos del mundo real

La configuración de entrenamiento dependía fuertemente del hardware de Nvidia. Para el ajuste fino supervisado, utilizaron 128 chips Nvidia H20 durante 220 horas continuas. Después de eso, cambiaron a 32 chips H200 durante otros siete días completos para manejar la fase de aprendizaje por refuerzo. Estas no fueron elecciones al azar. El H20 está optimizado para la inferencia, y el H200 está diseñado para el entrenamiento de alto rendimiento. Estos son los chips más potentes disponibles para las empresas chinas en este momento, gracias a las exenciones de control de exportación aprobadas por la administración Trump después de que Nvidia hiciera una intensa campaña para que estuvieran disponibles en China.

Los investigadores dijeron que la propia tubería no era el problema cuando se trataba de escalar. Todo se trataba de potencia de cómputo.

Wu Jie, el autor principal y estudiante de máster en Tsinghua, dijo que la verdadera razón por la que no habían llevado la tubería a modelos de 100.000 millones o billones de parámetros fue simplemente: «limitaciones computacionales, en lugar de limitaciones de la propia tubería».

Al liberar el código públicamente, esperan que otros puedan construir sobre el proyecto sin necesidad de pagar costos masivos de entrenamiento. El artículo también señala una tendencia en la IA.

Se espera que los modelos «piensen» durante períodos de tiempo más largos y manejen razonamientos complejos, lo que ha impulsado la necesidad de mucha más potencia de cómputo durante la inferencia, no solo durante el entrenamiento.

Equipo chino construye chip más rápido utilizando tecnología de fabricación antigua

Por separado, un nuevo chip llamado ACCEL fue construido por científicos chinos utilizando partículas de luz, no electricidad. El chip (siglas de All-Analogue Chip Combining Electronics and Light) fue probado en un laboratorio y alcanzó 4,6 PFLOPS.

Eso es 3.000 veces más rápido que el A100 de Nvidia, y el chip chino utilizó 4 millones de veces menos energía. Esto lo convierte en uno de los chips de IA más eficientes jamás creados para tareas específicas como el reconocimiento de imágenes o la conducción autónoma.

Aún no reemplazará a las CPU o a los chips de los teléfonos inteligentes, pero el equipo cree que podría funcionar en dispositivos portátiles, vehículos eléctricos o fábricas inteligentes.

El chip fue construido utilizando un proceso de hace 20 años por Semiconductor Manufacturing International Corporation. Evitó la necesidad de máquinas de litografía avanzada que China aún no puede acceder.

“El despliegue de sistemas de computación fotónica solía ser un desafío debido a su diseño estructural complicado y su vulnerabilidad al ruido y a los errores del sistema”, dijo Tsinghua en un artículo.

El chip evita esto combinando electrónica fotónica y analógica en un nuevo marco. No maneja tareas de cómputo general como la compresión de archivos, pero es excelente para la visión por IA y la detección en condiciones de poca luz.

Un detalle increíble: la energía que toma ejecutar chips modernos durante una hora podría mantener ACCEL funcionando durante 500 años. Esa baja demanda de energía también facilita lidiar con los problemas de calor, lo que limita cuán pequeños pueden llegar a ser los chips.

Las funciones del chip incluyen identificación de tráfico, imagen en condiciones de poca luz y visión en tiempo real, utilizando la luz ambiental directamente en el proceso de detección. El equipo dijo que no es un chip de propósito general, pero satisface una necesidad muy específica.

La financiación provino del Programa Nacional de I+D Clave y de la Fundación Nacional de Ciencias Naturales de China. Una empresa de chips de Pekín llamada MakeSens, cofundada por uno de los investigadores, participó en el proyecto y también lanzó recientemente un chip analógico de bajo consumo.

Dai Qionghai, de la Universidad de Tsinghua y uno de los responsables del proyecto, afirmó que construir una nueva arquitectura de computación era solo el primer paso.

“El desafío más importante es llevar esta nueva arquitectura a aplicaciones prácticas, resolviendo necesidades nacionales y públicas de gran envergadura, lo cual es nuestra responsabilidad.”

El equipo no ha dicho nada sobre cuándo este chip podría llegar al mercado.

Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.

Comparte este artículo
Jai Hamid

Jai Hamid

Jai Hamid ha estado cubriendo criptomonedas, mercados bursátiles, tecnología, la economía global y los eventos geopolíticos que afectan a los mercados durante los últimos 6 años. Ha trabajado con publicaciones centradas en blockchain, incluidas AMB Crypto, Coin Edition y CryptoTale, en análisis de mercado, grandes empresas, regulación y tendencias macroeconómicas. Se graduó en la London School of Journalism y ha compartido tres veces sus conocimientos sobre el mercado de criptomonedas en una de las principales cadenas de televisión de África.

MÁS … NOTICIAS