DeepSeek presenta mHC pero enfrenta obstáculos de revisión por pares

- DeepSeek propone una nueva forma de escalar la IA sin necesidad de más potencia computacional.
- Los investigadores ven promesa, pero advierten que aún se necesitan más pruebas.
- mHC podría transformar la forma en que se entrenan los modelos de lenguaje grandes.
En un momento en que hay problemas con los crecientes costos de desarrollo y mantenimiento de la IA y la limitada cantidad de hardware disponible, DeepSeek ha presentado un nuevo plan para desarrollar y escalar la inteligencia artificial (IA).
La startup con sede en China cree que puede crear modelos de IA significativamente mejores sin necesariamente añadir más chips y, por lo tanto, aumentar el consumo de energía. Aunque el concepto propuesto mHC ha generado una atención significativa de muchos investigadores del tema, generalmente se considera que aún está en etapas tempranas.
Se requerirá más investigación para determinar los beneficios del enfoque en el desarrollo de sistemas de IA más grandes. Un artículo técnico que detalla el concepto mHC se publicó la semana pasada y está coescrito por Liang Wenfeng, fundador y CEO de DeepSeek.
DeepSeek repensa el diseño de la red para escalar la IA
Uno de los componentes principales del trabajo es una reevaluación de cómo se transfiere la información entre las varias capas de una red neuronal multicapa.
Cada capa en una red neuronal transmite una forma de información procesada a la siguiente capa del modelo, creando lo que se ha denominado «Red de Aprendizaje Residual» (ResNet). Desarrollada por Kaiming He de Microsoft Research y otros hace aproximadamente diez años, ResNet proporcionó la base fundamental para muchos de los sistemas de IA más avanzados de hoy.
Un concepto desarrollado por DeepSeek se creó después de que ByteDance introdujera Hyper-Connections en 2024. Hyper-Connections permiten que la información viaje por múltiples rutas a través de una red, en lugar de solo un camino principal, lo que puede aumentar la velocidad de aprendizaje y la riqueza de la experiencia.
Sin embargo, aunque pueden ser beneficiosos, también pueden llevar a ocurrencias problemáticas de entrenamiento, donde los modelos experimentan inestabilidad de entrenamiento o fallo completo.
Según Song Linqi (Universidad de Ciudad de Hong Kong), la investigación de DeepSeek es una progresión de una idea existente, una continuación de cómo DeepSeek mira el trabajo de otras empresas, en lugar de inventar algo desde cero.
ResNet se compara con una autopista de un solo carril, mientras que Hyper-Connections se asemejan a una autopista de múltiples carriles; sin embargo, Song advirtió que tener múltiples carriles sin reglas adecuadas puede llevar a más colisiones.
El profesor Guo Song de la Universidad de Ciencia y Tecnología de Hong Kong cree que este artículo de investigación puede indicar un cambio en el comportamiento de investigación para la investigación de IA. En lugar de continuar haciendo pequeñas modificaciones a los diseños de modelos existentes, siente que la investigación puede evolucionar hacia el desarrollo de nuevos modelos basados en construcciones teóricas.
Los investigadores prueban mHC pero plantean preocupaciones prácticas
Aunque hay entusiasmo por el reciente hito alcanzado en las pruebas de mHC para el aprendizaje profundo, los expertos han destacado que la investigación aún no está terminada. Las pruebas proporcionadas por DeepSeek solo utilizaron cuatro rutas de datos al probar modelos con 27 mil millones de parámetros.
«Los experimentos validaron modelos hasta 27 mil millones de parámetros, pero ¿cómo se desempeñaría en los modelos de vanguardia de hoy que son un orden de magnitud más grandes?»
Profesor Guo Song.
Los modelos de IA disponibles hoy son más grandes y típicamente tienen cientos de miles de millones de parámetros en comparación con los 30 mil millones de parámetros que eran el estándar hace solo unos años.
Guo hizo eco de estos sentimientos y declaró que nadie puede concluir aún si mHC podrá realizar trabajo en la vanguardia de la tecnología de IA. También declaró que la infraestructura necesaria para que mHC funcione puede ser demasiado avanzada para que la utilicen instituciones de investigación más pequeñas y empresas para dispositivos móviles.
Según Cryptopolitan, la popularidad de DeepSeek provenía de su lanzamiento del modelo de lenguaje grande DeepSeek V3, y el lanzamiento subsiguiente de su modelo de razonamiento DeepSeek-R1 solo un par de semanas después.
Al comparar los resultados de los modelos con sus competidores durante las pruebas de referencia, ambos modelos fueron capaces de alcanzar o exceder los resultados de sus competidores a pesar de haberse lanzado utilizando solo una fracción de los datos de entrenamiento utilizados para los otros modelos de lenguaje competidores.
Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.
Enacy Mapakame
Enacy Mapakame es una periodista con más de 10 años de experiencia en noticias empresariales y financieras. Cubre los mercados de capitales y las tecnologías emergentes: el metaverso, la inteligencia artificial y las criptomonedas. Enacy posee un título de licenciatura con honores en Estudios de Medios y Sociedad.















