ÚLTIMAS NOTICIAS
SELECCIONADO PARA TI

El DeepSeek chino presenta un modelo de IA de próxima generación para rivalizar con GPT-5. ¿Pero es lo suficientemente bueno?

PorJai HamidJai Hamid 3 min de lectura
El nuevo modelo de IA de próxima generación de DeepSeek, de China, busca rivalizar con GPT-5. Pero ¿es lo suficientemente bueno?

Foto de Solen Feyissa en Unsplash.

  • DeepSeek lanzó su nuevo modelo V3.2-Exp el lunes, con un enfoque en la velocidad, la reducción de costos y el manejo de grandes volúmenes de datos.
  • El modelo introduce DeepSeek Sparse Attention, que omite los datos irrelevantes para mejorar la eficiencia y reducir a la mitad los costos.
  • Los expertos advierten que la atención dispersa podría eliminar información importante y reducir la fiabilidad, a pesar de sus beneficios.

El niño prodigio tecnológico chino DeepSeek ha lanzado un nuevo modelo experimental, V3.2-Exp, como parte de su intento de desafiar el dominio estadounidense en la IA. El lanzamiento fue el lunes y se hizo público por primera vez a través de una publicación en Hugging Face, un foro de IA popular.

DeepSeek afirma que esta última versión se basa en su modelo actual, V3.1-Terminus, pero con un mayor énfasis en la velocidad, el costo y la gestión de la memoria.

Según Adina Yakefu, líder de la comunidad china de Hugging Face, el modelo presenta algo llamado DeepSeek Sparse Attention (Atención Dispersa de DeepSeek), o DSA, que dijo «hace que la IA sea mejor para manejar documentos largos y conversaciones» mientras también reduce los costos operativos a la mitad.

Si recuerdas, hace alrededor de un año, DeepSeek cayó y sacudió las cosas al lanzar su primer modelo, R1, sin previo aviso. Ese modelo mostró que era posible entrenar un modelo de lenguaje grande utilizando menos chips y mucha menos potencia de computación. Nadie esperaba que un equipo chino lograra eso bajo esas restricciones. Con V3.2-Exp, el objetivo no ha cambiado: menos hardware, más rendimiento.

Añade DeepSeek Sparse Attention y reduce el costo de ejecución de la IA

DSA es la gran característica de este modelo. Cambia la forma en que la IA selecciona qué información buscar. En lugar de escanear todo, DeepSeek entrena al modelo para centrarse solo en lo que parece útil para la tarea. Adina explicó que el beneficio aquí es doble: «eficiencia» y «reducción de costos».

Al omitir datos irrelevantes, el modelo se mueve más rápido y requiere menos energía. Dijo que el modelo fue diseñado pensando en la colaboración de código abierto.

Nick Patience, quien lidera la investigación de IA en The Futurum Group, dijo a CNBC que el modelo tiene el potencial de abrir herramientas de IA poderosas a desarrolladores que no pueden permitirse usar modelos más caros. «Debería hacer que el modelo sea más rápido y más rentable de usar sin una caída notable en el rendimiento», dijo Nick. Pero eso no significa que no haya riesgos.

La forma en que DeepSeek utiliza la atención dispersa es como cómo las aerolíneas eligen rutas de vuelo. Puede haber cientos de formas de llegar de un lugar a otro, pero solo unas pocas tienen sentido. El modelo filtra el ruido y se centra en lo que importa, o al menos en lo que cree que importa.

Pero esto viene con preocupaciones. Ekaterina Almasque, cofundadora de BlankPage Capital, lo explicó simplemente: «Básicamente, eliminas cosas que crees que no son importantes». Pero el problema, dijo, es que no hay garantía de que el modelo esté eliminando las cosas correctas.

Ekaterina, que ha respaldado empresas como Dataiku, Darktrace y Graphcore, advirtió que cortar esquinas podría crear problemas más adelante. «Han perdido muchas matices», dijo. «Y luego la verdadera pregunta es, ¿tuvieron el mecanismo correcto para excluir datos no importantes, o hay un mecanismo que excluye datos realmente importantes, y entonces el resultado será mucho menos relevante?»

Se conecta a chips chinos y libera código abierto

A pesar de esas preocupaciones, DeepSeek insiste en que V3.2-Exp funciona tan bien como V3.1-Terminus. El modelo también puede ejecutarse directamente en chips chinos nacionales como Ascend y Cambricon, sin requerir configuraciones adicionales. Eso es clave en el esfuerzo más amplio de China por construir IA con hardware nacional y reducir la dependencia de la tecnología extranjera. «Listo para usar», dijo Adina, DeepSeek funciona con estos chips.

La compañía también hizo público el código completo y las herramientas del modelo. Eso significa que cualquiera puede descargar, ejecutar, modificar o construir sobre V3.2-Exp. Este movimiento se alinea con la estrategia de código abierto de DeepSeek, pero plantea otro problema: las patentes. Dado que el modelo es abierto y la idea central, la atención dispersa, existe desde 2015, DeepSeek no puede bloquearla legalmente.

«El enfoque no es súper nuevo», dijo Ekaterina. Para ella, la única parte defendible de la tecnología es cómo DeepSeek elige qué mantener y qué ignorar.

Ahí es donde reside la verdadera competencia ahora. No solo en hacer modelos más inteligentes, sino en hacerlos más rápidos, más baratos y más ligeros, sin arruinar los resultados. Incluso DeepSeek llamó a esta versión «un paso intermedio hacia nuestra arquitectura de próxima generación», lo que sugiere que ya están trabajando en algo más grande.

Nick dijo que el modelo muestra que la eficiencia ahora es tan importante como la potencia bruta. Y Adina cree que la compañía tiene un juego a largo plazo en mente. «DeepSeek está jugando el juego largo para mantener a la comunidad invertida en su progreso», dijo. «La gente siempre buscará lo que es barato, confiable y efectivo.»

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Comparte este artículo
Jai Hamid

Jai Hamid

Jai Hamid ha estado cubriendo criptomonedas, mercados bursátiles, tecnología, la economía global y los eventos geopolíticos que afectan a los mercados durante los últimos 6 años. Ha trabajado con publicaciones centradas en blockchain, incluidas AMB Crypto, Coin Edition y CryptoTale, en análisis de mercado, grandes empresas, regulación y tendencias macroeconómicas. Se graduó en la London School of Journalism y ha compartido tres veces sus conocimientos sobre el mercado de criptomonedas en una de las principales cadenas de televisión de África.

MÁS … NOTICIAS