Qwen3 de Alibaba desplaza a R1 de DeepSeek, ahora lidera los modelos de IA de código abierto

- La familia de modelos de IA Qwen3 de Alibaba ha superado a R1 de DeepSeek para convertirse en el mejor modelo de código abierto del mundo en áreas como instrucción lingüística, matemáticas, programación y análisis de datos.
- Qwen3 es económico de usar porque solo cuesta 0,55 USD por cada 1 millón de tokens para ejecutarlo.
- Los fabricantes estadounidenses de chips Nvidia e Intel han comenzado a apoyar Qwen3.
La nueva familia de modelos de IA Qwen3 de Alibaba ha superado a R1 de DeepSeek para convertirse en el mejor modelo de código abierto del mundo. Según los informes, Qwen3 hizo mejor que R1 en pruebas que miden las capacidades de los modelos de IA de código abierto en áreas como instrucción de idiomas, matemáticas, programación y análisis de datos.
La familia Qwen3 fue lanzada la semana pasada por la unidad de computación en la nube de Alibaba. Tiene ocho modelos mejorados con entre 600 millones y 235 mil millones de parámetros. En el aprendizaje automático, los parámetros son las variables en un sistema de IA mientras se está entrenando.
Según La plataforma LiveBench, una plataforma independiente que prueba modelos de lenguaje grandes, antes de estas nuevas pruebas, R1 de DeepSeek había sido el mejor modelo de IA de código abierto del mundo desde que salió en enero. Pero ya no más.
Tanto empresas estadounidenses como chinas se apresuran a adoptar Qwen 3
El ascenso de Qwen3 en los rankings de LiveBench muestra lo rápido que se está desarrollando la IA en China. La industria tecnológica china ha crecido mucho gracias a las herramientas de código abierto. El código del método de código abierto de Alibaba ha permitido que otros desarrolladores de software de terceros compartan el diseño, corrijan enlaces rotos o hagan el programa más poderoso.
Sin embargo, los resultados generales de LiveBench mostraron que Qwen3 no era tan bueno como o3 de OpenAI, Gemini Pro 2.5 de Google y Claude 3.7 de Anthropic, que son los mejores modelos de IA de código cerrado del mundo. LiveBench dice que o3-mini, el modelo de IA más popular de OpenAI, fue el mejor en el mundo en general. Microsoft respalda a OpenAI.
Por cada 1 millón de tokens, cuesta 10 dólares ejecutar o3. Por otro lado, Qwen3 es más barato de usar porque solo cuesta 0,55 dólares por cada 1 millón de tokens para ejecutarlo. Debido a que Qwen3 es más barato y funciona mejor, muchas empresas dijeron que respaldarían el nuevo modelo de IA de Alibaba tan pronto como saliera a la luz.
Huawei Technologies, Moore Threads, Cambricon Technologies e Hygon Information Technology son todas empresas de chips que han dicho que apoyarán a Qwen3.
Cambricon dijo el martes pasado que había optimizado con éxito Qwen3 para ejecutarse rápidamente en sus unidades de procesamiento gráfico. Esto se hizo porque los desarrolladores de IA en Filipinas querían chips fabricados en China.
Qwen3 también se está utilizando en los servicios de computación en la nube de Hyperbolic y Fireworks.ai, dos empresas de infraestructura de IA. Los fabricantes de chips estadounidenses Nvidia e Intel han comenzado a apoyar a Qwen3.
Muchos grandes centros de datos en China, como los de Pekín, Shanghái, Hangzhou y las provincias de Hubei, Jilin y el noroeste de Shaanxi, también han dicho que utilizarán los modelos de IA Qwen de tercera generación de Alibaba. La Red de Supercomputación de China también ha adoptado Qwen3. Esta red conecta más de 20 centros de datos en 20 ciudades a lo largo de 14 provincias.
El CEO de Anthropic dice que DeepSeek fue "un poco exagerado"
En un evento empresarial, un cofundador de Anthropic, la empresa que creó los modelos de IA Claude, dijo que DeepSeek sigue "seis a ocho meses por detrás de donde están las empresas líderes de EE. UU.". También dijo que el reciente entusiasmo en torno a la startup china fue "quizás un poco exagerado".
DeepSeek llamó la atención en todo el mundo a finales de diciembre de 2024 y principios de enero de 2025 al compartir dos modelos de IA de código abierto avanzados, V3 y R1. Estos modelos se crearon con una fracción mínima del costo y la potencia de cómputo que las grandes empresas tecnológicas suelen necesitar para proyectos de LLM.
No está claro cuándo DeepSeek lanzará la próxima generación de sus modelos. La empresa con sede en Hangzhou lanzó discretamente su Prover-V2 de 671 mil millones de parámetros a finales de Abril. Esto fue una actualización de su modelo especializado para manejar pruebas matemáticas. Sin embargo, no ha dicho nada sobre el progreso de su largamente esperado modelo de razonamiento R2.
Las mentes más inteligentes del mundo cripto ya leen nuestro boletín. ¿Quieres unirte? Únete a ellos.
Aviso de responsabilidad. La información proporcionada no es un consejo de trading. Cryptopolitan.com no asumimos responsabilidad alguna por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente la investigación independiente y/o la consulta con un profesional calificado antes de tomar cualquier decisión de inversión.

Florence Muchai
Florence ha estado cubriendo durante los últimos 6 años noticias sobre criptomonedas, juegos, tecnología e inteligencia artificial. Sus estudios de Ciencias de la Computación en la Universidad de Ciencias y Tecnología de Meru y Gestión de Desastres y Diplomacia Internacional en MMUST la dotan adecuadamente de habilidades lingüísticas, de observación y técnicas. Florence ha trabajado en VAP Group y como editora en varias casas de medios de criptomonedas.
















