OpenAI sigue probando modelos propietarios en matemáticas a pesar de la solicitud de sus asesores

- OpenAI publicó 719 manuscritos de matemáticas de un modelo interno no lanzado en GitHub el 6 de octubre.
- Su grupo asesor había solicitado el 29 de septiembre a los laboratorios que dejaran de probar problemas avanzados de matemáticas en modelos propietarios.
- Un estudio reveló que el código Lean de OpenAI para su demostración de Navier-Stokes prueba afirmaciones más débiles que la versión escrita.
El 6 de octubre, OpenAI subió 719 artículos de matemáticas procedentes de un modelo interno no lanzado a GitHub.
Una semana antes, su propio grupo asesor había pedido a los laboratorios que dejaran de probar problemas avanzados de matemáticas en modelos propietarios.
Más de 600 respuestas a una encuesta dieron forma a las directrices del panel del IAS el 29 de septiembre
El Grupo Asesor de Matemáticas e Inteligencia Artificial está basado en el Instituto de Estudios Avanzados de Princeton, Nueva Jersey. El 29 de septiembre publicó recomendaciones fundamentadas en más de 600 respuestas a una encuesta.
«Queremos dejar claro desde el principio: no respaldamos esta práctica y les pedimos que dejen de probar problemas matemáticos avanzados en modelos propietarios», escribió el grupo.
El mismo documento advierte que los modelos internos privados corren el riesgo de crear un sistema de dos niveles donde los laboratorios superen al resto del campo.
Como parte del desarrollo del modelo, OpenAI indica en su repositorio que prueba sus modelos con problemas de investigación abiertos. Amplió estas pruebas después de que sus benchmarks matemáticos existentes se saturaran.
OpenAI dijo que consultó con el grupo y tuvo en cuenta sus recomendaciones para la publicación. En un comunicado emitido el 6 de octubre, el grupo señaló que su papel como asesor no constituye «un respaldo del proceso mediante el cual OpenAI los obtuvo».
El grupo encomendó a la comunidad matemática en general la evaluación del cumplimiento de los criterios establecidos.
El código Lean de Navier-Stokes demuestra afirmaciones más débiles que las contenidas en el artículo escrito
OpenAI agrupó los 719 artículos en 372 familias matemáticas, cada una centrada en un resultado principal y sus demostraciones relacionadas. Se proporcionaron al modelo propietario aproximadamente 4.000 problemas, y cada resultado requirió, en promedio, unas tres horas de potencia computacional de tipo "thinking" de ChatGPT Pro.
El grupo solicitó a los laboratorios de IA que publicaran el nombre del modelo, los prompts, un resumen de la cadena de pensamiento, el tiempo empleado y el coste computacional para cada resultado.
OpenAI publicó 10 resúmenes de razonamiento, y alrededor del 42% de los resultados principales cuentan con formalizaciones en Lean.
Lean es un lenguaje de programación que permite verificar una demostración mediante un ordenador. Que el código se compile no significa necesariamente que el código y el argumento escrito sean idénticos; solo indica que la declaración formalizada es verdadera.
Alexander Bastounis, Fabian Circelli y Anders C. Hansen examinaron esa brecha en un artículo publicado el 6 de octubre. Descubren que el artículo escrito sobre Navier-Stokes de OpenAI hace afirmaciones más fuertes que las demostradas por su código Lean, y una estimación cambia el orden de las derivadas de entrada.
Los autores detectaron traducciones erróneas similares en la demostración de Euler de OpenAI. Escribieron que «la demostración escrita de OpenAI y otras demostraciones formalizadas automáticamente en Lean no deben confiarse a primera vista sin el mismo proceso de revisión por pares y escrutinio al que se someten otras demostraciones».
El resultado sobre Navier-Stokes fue anunciado por OpenAI el 8 de septiembre. Según Cryptopolitan, el matemático de la NYU Tristan Buckmaster cuestionó entonces su descripción de la mínima intervención humana implicada en el trabajo.
La empresa se comprometió a aportar fondos para talleres, conferencias y programas especiales sobre los principales resultados de IA.
El 6 de octubre, Terence Tao escribió que los creadores de prompts de IA suelen resolver problemas y luego pierden interés en el campo. Muchos no pueden responder preguntas ni dar charlas sobre el resultado, escribió. Su publicación no nombraba a OpenAI.
La empresa ha dicho que sus asesores no tienen voz ni voto sobre el ritmo de su investigación, informó Cryptopolitan en septiembre.
Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.
Preguntas frecuentes
¿Qué lanzó OpenAI el 6 de 2026?
719 manuscritos matemáticos de un modelo interno no publicado, con formalizaciones en Lean para aproximadamente el 42% de los resultados principales.
¿Qué pidió el grupo asesor a OpenAI que hiciera?
Dejar de probar problemas matemáticos avanzados en modelos propietarios y publicar los prompts y la cadena de pensamiento resumida de cada resultado.
¿Por qué están preocupados los matemáticos por la demostración de Navier-Stokes?
Un estudio encontró que el código Lean de OpenAI demuestra enunciados más débiles que su demostración escrita, y cambia el orden de una derivada en una estimación.
Descargo de responsabilidad. La información proporcionada no constituye asesoramiento financiero. Cryptopolitan.com no asume ninguna responsabilidad por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente realizar una investigación independiente y/o consultar con un profesional calificado antes de tomar cualquier decisión de inversión.

Randa Moses
Randa Moses es editora y reportera en Cryptopolitan, donde cubre tecnología, IA, robótica, criptomonedas, estafas y ciberataques. Ha trabajado en el espacio de las criptomonedas desde 2017. Ocupó cargos en Forward Protocol, AmaZix y Cryptosomniac. Randa posee un grado en Ingeniería Eléctrica y Electrónica de la Universidad de Bradford.
















