Los científicos exigen una divulgación más estricta de la IA ante la explosión de "basura" en los artículos

Foto de Solen Feyissa en Unsplash.
-
Los artículos y revisiones generados por IA están inundando las principales conferencias y dañando la confianza en la investigación científica.
-
Los estudios encontraron que ahora un porcentaje de dos dígitos de los artículos y reseñas dependen en gran medida de las herramientas de IA.
-
Conferencias como NeurIPS e ICLR están endureciendo las normas de divulgación y penalizando el uso de baja calidad de la IA.
Los científicos que trabajan dentro del mundo de la investigación de la IA están enfrentando un problema de credibilidad que ya no pueden ignorar.
Las principales conferencias centradas en la investigación de la IA reaccionaron después de que los sistemas de revisión se saturaran con presentaciones débiles.
Los organizadores observaron un aumento pronunciado en artículos y revisiones por pares producidos con poco esfuerzo humano. La preocupación no es el estilo. La preocupación es la precisión. Los errores se están colando en lugares donde la precisión solía importar.
Las conferencias endurecen las normas mientras los artículos de baja calidad abrumaban a los revisores
Los investigadores advirtieron temprano que el uso descontrolado de herramientas de escritura automatizada podría dañar el campo. Inioluwa Deborah Raji, una investigadora de IA en la Universidad de California, Berkeley, dijo que la situación se volvió caótica rápidamente.
"Hay un poco de ironía en el hecho de que haya tanto entusiasmo por la IA dando forma a otros campos cuando, en realidad, nuestro campo ha pasado por esta experiencia caótica debido al uso generalizado de la IA", dijo.
Los datos duros muestran cuán generalizado se convirtió el problema. Un estudio de la Universidad de Stanford publicado en agosto encontró que hasta el 22 por ciento de los artículos de ciencias de la computación mostraban signos de uso de modelos de lenguaje grande.
Pangram, una start-up de análisis de texto, revisó las presentaciones y las revisiones por pares en la Conferencia Internacional sobre Representaciones de Aprendizaje en 2025. Estimó que el 21 por ciento de las revisiones fueron generadas completamente por IA, mientras que más de la mitad la utilizó para tareas como la edición. Pangram también encontró que el 9 por ciento de los artículos presentados tenían más de la mitad de su contenido producido de esta manera.
El problema alcanzó un punto de inflexión en noviembre. Los revisores de ICLR marcaron un artículo sospechoso de haber sido generado por IA que aún así se clasificó en el top 17 por ciento según las puntuaciones de los revisores. En enero, la firma de detección GPTZero reportó más de 100 errores automatizados en 50 artículos presentados en NeurIPS, ampliamente considerado como el principal foro para la investigación avanzada en el campo.
A medida que crecían las preocupaciones, ICLR actualizó sus normas de uso antes de la conferencia. Los artículos que no revelen un uso extensivo de modelos de lenguaje ahora enfrentan el rechazo. Los revisores que presenten evaluaciones de baja calidad creadas con automatización corren el riesgo de sanciones, incluido el rechazo de sus propios artículos.
Hany Farid, profesor de ciencias de la computación en la Universidad de California, Berkeley, dijo: "Si estás publicando artículos de muy baja calidad que simplemente están equivocados, ¿por qué debería la sociedad confiar en nosotros como científicos?"
Los volúmenes de artículos se disparan mientras la detección lucha por mantenerse al día
Según el informe, NeurIPS recibió 21,575 artículos en 2025, en comparación con los 17,491 de 2024 y los 9,467 de 2020. Un autor presentó más de 100 artículos en un solo año, muy por encima de lo típico para un solo investigador.
Thomas G. Dietterich, profesor emérito de la Universidad Estatal de Oregón y presidente de la sección de ciencias de la computación de arXiv, dijo que las subidas al repositorio abierto también aumentaron drásticamente.
Aún así, los investigadores dicen que la causa no es simple. Algunos argumentan que el aumento proviene de más personas que ingresan al campo. Otros dicen que el uso intensivo de herramientas de IA juega un papel importante. La detección sigue siendo difícil porque no hay un estándar compartido para identificar texto automatizado. Dietterich dijo que las señales de advertencia comunes incluyen referencias inventadas y cifras incorrectas. Los autores atrapados haciendo esto pueden ser prohibidos temporalmente de arXiv.
La presión comercial también está en segundo plano. Las demostraciones de alto perfil, los salarios en aumento y la competencia agresiva han empujado a partes del campo a centrarse en la cantidad. Raji dijo que los momentos de hype atraen a personas externas buscando resultados rápidos.
Al mismo tiempo, los investigadores dicen que algunos usos son legítimos. Dietterich señaló que la calidad de la escritura en los artículos de China ha mejorado, probablemente porque las herramientas de lenguaje ayudan a reescribir el inglés con mayor claridad.
El problema ahora se extiende más allá de la publicación. Empresas como Google, Anthropic y OpenAI promocionan sus modelos como socios de investigación que pueden acelerar el descubrimiento en áreas como las ciencias de la vida. Estos sistemas están entrenados con texto académico.
Farid advirtió que si los datos de entrenamiento incluyen demasiado material sintético, el rendimiento del modelo puede degradarse. Estudios anteriores muestran que los modelos de lenguaje grande pueden colapsar en tonterías cuando se les alimenta con datos automatizados no curados.
Farid dijo que las empresas que extraen investigación tienen fuertes incentivos para saber qué artículos son escritos por humanos. Kevin Weil, jefe de ciencia en OpenAI, dijo que las herramientas aún requieren verificaciones humanas. "Puede ser un acelerador masivo", dijo. "Pero tienes que verificarlo. No te exime del rigor".
Las mentes más inteligentes del mundo cripto ya leen nuestro boletín. ¿Quieres unirte? Únete a ellos.

Jai Hamid
Jai Hamid ha estado cubriendo criptomonedas, mercados bursátiles, tecnología, la economía global y los eventos geopolíticos que afectan a los mercados durante los últimos 6 años. Ha trabajado con publicaciones centradas en blockchain, incluidas AMB Crypto, Coin Edition y CryptoTale, en análisis de mercado, grandes empresas, regulación y tendencias macroeconómicas. Se graduó en la London School of Journalism y ha compartido tres veces sus conocimientos sobre el mercado de criptomonedas en una de las principales cadenas de televisión de África.
















