Cientistas pedem divulgação mais rigorosa de IA em meio à explosão de “lixo” em artigos

Foto de Solen Feyissa em Unsplash.
-
Artigos e revisões gerados por IA estão inundando grandes conferências e prejudicando a confiança na pesquisa científica.
-
Estudos revelam que uma porcentagem de dois dígitos dos artigos e avaliações agora depende fortemente de ferramentas de IA.
-
Conferências como NeurIPS e ICLR estão endurecendo as regras de divulgação e penalizando o uso inadequado de IA.
Cientistas que trabalham no interior do mundo da investigação de IA estão a enfrentar um problema de credibilidade que já não podem ignorar.
Grandes conferências focadas na investigação de IA reagiram depois de os sistemas de revisão ficarem entupidos com submissões fracas.
Os organizadores observaram um aumento acentuado em artigos e revisões por pares produzidos com pouco esforço humano. A preocupação não é o estilo. A preocupação é a precisão. Erros estão se infiltrando em lugares onde a precisão antes importava.
Conferências endurecem regras enquanto artigos de baixa qualidade sobrecarregam os revisores
Pesquisadores alertaram cedo que o uso descontrolado de ferramentas automatizadas de escrita poderia prejudicar a área. Inioluwa Deborah Raji, pesquisadora de IA na Universidade da Califórnia, Berkeley, disse que a situação se tornou caótica rapidamente.
“Há um pouco de ironia no fato de haver tanto entusiasmo pela IA moldando outros campos quando, na realidade, nosso campo passou por essa experiência caótica devido ao uso generalizado da IA”, disse ela.
Dados concretos mostram o quão generalizado o problema se tornou. Um estudo da Universidade de Stanford, publicado em agosto, descobriu que até 22% dos artigos de ciência da computação apresentavam sinais de uso de modelos de linguagem grandes.
A Pangram, uma start-up de análise de texto, reverteu submissões e revisões por pares na Conferência Internacional sobre Representações de Aprendizagem em 2025. Estimou que 21 por cento das revisões foram totalmente geradas por IA, enquanto mais de metade usou-a para tarefas como edição. A Pangram também descobriu que 9 por cento dos artigos submetidos tinham mais de metade do seu conteúdo produzido desta forma.
O problema atingiu um ponto de inflexão em novembro. Revisores do ICLR sinalizaram um artigo suspeito de ter sido gerado por IA que ainda estava classificado entre os 17% melhores com base nas pontuações dos revisores. Em janeiro, a empresa de detecção GPTZero relatou mais de 100 erros automatizados em 50 artigos apresentados no NeurIPS, amplamente considerado o principal fórum para pesquisa avançada na área.
À medida que as preocupações cresciam, a ICLR atualizou as suas regras de uso antes da conferência. Os artigos que não revelarem o uso extensivo de modelos de linguagem agora enfrentam rejeição. Os revisores que submeterem avaliações de baixa qualidade criadas com automação correm o risco de penalizações, incluindo o declínio dos seus próprios artigos.
Hany Farid, professor de ciência da computação na Universidade da Califórnia, Berkeley, disse: “Se você está publicando artigos de qualidade muito baixa que estão simplesmente errados, por que a sociedade deveria confiar em nós como cientistas?”
O volume de artigos aumenta enquanto a detecção luta para acompanhar
De acordo com o relatório, o NeurIPS recebeu 21.575 artigos em 2025, um aumento em relação aos 17.491 de 2024 e aos 9.467 de 2020. Um autor submeteu mais de 100 artigos em um único ano, muito além do que é típico para um único pesquisador.
Thomas G. Dietterich, professor emérito da Universidade Estadual do Oregon e presidente da seção de ciência da computação do arXiv, disse que os uploads para o repositório aberto também aumentaram drasticamente.
Ainda assim, os pesquisadores dizem que a causa não é simples. Alguns argumentam que o aumento vem do ingresso de mais pessoas na área. Outros dizem que o uso intenso de ferramentas de IA desempenha um papel importante. A detecção permanece difícil porque não há um padrão compartilhado para identificar texto automatizado. Dietterich disse que sinais de alerta comuns incluem referências inventadas e figuras incorretas. Autores pegos fazendo isso podem ser banidos temporariamente do arXiv.
A pressão comercial também está em segundo plano. Demonstrações de alto perfil, salários em alta e competição agressiva levaram partes do campo a focar na quantidade. Raji disse que momentos de hype atraem pessoas de fora buscando resultados rápidos.
Ao mesmo tempo, os pesquisadores dizem que alguns usos são legítimos. Dietterich observou que a qualidade da escrita em artigos da China melhorou, provavelmente porque as ferramentas de linguagem ajudam a reescrever o inglês com mais clareza.
A questão agora estende-se para além da publicação. Empresas como a Google, Anthropic e OpenAI promovem os seus modelos como parceiros de investigação que podem acelerar a descoberta em áreas como as ciências da vida. Estes sistemas são treinados em texto académico.
Farid alertou que, se os dados de treinamento incluírem material sintético demais, o desempenho do modelo pode degradar. Estudos anteriores mostram que os modelos de linguagem grandes podem colapsar em nonsense quando alimentados com dados automatizados não curados.
Farid disse que as empresas que raspam pesquisas têm fortes incentivos para saber quais artigos foram escritos por humanos. Kevin Weil, chefe de ciência da OpenAI, disse que as ferramentas ainda exigem verificações humanas. “Pode ser um acelerador massivo”, disse ele. “Mas você tem que verificar. Isso não o absolve do rigor.”
Se você está lendo isso, já está à frente. Mantenha-se assim com nosso boletim informativo.

Jai Hamid
Jai Hamid cobre criptomoedas, mercados de ações, tecnologia, economia global e eventos geopolíticos que afetam os mercados há 6 anos. Ela trabalhou com publicações focadas em blockchain, incluindo AMB Crypto, Coin Edition e CryptoTale, em análises de mercado, grandes empresas, regulamentação e tendências macroeconômicas. Formada na London School of Journalism, ela compartilhou insights sobre o mercado de criptomoedas três vezes em uma das principais redes de TV da África.
















