Le responsable de la sécurité en IA d'Anthropic affirme qu'il y a plus de 10 % de chances que l'humanité soit anéantie

- Selon Evan Hubinger d'Anthropic, l'IA a plus de 10 % de chances d'anéantir l'humanité au cours de la prochaine décennie.
- Jacob Coxon a quitté Anthropic et a déclaré que les principaux laboratoires d'IA prenaient des risques dangereux avec la superintelligence auto-améliorante.
- Anthropic indique que Claude a atteint un taux de réussite de 76 % sur ses tâches ouvertes les plus difficiles en mai 2026.
Evan Hubinger, responsable scientifique de l'alignement anthropique, affirme que l'intelligence artificielle a plus de 10 % de chances d'anéantir l'humanité au cours de la prochaine décennie.
Son estimation est intervenue mardi, quelques heures après que le chercheur Jacob Coxon a annoncé sa démission d'Anthropic et accusé Anthropic et OpenAI de prendre des risques inacceptables dans leur quête de systèmestronpuissants. Jacob a écrit sur X : « Ils foncent droit vers une superintelligence auto-améliorante et jouent avec nos vies. »
Selon Jacob, les développeurs de cette technologie entrevoient un risque que cela se produise avant même 2030. Il a souligné que l'IA future pourrait très rapidement surpasser les pirates informatiques humains, transformer les industries et avoir accès aux financements et aux ressources.
Des chercheurs en anthropologie ont chiffré le risque d'extinction alors que les laboratoires d'IA s'orientent vers des systèmes d'auto-amélioration
Evan a répondu que l'avertissement de Jacob était correct et a déclaré qu'Anthropic n'avait aucun moyen de maintenir la superintelligence alignée sur les objectifs humains.
« Jacob a raison sur ce point : nous croyons vraiment sincèrement que l'IA pourrait exterminer toute l'humanité ! Personnellement, je pense que ce chiffre dépassera les 10 % d'ici dix ans. Je crois qu'Anthropic fait de son mieux, mais nous n'avons pas encore de plan pour résoudre le problème de l'alignement pour la superintelligence et nous ne sommes pas clairement sur trac», a écrit Evan.
Evan a déclaré par la suite que le danger que représentent les modèles actuels est « faible ». Ce qui l'inquiète, c'est l'amélioration continue, un système qui perfectionne sans cesse ses propres capacités avec une intervention humaine minimale. Cette capacité n'existe pas encore, même si les laboratoires d'IA y travaillent. Il a ajouté que la superintelligence qui émerge de ce processus progresse plus vite que prévu.
Anthropic avait déjà lancé un avertissement similaire en juin, déclarant que « l’amélioration récursive complète pourrait également accroître les risques de perte de contrôle des systèmes d’IA par l’humain ». L’entreprise ajoutait : « Si les systèmes sont capables de construire entièrement leurs propres successeurs, les moyens de les sécuriser, de les surveiller et de façonner leur comportement deviennent d’autant plus importants. »
Anthropic et OpenAI lèvent des fonds en vue de leur introduction en bourse. Aucune des deux entreprises n'a immédiatement répondu à la demande de commentaires de CNBC.
Elon Musk, PDG de Tesla (NASDAQ : TSLA) et de SpaceX (SPCX), met en garde depuis des années contre les menaces que l’IA pourrait représenter pour l’humanité. Des chercheurs et des universitaires ont également exprimé des inquiétudes quant à la perte de contrôle des entreprises.
Ces craintes se sont ravivées après qu'un d'OpenAI a pénétré Hugging Face, une plateforme de développement open source, en juillet. Jacob a qualifié cedentde « signaux d'alarme » et a déclaré qu'ils rendaient les accords entre les laboratoires américains plus réalistes. Cela l'a rendu plus optimiste quant à la coordination américaine, mais il s'attend toujours à ce qu'une course mondiale à l'IA soit difficile à arrêter.
« Je n’ai pas l’impression que nous soyons sur tracpour empêcher une course mondiale, ce qui pourrait nécessiter des mesures coûteuses comme une interdiction temporaire d’améliorer les capacités des modèles », a déclaré Jacob.
Les progrès de Claude en matière de codage modifient la façon dont Anthropic teste ses logiciels et vérifie le travail de ses propres ingénieurs
Anthropic a indiqué que Claude avait achevé 76 % de ses tâches les plus complexes et à durée indéterminée en mai 2026, soit une hausse de 50 points de pourcentage en six mois.
Un exemple parmi d'autres : une mise à jour de routine a provoqué le plantage de dizaines de milliers de tâches d'entraînement. Un ingénieur a alors fourni à Claude des explications écrites et un accès au cluster de calcul en production.
Claude a vérifié les tâches en cours, testé chaque paramètre d'environnement un par un et a tracla cause de la panne : un indicateur de débogage peu connu. Il a reproduit le problème, prouvé sa cause et confirmé une solution en deux heures environ. Anthropic a indiqué que ce même travail prendrait généralement deux à trois jours à un ingénieur.
L'entreprise évalue également la capacité de Claude à écrire du code compréhensible et exploitable par d'autres ingénieurs. Les avis divergent quant à cette comparaison. Fin 2025, beaucoup estimaient que le code de Claude était inférieur à celui des humains chez Anthropic. L'entreprise affirme désormais que la qualité est globalement équivalente et prévoit que Claude progressera d'ici un an.
Ces progrès ont modifié le processus de révision interne d'Anthropic. Les modifications de code proposées sont désormais vérifiées par un outil automatisé, Claude, avant leur intégration. Ce dernier recherche les bogues, les failles de sécurité et autres anomalies.
Un test rétrospectif a révélé qu'un examen systématique de chaque modification passée aurait permis de détecter environ un tiers des bogues à l'origine desdentClaude antérieurs avant la mise en production. Anthropic a indiqué que le code original provenait d'ingénieurs considérés comme parmi les meilleurs au monde dans la conception de ces systèmes, et pourtant Claude a mis en évidence des erreurs qui leur avaient échappé.
Anthropic a formulé la comparaison ainsi : « Le code écrit par Claude était légèrement moins bon que le code écrit par des humains chez Anthropic fin 2025, il est aujourd’hui à peu près équivalent, et nous prévoyons qu’il sera nettement meilleur d’ici la fin de l’année. »
Si vous lisez ceci, vous avez déjà une longueur d'avance. Restez-y grâce à notre newsletter.

Jai Hamid
Jai Hamid couvre l'actualité des cryptomonnaies, des marchés boursiers, des technologies, de l'économie mondiale et des événements géopolitiques qui influencent les marchés depuis six ans. Elle a collaboré avec des publications spécialisées dans la blockchain, telles que AMB Crypto, Coin Edition et CryptoTale, sur des analyses de marché, des sujets liés aux grandes entreprises, à la réglementation et aux tendances macroéconomiques. Diplômée de la London School of Journalism, elle a également présenté à trois reprises son expertise du marché des cryptomonnaies sur l'une des principales chaînes de télévision africaines.
















