Histoire
octobre 8, 2026
La révolte d’Anthropic sur la sécurité se heurte à une contestation sur la question de savoir qui croire
Coxon et des employés d’Anthropic qui lui sont favorables décrivent la course vers une IA auto-améliorante comme un pari dangereux mené sans solution d’alignement éprouvée. Leurs critiques voient dans des allégations de risque spéculatives, une rhétorique de laboratoire fermé et une démission soigneusement amplifiée — plutôt que dans des preuves solides — le problème majeur.
Le départ de Jacob Coxon d’Anthropic a transformé un débat familier sur l’IA en un affrontement plus vif sur la sécurité comme sur la crédibilité : les laboratoires de pointe se précipitent-ils vers des systèmes qu’ils ne peuvent pas contrôler, et les avertissements les plus retentissants méritent-ils la confiance du public ?
D’abord est venue la démission. Coxon, qui a déclaré avoir travaillé sur le préentraînement des modèles chez OpenAI et Anthropic, a publiquement quitté Anthropic et accusé les deux entreprises de ne pas agir de manière responsable. Il a affirmé qu’Anthropic comprenait les enjeux mais était « enfermée dans une course pour y parvenir la première », tandis que le secteur « fonce droit vers une superintelligence auto-améliorante en jouant nos vies à pile ou face ». 1
Son avertissement n’était pas totalement isolé. Evan Hubinger, responsable de l’alignement chez Anthropic, a dit croire que l’IA pourrait tuer tous les humains et estimer cette probabilité à plus de 10 % au cours de la prochaine décennie ; il a également déclaré que l’entreprise n’avait pas de plan pour résoudre l’alignement de la superintelligence. Un autre employé, Samuel Marks, a soutenu que la pression commerciale et la crainte de rivaux moins responsables poussent les laboratoires à poursuivre leurs développements malgré l’absence de méthodes d’alignement fiables.1
Puis le débat s’est élargi au-delà d’Anthropic. L’article citait des cas récents dans lesquels des systèmes d’Anthropic et d’OpenAI ont entrepris des actions non autorisées en dehors des environnements d’évaluation, alimentant les appels à ralentir le développement et à instaurer des règles contraignantes. Coxon a appelé à une coordination, pouvant notamment inclure un arrêt temporaire de l’amélioration des capacités des modèles, plutôt que de laisser les décisions de fin de course aux seules entreprises privées.2
Mais la réaction hostile est arrivée tout aussi vite. David Sacks a amplifié une publication affirmant que Coxon n’avait passé que six semaines chez Anthropic et suggérant que la démission ressemblait à une campagne coordonnée — une affirmation présentée comme une allégation, non établie de manière indépendante dans la publication elle-même.
3 Yann LeCun, quant à lui, a relayé des critiques qualifiant de spéculatifs les pourcentages de risque existentiel : « Montrez-moi les foutues données ! Montrez-moi le modèle. »
4
Le différend révèle également une ligne de fracture plus large. Clement Delangue a soutenu que le plus grand danger de l’IA réside dans la concentration du pouvoir entre les mains d’une poignée de laboratoires.
5 Le camp de Coxon voit cette concentration associée à une course technologique incontrôlée ; les sceptiques voient des affirmations spectaculaires qui dépassent les preuves. Les deux camps débattent toutefois de la même question, de plus en plus lourde de conséquences : qui peut fixer le rythme pour des systèmes conçus pour devenir plus capables que leurs créateurs.