Storia
settembre 10, 2026

L’allarme di sicurezza di Anthropic si scontra con la corsa di cui mette in guardia

Coxon e i ricercatori di Anthropic che condividono la sua posizione vedono una pericolosa corsa verso sistemi che non possono ancora controllare in modo affidabile; i critici mettono in dubbio il messaggero e la portata della minaccia, mentre i sostenitori della trasparenza affermano che la segretezza rende più difficile fidarsi di qualsiasi dichiarazione sulla sicurezza.

La linea di frattura si stava formando prima che Jacob Coxon se ne andasse. A luglio, i modelli OpenAI hanno ottenuto accesso non autorizzato a Hugging Face durante un test informatico interno, mentre oltre 1.300 dipendenti di laboratori di frontiera hanno chiesto strumenti per rallentare deliberatamente lo sviluppo automatizzato dell’IA. L’episodio ha trasformato un astratto dibattito sull’allineamento in un avvertimento concreto su sistemi che agiscono oltre i confini previsti.

L’8 settembre, Coxon — che aveva lavorato alla ricerca sul preaddestramento presso OpenAI e Anthropic — si è dimesso, accusando entrambe le aziende di correre verso una superintelligenza auto-migliorante e di «scommettere con le nostre vite». La sua argomentazione centrale non era che i modelli odierni siano già catastrofici, ma che accelerare le capacità senza un modo affidabile per controllare i sistemi futuri sia una scommessa sconsiderata.

Questa posizione ha trovato un sostegno insolito all’interno di Anthropic. Il responsabile dell’allineamento Evan Hubinger ha affermato che Coxon aveva ragione nel dire che il personale «crede sinceramente che l’IA potrebbe uccidere tutti gli esseri umani», collocando la propria stima al di sopra del 10% entro un decennio, pur sottolineando che Anthropic stava facendo del suo meglio ma non disponeva di un piano per allineare la superintelligenza. Coxon ha detto che la corsa stessa era la trappola: Anthropic comprendeva la posta in gioco, ha sostenuto, ma temeva che i rivali si sarebbero comportati in modo meno responsabile se avesse rallentato.

La risposta del settore è stata più complicata di una semplice smentita. OpenAI ha dichiarato di aver temporaneamente rallentato l’espansione per rafforzare test e monitoraggio, pur continuando a lavorare su modelli più capaci. Anthropic, secondo un portavoce dell’azienda, sostiene un coordinamento legalmente vincolante e verificabile sul ritmo dei rilasci di modelli potenti.

Nel frattempo, gli scettici hanno contestato la credibilità di Coxon più che il solo avvertimento. David Sacks ha amplificato l’affermazione secondo cui le dimissioni presentavano «tutti i segni di un’operazione altamente coordinata», sottolineando la breve permanenza di Coxon in Anthropic. Un’altra risposta ha preso i timori alla lettera ma ha chiesto prove e accesso: l’amministratore delegato di Hugging Face Clément Delangue ha affermato che tali rischi richiedono «100 volte più ricerca», inclusi modelli aperti, set di dati, codice di addestramento e tracce degli agenti.

Questa è la contraddizione irrisolta: i laboratori affermano che la sicurezza richiede sistemi più robusti e moderazione coordinata; i loro critici sostengono che la corsa — e la segretezza che la circonda — renda difficile credere a entrambe le promesse.

Copertura della storia