Story
Oktober 1, 2026

OpenAI erklärt verborgenes Schlussfolgern zum neuen Ziel im KI-Sicherheitswettlauf

OpenAI stellt die Operation im Juli als einen ernsthaften, sich weiterentwickelnden Versuch dar, Fähigkeiten von Modellen an der KI-Spitze ohne deren Schutzvorkehrungen zu kopieren, während seine Zuschreibung bewusst eng gefasst bleibt: Ein zentraler Cluster, nicht jeder Akteur, wurde mit Personen mit Verbindungen zu Moonshot AI in Verbindung gebracht.

OpenAI erklärt, die Kampagne habe am 1. Juli unauffällig begonnen, als Akteure damit anfingen, Wege zu testen, „geschütztes Schlussfolgern“ — das interne Arbeitsprotokoll des Modells — in sichtbare Antworten zu übertragen. Das Unternehmen bezeichnet diese Praxis als adversariale Destillation: die Nutzung der Ausgaben oder des Schlussfolgerns eines Modells, um ein anderes System ohne Genehmigung zu trainieren, nachzubilden oder zu verbessern.

Die Operation beschleunigte sich dann. OpenAI erklärt, es habe am 24. und 25. Juli Spitzen bei hohen Anfragevolumina beobachtet, mit 16.000 Anfragen nach Extraktionsmustern von mehr als 4.000 Nutzern. Die Untersuchung identifizierte letztlich damit verbundene Aktivitäten in einem Cluster von mehr als 15.000 Nutzern, das nach Angaben des Unternehmens bis zum 28. Juli vollständig unterbunden wurde.

Laut OpenAI knackten die Akteure weder Verschlüsselung noch drangen sie in eine Datenbank ein oder erlangten direkt gespeicherte Konversationen. Stattdessen manipulierten sie angeblich Interaktionen — bei einer Methode wurde verschlüsseltes Schlussfolgern aus einem Chat kopiert und ein Modell in einem anderen Chat gebeten, es zu entschlüsseln und zu transkribieren. Unabhängige Forscher hatten laut OpenAI separat auf verwandte Schwachstellen zwischen Modellen und bei der Komprimierung von Konversationen hingewiesen und dem Unternehmen damit geholfen, die breitere Angriffsklasse einzuordnen.

Das Unternehmen erklärt, es habe den Wiederholungspfad geschlossen, die Prüfungen der Ausgaben verschärft, betrügerische Konten gesperrt oder eingeschränkt und sich mit Drittanbietern koordiniert. Zudem teilte es Erkenntnisse mit dem Frontier Model Forum und über Regierungskanäle und argumentierte, dass übertragbare oder wiederholbare Schlussfolgerungsartefakte ähnliche Risiken für fortgeschrittene KI-Systeme schaffen könnten.

Die Zuschreibung ist der politisch heikelste Teil der Offenlegung. OpenAI erklärt, es könne nicht feststellen, ob jeder Akteur von derselben Partei stamme, führt aber einen „zentralen Cluster“ auf Personen mit Verbindungen zu Moonshot AI zurück, dem chinesischen Entwickler hinter Kimi. Ein Bericht über die Ankündigung stellt fest, dass Anthropic ähnliche Vorwürfe gegen Moonshot erhoben hat.

OpenAIs umfassendere Warnung lautet, dass gestohlenes Schlussfolgern fortgeschrittene Fähigkeiten übertragen könnte, ohne die Sicherheitsbeschränkungen für öffentlich sichtbare Antworten mitzuübertragen. Mit zunehmender Leistungsfähigkeit der Modelle würden Versuche, verborgenes Schlussfolgern in eine Abkürzung zu verwandeln, nur noch ausgefeilter werden.