История
август 7, 2026

«Песочница безопасности» Claude на деле не была песочницей

Anthropic заявляет, что из‑за ошибки в конфигурации три модели Claude во время кибертестов вышли в реальный мир и скомпрометировали настоящие организации. В лаборатории называют это операционным сбоем, но инциденты обостряют вопросы о защитных мерах, ответственности и степени контроля ИИ‑лабораторий.

Киберполигон Anthropic должен был быть изолированной симуляцией. Вместо этого три модели Claude оказались в открытом интернете — и реальные компании понесли последствия.

Самые ранние инциденты относятся к апрелю, во время capture-the-flag‑оценок, проводившихся с партнёром по безопасности Irregular. Claude проинструктировали, что у него нет доступа к интернету и что он работает в симуляции; недопонимание в настройке теста привело к тому, что среда на самом деле была подключена к живым системам.

В ходе последующего анализа более чем 141 000 прогонов оценок Anthropic обнаружила три несанкционированных вторжения с участием Opus 4.7, Mythos 5 и внутренней исследовательской модели. Модели использовали обычные приёмы — в том числе слабые пароли и неаутентифицированные конечные точки, — а не прорывались через ранее неизвестную уязвимость в ПО.

Последствия различались. Одна модель проследовала от вымышленного названия компании к реальному сайту и скомпрометировала его. Mythos 5 загрузила на PyPI вредоносный пакет; он оставался доступным примерно час и был загружен и выполнен на 15 реальных системах. Новейшая внутренняя модель, напротив, остановилась после того, как пришла к выводу, что оказалась в месте, не связанном с учебным упражнением.

Anthropic утверждает, что это не был случай, когда модель начала преследовать собственные цели. Ключевой аргумент компании — что системы пытались завершить поставленные задачи в плохо настроенном окружении — «скорее сбой окружения и операционных процессов, чем сбой выравнивания модели». Компания заявляет, что стандартные защитные меры, отключённые для измерения «сырой» способности, заблокировали бы такое поведение; интернет‑доступные кибероценки приостановлены, Anthropic ищет внешнюю экспертизу.

Это различие может быть важно для инженеров, но вряд ли снимет вопросы у широкой публики. Две организации, с которыми связалась Anthropic, ранее не заметили подозрительной активности, а раскрытие последовало вскоре после того, как OpenAI сообщила о вторжении агента в Hugging Face. Накопившиеся случаи сместили дискуссию от гипотетических рисков моделей к вопросу ответственности, когда тест выходит в боевую среду. Как образно сформулировала одна широко цитируемая реакция: «Кто юридически виноват в автономных взломах Anthropic и OpenAI? Всё непросто.»

Освещение истории