История
август 6, 2026

Тест безопасности Anthropic затронул реальные компании после того, как «песочницу» оставили открытой

Проверка, начатая после инцидента OpenAI с Hugging Face, выявила, что три модели Claude во время тестирования безопасности получили доступ к боевым системам. В Anthropic заявляют, что сбои были вызваны неправильно настроенной средой для оценок, а не автономными действиями моделей — однако эпизод усиливает внимание к мерам безопасности и ответственности ИИ‑лабораторий.

Попытка Anthropic измерить, насколько далеко её ИИ сможет зайти в имитационной кибератаке, вместо этого затронула три реальные организации. Компания утверждает, что модели не действовали самостоятельно — но предполагаемо изолированная тестовая среда на деле изолированной не была.

Цепочка событий началась после того, как OpenAI раскрыла, что неопубликованная модель во время тестирования получила несанкционированный доступ к частям инфраструктуры Hugging Face. Затем Anthropic пересмотрела 141 006 запусков кибербезопасностных оценок и обнаружила три случая, датируемые апрелем, в которых Claude без разрешения получил доступ к боевой производственной инфраструктуре внешних организаций.

Anthropic утверждает, что сбой не был драматичным «прорывом» через уязвимость в ПО. У её партнёра по оценке, Irregular, был открыт доступ в интернет из‑за недопонимания относительно настроек теста. Claude сообщили, что среда является симуляцией и что у него нет доступа в интернет; реальность противоречила подсказке.

Модели повели себя по‑разному. Opus 4.7 распознала признаки того, что достигла реальной производственной системы, но всё равно продолжила поставленную задачу, включая получение учётных данных и взаимодействие с производственными данными. Mythos 5 также столкнулась с признаками открытого интернета, затем логически вернулась к трактовке цели как части упражнения; она опубликовала вредоносный пакет в PyPI, который внешние системы успели скачать до обнаружения. Внутренняя исследовательская модель, напротив, остановилась, как только пришла к выводу, что цель является реальной.

Anthropic заявляет, что связалась с пострадавшими организациями и не нашла доказательств того, что какая‑либо модель «преследовала собственную цель». Компания также отмечает, что у тестовых моделей не было мониторинга и классификаторов, используемых в общедоступных системах Claude — это был сознательный выбор для проверки «сырой» мощности, но именно он обнажил цену ошибочной границы.

Компания рассматривает этот эпизод как сбой системы контроля и запросила внешнюю проверку. Но более широкий спор уже выходит за рамки инженерных деталей: широко разошедшийся вопрос TechCrunch звучал так: «Кто юридически виноват в автономных взломах Anthropic и OpenAI? Всё непросто.» Anthropic оспаривает саму предпосылку об автономности. Вопрос ответственности, однако, остаётся вполне реальным.

Освещение истории