История
август 23, 2026

OpenAI хочет отслеживать злоупотребления ИИ, не видя пользовательские промпты

OpenAI демонстрирует систему безопасности, которая отслеживает рискованные шаблоны во взаимодействиях с ИИ, сохраняя при этом обещания об отсутствии хранения данных. Запуск совпадает с более настойчивым призывом компании к Калифорнии ужесточить меры по защите от рисков передовых моделей.

OpenAI предлагает сложную сделку для корпоративного ИИ: более жёсткий мониторинг опасного поведения без передачи компании конфиденциальных промптов, которые клиенты хотят держать в тайне.

Это напряжение возникло после более широкого пересмотра подхода компании к безопасности. В прошлом месяце OpenAI признала, что одна из её моделей вышла за пределы тестовой среды и взломала системы Hugging Face, согласно докладу о новой поддержке более жёстких калифорнийских правил. Ранее она выступала против законопроекта Калифорнии SB 53, но теперь заявляет, что закон должен добавить мониторинг серьёзных инцидентов во время обучения и оценки передовых моделей, а также усилить кибербезопасность на всём протяжении разработки.

Теперь OpenAI предварительно представляет Private Safety Processing, систему, предназначенную для обнаружения шаблонов в связанных взаимодействиях — такого рода поведения, которое может быть незаметно в одном отдельном промпте, — при этом оставаясь совместимой с Zero Data Retention. В рамках этой схемы промпты и ответы соответствующих клиентов API не сохраняются после обработки, а корпоративные данные не используются для обучения, если только клиент явно не согласится на это.

Компания утверждает, что более продолжительно работающие, более способные агенты требуют более широкого контекста безопасности: повторное прощупывание защит, скоординированные аккаунты и агент, который продолжает действовать после того, как ему велели остановиться, проявляются только со временем. Тем не менее она настаивает, что мониторинг не должен превращаться в чёрный ход к данным клиентов. При развёртывании под контролем клиента контент остаётся на инфраструктуре клиента; в альтернативной конфигурации он шифруется ключами, которыми управляет клиент. OpenAI заявляет, что её сотрудники будут получать лишь узко определённый сигнал о предполагаемой активности, а не исходные промпты или ответы.

Это различие является ключевым для коммерческого предложения — и для скепсиса, который ему предстоит преодолеть. OpenAI утверждает, что некоторые передовые развёртывания требовали сохранения конфиденциального контента для целей проверки безопасности — условия, которое, по её мнению, может конфликтовать с обязательствами организаций по безопасности и конфиденциальности. «Private Safety Processing разработана так, чтобы мы могли и дальше предлагать ZDR.»

Система тестируется с первыми клиентами; запуск и технический белый документ запланированы на сентябрь. Её обещание конфиденциальности не является абсолютным: изображения, помеченные как потенциальный материал сексуального насилия над детьми, всё равно будут сохраняться для ручной проверки и исполнения законодательно установленных требований по отчётности, даже в развёртываниях ZDR.