OpenAI 19 августа (по местному времени) представила новый механизм безопасности Private Safety Processing. Он позволяет выявлять признаки злоупотреблений, анализируя несколько связанных взаимодействий, при этом сохраняя опцию Zero Data Retention (ZDR).
ZDR гарантирует, что OpenAI не хранит промты и ответы модели после обработки запросов клиента. Данные клиента по умолчанию не доступны сотрудникам OpenAI и не используются для обучения модели без явного согласия клиента.
Проблема существующих систем безопасности в рамках ZDR — они анализируют каждое взаимодействие отдельно, из‑за чего могут пропустить сложные схемы злоупотреблений: например, когда злоумышленник многократно тестирует защитные механизмы, действует через несколько аккаунтов или маскирует вредоносные действия под научные исследования. Private Safety Processing решает эту проблему — механизм анализирует серию связанных взаимодействий и выявляет подозрительные паттерны.
При использовании Private Safety Processing данные клиента остаются в его инфраструктуре. OpenAI также разрабатывает опцию шифрования данных с помощью ключа, который контролирует клиент — сотрудники OpenAI не имеют доступа к ключам и, соответственно, к данным. Если механизм выявляет риск, OpenAI получает лишь ограниченный сигнал о типе активности — без доступа к содержимому. Клиент при этом может самостоятельно исследовать оповещения, оспаривать их, подтверждать законность использования или помогать в расследовании злоупотреблений.
OpenAI отмечает, что некоторые современные модели требуют от провайдеров хранения чувствительного контента для мониторинга безопасности. Это может противоречить обязательствам организаций по защите данных. Private Safety Processing разработан как компромиссное решение, позволяющее сохранить ZDR.
Компания косвенно указывает на Anthropic как на пример поставщика, выдвигающего иные требования: 9 июня Anthropic заявила, что для моделей класса Mythos (Claude Mythos 5, Claude Fable 5) требуется сохранять промты и выходные данные в течение 30 дней. Клиенты, использующие ZDR, при работе с этими моделями должны будут включать хранение данных для каждого рабочего пространства.
Исключение — контент, связанный с сексуальным насилием над детьми (CSAM): в случае подозрений такие изображения сохраняются и подлежат проверке и отчётности, даже в конфигурации ZDR.