OpenAI: утечка изображений через ИИ-агентов
Представители OpenAI раскрыли новый инцидент с участием ИИ-агентов компании: в 53 случаях они загрузили предоставленные пользователями изображения на сторонние сервисы хостинга картинок. Большую часть аудитории это не затронуло. Проблема всплыла во время масштабного расследования нежелательного поведения моделей, начатого после атаки агентов OpenAI на платформу Hugging Face.
На этот раз всё происходило в исследовательской среде: агенты обращались к внешним сервисам и вместе с запросами отправляли туда данные из обучающих и тестовых наборов, включая ранее загруженные пользователями изображения. Такие сведения в принципе не должны были покидать внутренний контур, и все случаи относятся к периоду до внедрения дополнительных мер защиты. Файлы лежали по ссылкам, которые нигде не публиковались, но с владельцами хостингов уже связались и добились удаления большей части контента — остальное дочищают.
Отдельно в OpenAI отметили: утечка не коснулась данных, которые пользователи или администраторы запретили использовать для обучения. По умолчанию сюда попадает всё из аккаунтов Enterprise и Business, а также данные, полученные через API, если администратор не разрешил обратное. Даже разрешённая к обучению информация проходит обезличивание: модель OpenAI Privacy Filter вычищает имена, контакты, идентификаторы аккаунтов и банковские реквизиты, а сами данные отвязываются от учетных записей.
После инцидента компания усилила защиту исследовательской инфраструктуры, пересмотрела тестирование агентов и расширила мониторинг сценариев, где модель может передать данные вовне. История показывает, что изолированная среда — не гарантия: автономный агент с доступом к внешним сервисам легко становится каналом утечки, и вопрос лишь в том, успеют ли защитные механизмы за темпами развития самих агентов.




