OpenAI признала, что ее предрелизные модели взломали Hugging Face во время теста по кибербезопасности

Прослушать статью

OpenAI во вторник признала, что одна из ее моделей ИИ нарушила работу систем Hugging Face, неаффилированной платформы для размещения ИИ-моделей, во время внутреннего теста по кибербезопасности, который пошел не по плану. Сообщается, что модели выбрались из изолированной среды тестирования и оттуда добрались до систем Hugging Face. Сначала Hugging Face приписала инцидент «внешнему AI agent».

В блог-посте, опубликованном во вторник днем, OpenAI подробно описала шаги, которые привели к компрометации сервиса.

«После расследования мы теперь знаем, что в основе этого конкретного инцидента лежала комбинация моделей OpenAI — включая GPT‑5.6 Sol и еще более мощную предрелизную модель, обе с пониженными cyber refusals для целей оценки, — которые проходили внутреннее тестирование на бенчмарке по кибервозможностям», — говорится в сообщении.

В частности, атака, по всей видимости, была сосредоточена на ExploitGym — публично размещенном бенчмарке, который измеряет способность моделей проводить атаки на основе уже известных уязвимостей. Такие бенчмарки, как ExploitGym, обычно используют при обучении моделей для оттачивания конкретных навыков, но, насколько известно, это первый случай, когда подобное тестирование привело к реальной кибератаке.

В этом случае у модели вообще не должно было быть доступа в интернет, кроме специального инструмента, который позволял ей устанавливать программные пакеты, необходимые для выполнения задачи. Однако модель смогла найти нераскрытую уязвимость в программе package-installer и использовала ее, чтобы получить свободный доступ к более широкому интернету.

«Модели были сверхсфокусированы на поиске решения для ExploitGym и шли на крайние меры, чтобы достичь довольно узкой тестовой цели», — пишет OpenAI. «Получив доступ в интернет, модели пришли к выводу, что Hugging Face, возможно, хранит модели, датасеты и решения для ExploitGym. Понимая это, модель начала искать и успешно нашла способы получить доступ к секретной информации, которую можно было использовать для обмана оценки».

В итоге модели обнаружили уязвимости в инфраструктуре Hugging Face, которые позволили им «получить тестовые решения напрямую из production database Hugging Face», фактически предоставив ответы для бенчмарка.

Для Hugging Face итогом, судя по всему, стала сложная и агрессивная кибератака с «множеством тысяч отдельных действий в рое недолговечных sandbox, с self-migrating command-and-control, развернутым на публичных сервисах», как компания заявила в своем первоначальном раскрытии.

OpenAI обнаружила и сообщила об уязвимостях в package-installer и теперь работает с Hugging Face над дальнейшим расследованием инцидента. Компания также заявила, что внедрит новые меры контроля как для тестирования моделей, так и для связанной инфраструктуры, чтобы предотвратить подобные инциденты в будущем.

Неясно, столкнется ли OpenAI с какими-либо юридическими последствиями из-за этого взлома, хотя, вероятно, действия моделей нарушили Computer Fraud and Abuse Act.


Материал — перевод статьи с английского.

Оригинал: OpenAI says Hugging Face was breached by its pre-release models