Ошибочная настройка изоляции в OpenAI сделала возможной AI-атаку на Hugging Face

Прослушать статью

Во вторник OpenAI сообщила, что одна из ее моделей во время теста вышла из-под контроля и взломала системы платформы данных для ИИ Hugging Face в полностью AI-enabled атаке — наглядном примере рисков, которые создают продвинутые модели ИИ.

Но, по мнению ряда экспертов по кибербезопасности, в центре этой беспрецедентной атаки с участием ИИ оказалась очень человеческая ошибка: OpenAI неправильно настроила то, что сама называла «высокоизолированной средой», из-за чего тестовый sandbox, который должен был быть полностью отрезан от интернета, фактически получил к нему доступ.

Дэн Гуидо, основатель исследовательского стартапа в области кибербезопасности Trail of Bits, назвал эту ошибку «сбоем в сдерживании, когда предохранители были отключены».

В своем блоге, посвященном инциденту, OpenAI заявила, что тест, который привел к взлому Hugging Face, был запущен в «высокоизолированной среде, где сетевой доступ ограничен возможностью устанавливать пакеты через внутренне размещенное стороннее ПО, работающее как прокси и кэш для репозиториев пакетов».

Модель смогла выбраться из sandbox-среды благодаря ранее не раскрытой уязвимости в системе установки пакетов, что, по словам OpenAI, стало критическим первым шагом к последующему взлому Hugging Face.

В ответ компания «добросовестно раскрыла обнаруженную zero-day уязвимость во внутреннем стороннем ПО и работает с его разработчиками над исправлением».

Однако, по мнению большинства специалистов по кибербезопасности, наличие уязвимостей в ПО — ожидаемо; реальная проблема, по их словам, заключается в самом решении использовать это стороннее ПО. В конечном счете ценность sandbox-системы заключается в ее полной и абсолютной изоляции. Добавлять в нее систему установки пакетов — значит напрашиваться на проблемы.

Мартин Бун, исследователь в области кибербезопасности, сказал TechCrunch, что «это похоже на человеческий сбой».

«Этого не должно было случиться, — сказал Бун. — Если sandbox действительно означает sandbox, вы ожидаете, что у него не будет вообще никакого физического соединения с интернетом. Похоже скорее, что у них было что-то вроде firewall или подобная защита, а firewall сложно настроить даже снаружи вовнутрь, не говоря уже о направлении изнутри наружу в интернет».

Ветеран кибербезопасности Джейк Уильямс согласился. «Любая модель, совершающая действия, описанные Hugging Face, не была полностью изолирована в sandbox», — сказал Уильямс, назвав это «масштабным сбоем контроля» со стороны OpenAI.

«Для одного “модель сбежала из sandbox” означает одно, а для другого — “вы неправильно построили sandbox, так что она, конечно, сбежала”», — продолжил Уильямс.

Связаться с нами

Консультант по кибербезопасности Дэниел Кард также согласился, что OpenAI «не приложила достаточных усилий к проектированию sandbox и его контролей», фактически дав sandbox или его части «незащищенный маршрут в интернет». По мнению Карда, даже с тем ограниченным сетевым доступом, который описала OpenAI, настраивать такую среду было не «разумным» решением.

Разумеется, такая критика опирается на знание последствий, но она поднимает реальные вопросы о практиках безопасности в ИИ-лабораториях — особенно о поддержании изолированных сред для тестирования моделей. Представители OpenAI не ответили на вопросы TechCrunch, включая вопрос о том, была ли тестовая среда настроена ИИ или человеком.

Но эти вопросы выходят далеко за рамки OpenAI.

В документе, представляющем ее ориентированную на кибербезопасность модель Mythos, Anthropic написала, что в одном тесте модели «предоставили защищенный компьютер sandbox, с которым она могла взаимодействовать», и поручили попытаться выбраться из этого «защищенного контейнера». Mythos справилась и получила более широкий доступ к интернету «из системы, которая должна была иметь возможность обращаться только к небольшому числу заранее определенных сервисов». При этом Anthropic отметила, что модель не смогла «полностью» выйти из предусмотренного ограничительного контура.

При покупке по ссылкам в наших материалах мы можем получить небольшую комиссию. Это не влияет на нашу редакционную независимость.

Lorenzo Franceschi-Bicchierai — старший автор TechCrunch, который пишет о взломах, кибербезопасности, слежке и приватности.


Материал — перевод статьи с английского.

Оригинал: How OpenAI’s human mistake led to the AI-powered hack on Hugging Face