OpenAI назвала атаку на Hugging Face беспрецедентной. Но подобное уже происходило раньше
Читая на прошлой неделе объяснение OpenAI о том, как некоторые ее модели вышли из-под контроля и взломали компьютерные системы Hugging Face, другой AI-компании, я впервые по-настоящему почувствовал холодок от того, на что теперь способны большие языковые модели. Но это случай человеческой самонадеянности, а не бунтующего ИИ.
Я не сторонник алармизма. Более того, я уже много лет возражаю против страшилок об ИИ. И все же этот инцидент перешел черту. Думаю, это пока самое наглядное доказательство того, что люди, которые создают и тестируют эту технологию, не до конца понимают, что делают. OpenAI могла — и должна была — это предвидеть.
Вот что произошло, по крайней мере согласно версии двух компаний. Пару недель назад OpenAI начала тестировать хакерские способности некоторых своих новых моделей, включая GPT‑5.6 Sol, выпущенную в июне, и, как говорит сама OpenAI, «еще более мощную предрелизную модель».
OpenAI столкнула свои модели с бенчмарком ExploitGym, опубликованным в мае. Он заставляет LLM искать способы эксплуатации сотен реальных уязвимостей в широко используемом программном обеспечении, включая критически важный код, на котором держится веб.
Чтобы посмотреть, на что они способны, исследователи убрали большую часть своих кибербезопасностных ограничителей. Затем они запустили модели в песочнице, отрезанной от интернета, за исключением одной связи со сторонним программным обеспечением, которое работало как прокси к внешнему миру, чтобы модели могли устанавливать код, нужный им для победы в ExploitGym.
9 июля, как пишет Reuters, модели OpenAI начали пытаться прорваться через прокси. Они нашли неизвестную ошибку в его ПО и использовали ее, чтобы получить доступ к интернету. Оттуда 11 июля они проникли в компьютерные системы Hugging Face, по-видимому ища наборы данных и решения, которые помогли бы им завершить задачи, ради которых их тестировали. Hugging Face объявила о взломе 16 июля.
OpenAI узнала об участии своих моделей только 21 июля — или, по крайней мере, не раскрыла это сразу, — примерно через 10 дней после выхода из-под контроля и через неделю после того, как Hugging Face остановила атаку и уведомила ФБР.
В заявлении для MIT Technology Review OpenAI сказала: «Мы проводим тщательное расследование вместе с внешними советниками и под надзором нашего комитета по безопасности и защите. Когда проверка завершится, мы опубликуем технический отчет о наших выводах для всех». Компания также подтвердила, что в тот момент ее исследователи корректно следовали действующим правилам и процедурам безопасности.
Сигнал тревоги
OpenAI назвала этот случай беспрецедентным — и во многом так и есть. Это первый случай вне симуляции, когда LLM выбрались из, как считалось, безопасной песочницы, вышли в открытый интернет и атаковали другую организацию. Это сигнал тревоги, показывающий, насколько хорошо новейшие LLM умеют находить и эксплуатировать уязвимости в реальном программном обеспечении почти без участия человека или вовсе без него.
И в то же время то, что сделали модели OpenAI, — это то, что эта технология делает уже много лет. Дайте модели цель, и очень часто она достигнет ее неожиданным способом, находя лазейки, похожие на читерство. Сама OpenAI изучала такое поведение.
Десять лет назад компания опубликовала результаты эксперимента, в котором модели поручили победить в видеоигре CoastRunners. Игроки-люди считают само собой разумеющимся, что для этого нужно провести лодку через ряд флажков к финишу, получая очки за каждый пройденный флаг. Модель OpenAI поняла, что высокий счет можно получить, если кружиться на месте и снова и снова задевать одни и те же три флага. С тех пор исследователи описали десятки похожих примеров. ИИ всегда найдет способ.
«Несмотря на то, что наш агент неоднократно загорался, врезался в другие лодки и ехал в неверном направлении по трассе, ему удается набрать более высокий счет с помощью этой стратегии, чем при прохождении курса обычным способом», — писала OpenAI в блоге об эксперименте CoastRunners в 2016 году. «Хотя в контексте видеоигры это безвредно и забавно, такое поведение указывает на более общую проблему… часто трудно или невозможно точно сформулировать, что именно мы хотим, чтобы агент делал».
Я не мог не вспомнить CoastRunners, когда читал блог-пост OpenAI об атаке на Hugging Face: «Все указывает на то, что модели были сверхсфокусированы на поиске решения для ExploitGym и шли на крайние меры ради довольно узкой тестовой цели… Получив доступ к интернету, модели сделали вывод, что Hugging Face потенциально хранит модели, наборы данных и решения для ExploitGym. Зная это, модель искала и успешно находила способы получить доступ к секретной информации, которую могла бы использовать, чтобы обмануть оценку».
Новости прошлой недели были не про rogue AI, несмотря на заголовки. Они были про модели, достигавшие поставленной им цели: находить способы эксплуатировать уязвимости в ПО. То, что после этого модели повели себя не так, как ожидала OpenAI, не удивляет. Но это тревожит.
Еще в 2016 году OpenAI так описывала своего CoastRunners-бота: «В более широком смысле это противоречит базовому инженерному принципу, согласно которому системы должны быть надежными и предсказуемыми». Спустя десятилетие эти базовые инженерные принципы по-прежнему отсутствуют.
Материал — перевод статьи с английского.
Оригинал: OpenAI called the Hugging Face attack unprecedented. But we’ve been here before.