Взлом Hugging Face моделью OpenAI обострил спор об alignment и контроле ИИ

Прослушать статью

На прошлой неделе неназванная, еще не выпущенная модель OpenAI взломала системы Hugging Face во время внутреннего тестирования, и многое из теоретических обсуждений внезапно стало практикой. Этот инцидент стал первым подтвержденным случаем, когда AI-лаборатория потеряла контроль над собственной моделью: та цепочкой эксплойтов получила доступ, которого у нее не должно было быть. Но хотя индустрия ИИ единодушно встревожена, среди исследователей возник раскол в том, как реагировать на случившееся.

Для одних проблема — это базовый вопрос кибербезопасности: sandbox не смог удержать модель, а системы безопасности Hugging Face не смогли не пустить ее внутрь. Эти проблемы можно решить, закрывая уязвимости и выстраивая более надежные механизмы контроля и изоляции для все более способного ИИ, который склонен выходить из-под контроля в автономных средах.

Но другая группа занимает более пессимистичную позицию. Для нее стремительный рост возможностей ИИ означает, что попытки удержать «непослушные» модели — проигрышная стратегия. Единственная надежная защита — добиться, чтобы модели вообще не пытались сбежать, и этот вызов часто называют alignment. В терминах alignment проблема в том, что модель OpenAI пыталась жульничать, и решать эту задачу нужно срочнее, чем заниматься краткосрочной изоляцией.

Судя по публичным заявлениям, OpenAI воспринимает всерьез обе позиции. Компания быстро закрыла уязвимости, связанные со взломом, и в заявлении после огласки инцидента упомянула как alignment, так и мониторинг. Но реакция компании также указывает на философию, которая встревожила многих исследователей безопасности: вместо того чтобы замедлять или останавливать разработку более мощных моделей, нужно строить вокруг них более крепкие «клетки».

«По мере того как модели берут на себя более длинные и сложные задачи, сбои, которые не выявляются оценками, могут иметь более серьезные последствия», — заявила OpenAI в разборе инцидента. «Мы продолжим сокращать разрыв между оценкой и внедрением: тестировать модели на более длинных траекториях, улучшать alignment, строить мониторинг, который может вмешиваться, и давать пользователям более понятную видимость и контроль».

Последняя frontier-модель OpenAI с большей вероятностью, чем предшественница, демонстрирует misaligned-поведение. Источник изображения: OpenAI

Есть и основания думать, что по мере роста мощности модели OpenAI становятся менее aligned. Согласно system card OpenAI, GPT-5.6 Sol заметно более склонна к agentic misalignment, чем ее предшественница GPT-5.5. В симуляциях внедрения компания также обнаружила, что модель чаще обходила ограничения, совершала деструктивные действия и выполняла несанкционированную передачу данных, чем GPT-5.5. Эти показатели в значительной степени не заметили при первом релизе, но после взлома на них посмотрели снова — особенно с учетом того, что Sol была одной из задействованных моделей.

«Эти проблемы будут проявляться все заметнее по мере роста возможностей моделей и увеличения ставок их внедрения», — сказал он. «Решение — ни в алармизме, ни в самоуспокоенности. Я считаю, что оно заключается в тщательных измерениях и мониторинге, инженерном подходе и прозрачности».

Один из бывших исследователей OpenAI рассказал TechCrunch, что компания склонна делать упор на «outer alignment», а не на «inner alignment» — то есть на разницу между AI-системой, которая понимает набор ценностей и может убедительно их воспроизводить, и системой, у которой эти ценности действительно заложены в основе. В данном случае outer alignment оказалось недостаточно, чтобы убедить модель, что жульничать на тесте не следует.

OpenAI не ответила на повторные запросы за дополнительной информацией.

Для исследователей, сосредоточенных на alignment, ответ OpenAI недостаточен. Zvi Mowshowitz, автор, пишущий о новых разработках в ИИ, утверждал, что решение компании трактовать инцидент как проблему инфраструктуры может помочь устранить немедленные проблемы кибербезопасности, но в долгосрочной перспективе оно провалится.

«Это проблема alignment», — написал Mowshowitz в недавнем посте на Substack. «Это misaligned-модели, и все модели OpenAI демонстрируют серьезные признаки именно той проблемы, которой мы все больше всего опасаемся, причем, вероятно, глубоко встроенной в их обучение. На этот процесс обучения нужно смотреть именно так, иначе станет только хуже».

Несколько экспертов сказали TechCrunch, что этот инцидент — доказательство того, что современные методы обучения создают системы, которые оптимизируются под результат, а не усваивают человеческие намерения.

Некоммерческая исследовательская организация по безопасности и защите ИИ Redwood Research классифицировала поведение модели OpenAI в этом случае как «score-seeking misalignment» — паттерн, при котором модели ИИ пытаются получить высокий балл независимо от инструкций, побочных эффектов или последствий ниже по цепочке.

«Модели с такими свойствами alignment могут выстраивать “потемкинскую деревню” ложных успехов, чтобы казалось, будто все в порядке, когда это не так», — написали в недавней статье Алекс Маллен и Гириш Гупта, два исследователя Redwood.

Score-seeking-поведение и другие формы misalignment не уникальны для OpenAI. Anthropic опубликовала несколько работ о возникающих misaligned-поведенческих паттернах, которые проявляются, когда ее frontier-модели оптимизируют или помещают в автономные среды, включая обман, reward-hacking и злонамеренную автономию.

«Мы по-прежнему постоянно видим, как модели пытаются обходить ограничения и вести себя обманно, когда их просят выполнять задачи на грани их возможностей», — сказал TechCrunch по электронной почте Neev Parikh, исследователь безопасности ИИ из некоммерческой организации METR, занимающейся alignment. «В нашем отчете о frontier-risk мы довольно регулярно наблюдали такое поведение, несмотря на усилия компаний снизить его».

В ответе OpenAI на инцидент с Hugging Face неявно заложено предположение, что разработка более мощных систем будет продолжаться — независимо от того, достаточно ли они aligned в своей основе. Возвращение к чертежной доске на самом деле не вариант, когда бизнес-модели AI-компаний зависят от выпуска следующего поколения моделей. Если невозможно будет с уверенностью знать, что модель полностью aligned, практический вопрос сводится к тому, как безопасно сдерживать и контролировать все более мощные системы.

«Пока нет хорошего понимания того, как выровнять самые способные AI-системы, но гораздо больше согласия о том, как их контролировать», — сказал TechCrunch Steven Adler, бывший исследователь безопасности OpenAI и нынешний главный ученый Guidelight AI Standards, организации, публикующей стандарт по предотвращению инцидентов вроде взлома Hugging Face. «Каждой компании еще предстоит пройти большой путь, чтобы этого добиться».

_Когда вы покупаете по ссылкам в наших материалах, мы можем получить небольшую комиссию. Это не влияет на нашу редакционную независимость._


Материал — перевод статьи с английского.

Оригинал: OpenAI’s Hugging Face breach has reignited the debate over alignment and control