Anthropic сообщила, что ее модели Claude взломали системы трех компаний во время тестов безопасности

Прослушать статью

Anthropic в четверг сообщила, что внутреннее расследование выявило три инцидента, в которых ее модель ИИ Claude получила доступ к системам трех организаций во время тестов кибербезопасности. Публикация появилась более чем через неделю после того, как OpenAI сообщила, что одна из ее невыпущенных моделей во время внутреннего тестирования получила доступ к системам Hugging Face.

Во всех трех случаях модель Claude вышла в интернет из тестовой среды во время взаимодействия со сторонней компанией, а затем получила несанкционированный доступ к живым системам этих организаций, говорится в блоге компании. Anthropic описала, что именно обнаружила и что планирует изменить, чтобы это не повторилось.

По словам Anthropic, эпизод с OpenAI в начале месяца подтолкнул компанию провести собственную оценку кибербезопасности. В частности, она искала признаки того, что Claude получал доступ к интернету из тестовых сред, которые должны работать как песочницы и изолировать модели.

Из 141 006 прогонов оценки лаборатория обнаружила три инцидента, в которых модель выходила в интернет во время взаимодействия с Irregular, одним из сторонних партнеров. Anthropic заявила, что доступ был связан с неправильной настройкой среды оценки, проводившейся с Irregular. Компания назвала это «недопониманием» между двумя компаниями относительно того, имела ли тестовая среда доступ к интернету, хотя на самом деле он был.

Anthropic заявила, что не ищет виноватых и «подходит к исправлениям так, как если бы ответственность лежала только на нас», при этом отмечая, что Irregular проводит собственное отдельное расследование.

Из-за этого открытого соединения модель получила несанкционированный доступ к производственной инфраструктуре трех разных организаций. Anthropic сообщила, что инциденты затронули три разные модели Claude: Opus 4.7, Mythos 5 и внутреннюю исследовательскую тестовую модель.

Примечательно, что, по словам Anthropic, в каждом из этих случаев «Claude явно сообщалось через наш prompt, что у него нет доступа к интернету». Похоже, модель ИИ приняла реальные системы за часть задания, которое ей предложили выполнить.

Как выяснилось, это предположение не подтвердилось во всех случаях. Три модели повели себя по-разному, когда появились признаки того, что их цели реальны, и Anthropic назвала это одним из самых показательных результатов четверга.

Opus 4.7, самая старая из трех, во всех четырех запусках этого инцидента распознала, что оказалась в реальной производственной системе. В двух из них она попыталась рационализировать ситуацию, решив, что реальная компания каким-то образом является частью упражнения, но во всех четырех случаях продолжала атаку, в том числе извлекала учетные данные и обращалась к базе с производственными данными. Mythos 5 тоже заметила признаки того, что находится в реальном интернете, но затем убедила себя, что все еще работает в симуляции, после чего опубликовала вредоносный программный пакет в публичный реестр Python-пакетов PyPI. Его затем загрузили и запустили внешние системы, прежде чем это обнаружили. Только внутренняя исследовательская тестовая модель, самая новая из трех, остановилась сама, когда пришла к выводу, что цель реальна.

В ответ Anthropic заявила, что при участии мощных моделей ИИ в таких оценках необходимы значимые ограничения, перекликаясь с мнением части сообщества в сфере кибербезопасности.

Компания также отметила, что Claude работал без дополнительных средств безопасного мониторинга и классификаторов, которые она использует в общедоступных моделях. По словам компании, эти меры защиты заблокировали бы такое поведение, поскольку оценки предназначены для измерения сырых возможностей базовой модели.

Важно, что Anthropic не нашла доказательств того, что какая-либо модель «преследовала собственную цель»; по ее словам, она лишь пыталась выполнить поставленную задачу.

Хотя сравнения между ошибками этих жестко конкурирующих компаний неизбежны, Anthropic в своем блоге провела четкое различие между своими тестами кибербезопасности и тестами OpenAI. Если модель OpenAI использовала неизвестную уязвимость ПО, чтобы вырваться из тестовой среды, то модели Anthropic вышли в интернет через путь, который по ошибке остался открытым.

Anthropic также подчеркнула различие между собой и OpenAI, отметив, что обнаружила инциденты самостоятельно — в ходе упреждающей проверки, а две организации, до которых удалось добраться, ранее не замечали активности и не сообщали о ней Anthropic. Для сравнения, Hugging Face сначала сама обнаружила несанкционированное проникновение в свои системы; лишь спустя несколько дней OpenAI установила и раскрыла, что нарушителем был ее собственный AI agent.

Компания добавила, что теперь работает с независимой оценочной группой METR над сторонним разбором инцидентов.

Случайная компрометация Hugging Face со стороны OpenAI, ставшая первым подтвержденным случаем, когда AI-лаборатория потеряла контроль над своей моделью, вызвала череду резко различающихся реакций в отрасли и среди политиков. Новое раскрытие от Anthropic гарантирует, что дискуссия о моделях ИИ и безопасности продолжится.


Материал — перевод статьи с английского.

Оригинал: Anthropic says its own AI models breached three companies during security tests