Что показывает новое исследование Anthropic о внутренней «J-space» LLM — и чего оно не доказывает
Anthropic — сейчас самая дорогая AI-компания в мире с почти триллионной оценкой — известна своей необычной и «тяжеловесной» исследовательской повесткой. Например, она изучает, могут ли AI-модели чувствовать боль, а также иногда обрывает диалоги чат-ботов, если подозревает, что пользователи «злоупотребляют» моделью.
Одна из ниш, куда Anthropic тратит больше времени и денег, чем многие другие AI-компании, — это mechanistic interpretability, то есть попытки заглянуть внутрь сложной математики AI-модели и понять, почему она приходит к одному выводу, а не к другому. Это непростая область: для любого результата могут быть важны миллионы точек данных, и разбираться в них порой всё равно что читать бессвязный набор слов. Кроме того, это спорная тема. Когда поведение AI-моделей описывают терминами из психологии и нейронаук, они могут казаться более сложными и «человечными», чем есть на самом деле.
Именно поэтому, когда на прошлой неделе Anthropic объявила, что нашла новое окно в «внутренние мысли» своих моделей во время рассуждения над ответами, мне захотелось поговорить с коллегой, который давно занимается тем, что вообще можно сказать о работе AI-моделей. Старший редактор Will Douglas Heaven, помимо PhD по компьютерным наукам, много времени посвятил разбору того, как работают AI-модели. Я поговорила с ним о том, что следует вынести из нового — и по-своему странного — исследования Anthropic.
Что именно Anthropic обнаружила?
Anthropic уже несколько лет пытается понять, как работают большие языковые модели (LLM). Компания не единственная, кто этим занимается, но, на мой взгляд, она сделала это частью своей миссии сильнее, чем большинство. Генеральный директор Anthropic Dario Amodei говорил, что полностью контролировать LLM мы не сможем, пока не поймём лучше, как они устроены.
Новое исследование именно в этом контексте и находится. Оно проникает глубже в странные механизмы внутри LLM, чем всё, что Anthropic делала раньше. Компания выяснила, что внутри LLM есть пространство, которое Anthropic называет J-space, — оно заполнено словами, которые не появляются в выходном ответе, но, похоже, влияют на то, как модель решает задачи. Всё это оставалось скрытым, пока Anthropic не разработала новый способ зондировать модель Claude, так что речь идёт о настоящем открытии.
Иногда эти слова помогают отслеживать, на каком этапе задачи находится LLM, иногда напоминают вспышки распознавания — например, слово «protein» может возникнуть, если показать LLM только буквы из последовательности белка, — а иногда выглядят как внутренний комментарий к принятию решения. В моём любимом примере Claude решил схитрить на тесте по программированию, когда появилось слово «panic».
Anthropic также обнаружила, что LLM способны описывать и изменять слова в этом пространстве. Значит, они каким-то образом действительно используют его.
Давайте на секунду отступим. Я не считаю большие языковые модели простыми, но и магией они не являются. Это всего лишь математика, которая учится находить связи между словами, верно? Тогда почему так трудно «заглянуть» внутрь LLM и понять, что там происходит?
Да, это не магия! Думаю, то, что мы не до конца их понимаем, подпитывает мифологию вокруг них. И важно отметить, что весь нарратив, который Anthropic здесь продвигает — мол, они построили невероятно загадочную технологию, но не волнуйтесь, потому что именно они же её и разберут, — очень соответствует стилю компании. [Посмотрите, как Anthropic предупреждала, что её новые модели настолько хороши в кодинге, что создают глобальный риск кибербезопасности, а вскоре после этого их фактически «поставило на место» правительство США.]
Так что да: LLM — это просто математика. И всё же это крайне сложная математика. Сегодняшние LLM состоят из сотен миллиардов чисел, а их запуск вызывает каскад миллионов и миллионов вычислений. Я писал в прошлом году, что если распечатать даже LLM среднего размера на листах бумаги, ими можно было бы покрыть город размером с Сан-Франциско.
Без специализированных инструментов, которые в нужный момент выделяют нужные части LLM, в этой математике невозможно разобраться. Нужно знать, куда смотреть и как смотреть. А чтобы создать такие инструменты, сначала нужно хотя бы частично понимать эту сложную математику.
Вы уже писали о том, что LLM можно изучать так, как изучают мозг организма. Корректно ли использовать «мозгоподобные» термины, когда говоришь о работе LLM?
Мне не нравится использовать такие термины. LLM — это не мозг. Такой язык вводит в заблуждение, потому что создаёт впечатление, будто LLM способны на более человеческие вещи, чем на самом деле, или что мы можем делать о них выводы, которых делать не стоит. Вся эта антропоморфизация ещё и связана с набором очень жёстких идеологических позиций о том, что это за технология и какой она станет.
Но при этом у нас нет хорошего альтернативного словаря для описания того, что делают эти модели. Я понимаю, почему люди тянутся к словам вроде «think», «understand» и «brain-like» — это удобные сокращения.
Anthropic сравнивает найденное ею новое пространство внутри LLM с пространством, которое, по мнению некоторых нейробиологов, наш мозг использует для отслеживания сознательных мыслей. Я спросил компанию, насколько серьёзно стоит относиться к этой аналогии, и она ответила в комментарии: «Проведение этих аналогий помогло нам при проектировании экспериментов, поскольку позволило делать многие неочевидные экспериментальные предсказания о J-space, и они оказались верными. При этом важно отметить, что между J-space (и языковыми моделями вообще) и человеческим мозгом есть важные различия, поэтому мы не утверждаем, что между ними существует полное соответствие».
Какую проблему в AI это новое понятие J-space потенциально поможет решить?
Anthropic говорит, что наблюдение за J-space может стать способом ловить модели на нежелательном поведении. Поскольку в этом пространстве всплывают слова, которых нет в выходном ответе модели, они могут показывать то, что иначе осталось бы незамеченным, — например, когда модель выдаёт предвзятые ответы или когда она взвешивает плюсы и минусы жульничества.
По крайней мере, такова теория. Я бы сказал, что этот результат лучше рассматривать как ещё один шаг к общему пониманию технологии, а не как нечто, что само по себе уже будет практически полезно.
Подробнее — в полном материале Will о новом исследовании.
Deep Dive
Artificial intelligence
A startup claims it broke through a bottleneck that’s holding back LLMs
Subquadratic теперь поделилась новыми подробностями о своей модели. Но у некоторых по-прежнему остаются сомнения.
Will Douglas Heaven archive page
A reality check on the AI jobs hysteria
Что на самом деле показывают цифры о влиянии искусственного интеллекта на рынок труда? Ответ может удивить.
David Rotman archive page
Anthropic’s Code with Claude showed off coding’s future—whether you like it or not
По мере того как инструменты вроде Claude Code становятся лучше, всё больше разработчиков готовы передавать им задачи по программированию. То, как создаётся софт, изменилось надолго.
Will Douglas Heaven archive page
Anthropic found a hidden space where Claude puzzles over concepts
Новая техника позволила компании заглянуть глубже, чем когда-либо прежде, в странную работу LLM.
Will Douglas Heaven archive page
Stay connected
Узнавайте о специальных предложениях, главных материалах, предстоящих мероприятиях и другом.
Материал — перевод статьи с английского.
Оригинал: What Anthropic’s latest AI discovery does—and doesn’t—show