Сатья Наделла обвиняет Big AI в лицемерии из-за авторских прав, но Microsoft делает то же самое

Прослушать статью

Французскому романисту XIX века Оноре де Бальзаку приписывают фразу: за каждым большим состоянием стоит большое преступление.

Сегодня это еще более справедливо, чем 200 лет назад, — достаточно посмотреть, как Big AI, включая Anthropic, OpenAI, Google и других, построили свои триллионные состояния.

Все они используют огромные объемы материалов, защищенных авторским правом, чтобы обучать свои большие языковые модели (LLM), не платя правообладателям. Иными словами, они воруют их. Но они не называют это воровством. Они называют это «fair use», хотя в данном случае это одно и то же.

Обучение generative AI (genAI) требует огромных массивов текста. Чем лучше написан и чем более насыщен информацией этот текст, тем больше он помогает. ИИ становится намного умнее и делает это намного быстрее, когда обучается на хорошо написанных книгах и статьях журналов и газет, а не на болтовне из социальных сетей (или почти на всем остальном, что можно найти в интернете).

С самого начала эпохи ИИ компании выгребали материалы, защищенные авторским правом, где только могли — в открытом интернете, за платным доступом и даже в вручную отсканированных книгах, — а затем использовали этот отсканированный текст. И все это делалось без согласия авторов и издателей и без оплаты им.

Это крупнейшее в истории хищение интеллектуальной собственности с огромным отрывом — на миллиарды и миллиарды долларов. Книги, статьи, музыка, фотографии, произведения искусства — что угодно. Если это создал человек, Big AI, скорее всего, уже забрал это и «скормил» модели без разрешения, а затем заработал на этом большие деньги.

Мне это известно из личного опыта; у меня здесь есть личный интерес. Компании Big AI использовали как минимум 30 моих книг для обучения своих моделей без спроса. И это лишь то, что я смог подтвердить. Возможно, Big AI украл и гораздо больше. А еще, возможно, он украл многие из тысяч статей, которые я написал за эти годы.

Для больших фигур в ИИ это стандартная практика. Поэтому было удивительно увидеть, как генеральный директор Microsoft Сатья Наделла критикует Big AI за лицемерие: они используют чужую интеллектуальную собственность без оплаты, а затем возмущаются, когда небольшие ИИ-компании используют работу Big AI для обучения собственных моделей с помощью техники, называемой distillation.

Он написал в X: «Хотя важны те большие инновации, которые возникают из права поставщиков моделей на fair use при обучении моделей на публичных данных, мне кажется ироничным, что статус-кво затем заключается в том, чтобы вводить жесткие условия на distillation и сохранять за собой право учиться на данных об использовании и взаимодействии клиентов».

Важно отметить: Наделла считает, что Big AI должно быть разрешено воровать материалы, защищенные авторским правом, для обучения. Это ясно из его упоминания «fair use». Его проблема в том, что, по его мнению, небольшие ИИ-компании должны иметь возможность использовать работу Big AI для обучения своих моделей — а Big AI не хочет им этого позволять.

Алистар Барр в Business Insider высказывает похожую мысль: «Anthropic, OpenAI и Google обнаруживают то, что остальной интернет уже усвоил на болезненном опыте: как только вы что-то выкладываете в сеть, люди найдут способы использовать это так, как вам не нравится, и вы не сможете их остановить».

Прежде чем разбираться, прав ли Наделла, называя действия Big AI лицемерными, рассмотрим саму технику, которая лежит в центре спора: distillation.

Что такое distillation

Distillation — это техника обучения ИИ, при которой вы берете ответы одной модели ИИ, например ответ на запрос, и используете этот результат для обучения собственной модели. ИИ-компании делают это довольно часто и делают уже давно.

Барр объясняет distillation так: «Distillation очень напоминает то, чем ИИ-компании занимались по отношению ко всему интернету. Бесплатно и без разрешения собирают веб-контент. Превращают его в продукт, который продают. Доказывают, что это fair use. Надеются, что юристы разберутся с деталями позже».

Илон Маск признал, что его компания xAI использовала методы distillation, чтобы взять выводы конкурента OpenAI для обучения чат-бота xAI Grok. Он объяснил: «Как правило, ИИ-компании distill другие ИИ-компании».

Аналитики отмечают, что вся отрасль ИИ построена на distillation. Нил Шах, вице-президент по исследованиям Counterpoint Research, говорит: «Реальность такова, что ни одна из моделей не существует сама по себе, и вся индустрия в основном развивалась на основе рекурсивного обучения. Новые игроки во многих случаях проходят те же пути “distillation” и “optimization”».

Проблемой это стало только сейчас, потому что китайские ИИ-компании используют distillation, чтобы догнать американские ИИ-компании.

Генеральный директор OpenAI Сэм Альтман оказывает давление на США, требуя предпринять юридические меры против китайских компаний. Anthropic тоже присоединилась к этой линии, заявив, что борьба с distillation требует согласованного ответа со стороны всей ИИ-индустрии, облачных провайдеров и регуляторов.

Лицемерие или fair use?

Так лицемерны ли OpenAI, Anthropic и другие крупные американские ИИ-компании, как утверждает Наделла? Безусловно. Они построили свой бизнес на краже интеллектуальной собственности на миллиарды долларов и называют это fair use. А теперь изображают жертв, когда конкуренты делают то же самое с ними. (Хотя в ряде случаев они и сами уже платят: на прошлой неделе Anthropic урегулировала иск по авторскому праву, выплатив 1,5 млрд долларов.)

Хорошо, что Наделла указал на их лицемерие. Но Microsoft виновна в интеллектуальном воровстве не меньше других — ее AI Copilot работает на чат-ботах OpenAI и Anthropic. Против компании поданы крупные иски о нарушении интеллектуальной собственности. Среди них иск The New York Times, New York Daily News и Center for Investigating Reporting, иск от 400 местных и региональных газет, а также иск от 11 авторов, включая лауреатов Пулитцеровской премии Кая Бёрда, Джиа Толентино и Дэниела Окрента.

Так что не стоит хвалить Наделлу за его выступление. Лучше критиковать его — как и других лидеров ИИ-индустрии — за то, что они украли интеллектуальную собственность на миллиарды долларов у бесчисленных писателей и издателей, а затем назвали это fair use.


Материал — перевод статьи с английского.

Оригинал: Microsoft’s Nadella calls out Big AI for hypocrisy — but what about his own company?