OpenAI: как измерять отдачу от ИИ через полезную работу, стоимость успешной задачи и надежность
Вопрос, который Sarah Friar, финансовый директор OpenAI, слышит от CFO повсюду, прост: как получить больше ценности от расходов на ИИ?
В течение многих лет рынок измерял успех программного обеспечения через внедрение: купленные места, активные пользователи, продленные лицензии. Но чтобы понять ценность ИИ, нужен более сильный показатель — выполненная работа.
Базовый экономический вопрос для CFO и других бизнес-лидеров заключается в том, растет ли ценность работы, которую выполняет ИИ, быстрее, чем стоимость ее создания.
Чтобы ответить на этот вопрос, нужно смотреть глубже, чем на такой показатель, как стоимость за token. У более дешевой модели token может быть дешевле, но для хорошего результата может потребоваться больше попыток, больше времени или больше человеческой проверки. Более способная модель может стоить дороже на уровне token, но выполнять ту же задачу за один проход. Важно полная стоимость получения успешного результата, сопоставленная с ценностью, которую этот результат создает.
Итоговую систему оценки для эпохи ИИ можно описать как «полезный интеллект на доллар». Этот показатель отвечает на четыре ключевых вопроса:
Выполняет ли ИИ работу, которая действительно важна?
Сколько стоит каждая успешно выполненная задача?
Могут ли люди полагаться на результат?
Приносит ли каждый доллар, вложенный в ИИ, больше ценности по мере роста использования?
1. Сколько полезной работы выполняется?
Начинать нужно с самой работы.
Сколько клиентских проблем помог решить ИИ? Сколько изменений в коде помог выпустить? Сколько контрактов он помог проверить? Сколько времени он вернул людям? Сколько решений улучшилось потому, что нужный контекст оказался в нужный момент под рукой?
Token создают ценность, когда превращаются в работу, которой люди действительно могут воспользоваться. По мере того как модели становятся более способными, они могут брать на себя более длинные и сложные задачи: сохранять контекст, рассуждать через несколько шагов, работать с разными инструментами и адаптироваться по ходу дела.
Лучше всего начинать с одного процесса. Определите, что значит «готово», и измеряйте этот результат в системе, где работа и происходит.
Для команды поддержки «готово» может означать, что проблема клиента решена. Для инженерной команды — что изменение в коде прошло тесты. Для юридической команды — что контракт проверен точно и вовремя.
Рассмотрим финансовую команду, готовящуюся к просмотру прогноза. Большая часть работы происходит до принятия финального решения: найти последний прогноз, перенести данные в Excel или Sheets, определить изменения, сверить вкладки, пересобрать слайды и убедиться, что все сходится до последней детали.
ChatGPT Work может взять на себя значительную часть этого процесса, освобождая команде больше времени на вопросы, которые действительно важны: что изменилось, почему и что делать дальше?
На практике это и есть полезный интеллект на доллар. Работа выполняется быстрее и в большем объеме, а люди тратят больше времени на применение суждения, креативности и экспертизы.
2. Сколько на самом деле стоит успешно выполненная задача?
Следующий вопрос — во что обходится качественное выполнение такой работы.
Задачи ИИ сильно различаются. Короткий ответ может требовать совсем немного compute. А сценарий в coding, research или финансовой работе может включать более глубокое рассуждение, использование инструментов и множество действий. Более сложные задачи могут требовать больше compute, но и создавать гораздо большую ценность.
На уровне модели стоимость успешно выполненной задачи зависит от цены, объема использованного compute и вероятности получить правильный результат. Для бизнеса полная стоимость также включает время сотрудников, человеческую проверку, повторные попытки и доработки.
Расчет прост:
- сложите полную стоимость выполнения работы;
- посчитайте задачи, которые достигли требуемой планки качества;
- разделите полную стоимость на число успешных задач.
Именно поэтому самая низкая цена за token не всегда дает самую низкую стоимость результата. Frontier-модель может дать лучшую ценность даже для рутинного запроса, если она дает правильный ответ с первого раза, уменьшая число повторных попыток, задержки, проверки и общий объем compute.
Семейство моделей с несколькими уровнями дает клиентам больше способов оптимизировать это уравнение. GPT‑5.6, который мы выпустили на прошлой неделе, имеет три уровня: Sol — наш флагман; Terra сочетает производительность и стоимость; Luna — наша самая быстрая и доступная модель.
Эти уровни дают полезную отправную точку. Но в конечном счете правильную модель должна определять экономика всей задачи. Клиент может использовать Luna для быстрого и массового процесса, Terra для работы, требующей большей глубины, или Sol, когда более сильное рассуждение дает лучший результат с меньшим числом попыток.
Мы обучили GPT‑5.6 так, чтобы он извлекал больше полезной работы из каждого token. В Artificial Analysis Coding Agent Index GPT‑5.6 Sol с максимальным reasoning показал новый state of the art, используя на 54% меньше output token, чем другая ведущая модель. На графике ниже показано сравнение.
DeepSWE v1.1: долгосрочные инженерные задачи; GPT‑5.6 Sol достигает нового максимума в 72,7%, опережая Claude Fable 5 с 69,9%, при предполагаемой стоимости API ниже на 36,2%.
Во всем семействе GPT‑5.6 цель одна и та же: больше успешной работы на доллар. Более высокая эффективность делает существующие задачи доступнее. Более высокая способность делает возможными совершенно новые виды работы.
Каждое новое поколение модели должно улучшать обе стороны этого уравнения. Клиенты должны получать возможность выполнять более ценную работу, а стоимость каждой задачи при этом должна продолжать снижаться.
3. Как часто ИИ делает работу правильно?
Третья мера — надежность.
Внедрение ИИ обычно углубляется по этапам. Сначала ИИ помогает писать черновики. Затем он находит контекст и рассуждает по данным и инструментам. Со временем он начинает действовать, обрабатывать исключения и завершать workflow, а люди при необходимости подключают суждение и контроль.
Каждый шаг создает больше ценности и требует большего от системы.
Надежность имеет прямую экономическую ценность. Когда результаты точны, снабжены источниками, последовательны и при необходимости корректно эскалируются, люди тратят меньше времени на проверку, исправление и повторение работы. Успешные задачи стоят дешевле, а организации получают уверенность, чтобы применять ИИ в более важных workflow.
Команды могут сделать это измеримым, отслеживая три исхода:
- Готово к использованию: результат соответствовал планке качества в том виде, в котором был выдан.
- Требует исправления: результату понадобилась еще одна попытка или правки человека.
- Требует эскалации: человеку пришлось вмешаться и закончить работу.
Эти показатели дают более полную картину, чем одна лишь точность модели. Они показывают, действительно ли ИИ уменьшает объем работы, необходимый для завершения проекта.
Надежность также требует четких границ. Прежде чем ИИ перейдет от черновиков к действиям, организациям нужно определить:
- какие данные система может видеть;
- какие системы она может использовать или изменять;
- когда человеку следует проверить или одобрить действие.
Безопасность, security, privacy и контроль создают фундамент для более глубокого использования. Людям нужно понимать, как ведет себя система, как обрабатываются их данные и как управляются ее действия.
ChatGPT Work опирается на базу безопасности, privacy, compliance и управления рабочим пространством, заложенную в ChatGPT Enterprise. Это позволяет организациям давать ИИ больше контекста и доступ к более ценным workflow, сохраняя надлежащий контроль.
Способность обеспечивает первое использование. Надежность делает ИИ частью того, как действительно выполняется работа.
4. Покупает ли каждый доллар на ИИ больше работы по мере роста использования?
Последний вопрос — улучшается ли экономика на масштабе.
Компании могут измерять это, отслеживая один и тот же workflow во времени. Смотрите, сколько задач достигло планки качества, какова была общая стоимость их выполнения и сколько стоила одна успешно завершенная задача. Если объем выполненной работы растет быстрее общей стоимости, а качество сохраняется или улучшается, каждый доллар на ИИ приносит больше ценности.
В центре этого уравнения находится compute.
Compute питает research и каждую задачу, которую выполняет ИИ. Он определяет качество продукта, скорость, надежность, доступность и стоимость. Training compute строит будущие возможности. Inference compute дает полезную работу уже сегодня. И то и другое должно превращаться в лучшие результаты для клиентов.
Лучшие модели, более эффективный inference, специализированное hardware, более высокая утилизация, более умный routing и более сильный продуктовый дизайн — все это повышает return on compute. Каждое поколение инфраструктуры помогает обучать более способные модели. Затем лучшие алгоритмы, hardware и software помогают обслуживать эти модели более эффективно.
Клиенты ощущают эти улучшения в человеческих терминах: лучшие ответы, более быстрые результаты, меньше исправлений, более надежные продукты и более низкая стоимость работы, которую нужно выполнить.
Эффект накапливается. Более сильная инфраструктура ускоряет research. Research создает более способные и эффективные модели. Лучшие модели улучшают продукты. Лучшие продукты стимулируют внедрение, обучение и выручку. Этот рост поддерживает дальнейшие инвестиции в следующее поколение research, compute, deployment и safety.
OpenAI объединяет все эти элементы в одной общей intelligence platform. Люди используют ее через ChatGPT и ChatGPT Work. Разработчики создают решения через Codex и API. Компании внедряют ее в системы, где и происходит работа.
Когда один слой улучшается, выигрывают все продукты и все клиенты.
Оценка для эпохи ИИ
Вместе эти четыре показателя показывают, улучшается ли полезный интеллект на доллар.
Полезная работа показывает, что ИИ производит. Стоимость успешной задачи показывает, что требуется, чтобы достичь результата. Надежность показывает, какой объем работы люди могут уверенно использовать. Ценность на масштабе показывает, делает ли каждый доллар, и каждая единица compute, больше с течением времени.
Цель — это ИИ, который помогает людям делать более значимую работу, принимать более качественные решения и проводить больше времени на тех частях своей работы, которые требуют именно человеческого суждения и креативности.
Наша задача — улучшать это уравнение с каждым поколением: более способные модели, более быстрые и надежные результаты и более низкая стоимость работы, которую нужно выполнять клиентам.
Именно так ИИ со временем становится полезнее для большего числа людей и организаций.
Материал — перевод статьи с английского.
Оригинал: A scorecard for the AI age