Google представила Gemini 3.6 Flash и 3.5 Flash-Lite для снижения token cost в корпоративных AI agent

Прослушать статью

Google выпустила Gemini 3.6 Flash и 3.5 Flash-Lite как новые рабочие модели, призванные снизить задержки и token cost для корпоративных AI agent.

Экономика работы автономных программных agent в production-среде сводится к простой формуле, о которой многие вендоры не говорят прямо. Модель должна уверенно проходить многошаговую задачу, но каждый дополнительный token повышает стоимость и задержку в процессе, который может запускаться тысячи раз в час.

Командам, которые строят фоновые agent, а не чат-интерфейсы, в первую очередь нужна пропускная способность, а уже потом число параметров. Ответ Google, представленный на этой неделе, делит этот компромисс между тремя моделями: Gemini 3.6 Flash для coding и multimodal reasoning, Gemini 3.5 Flash-Lite для высоконагруженных low-latency задач и ограниченной версией Gemini 3.5 Flash Cyber для устранения уязвимостей.

Математика Gemini 3.6 Flash

В документации для разработчиков Google делает акцент на одном показателе: у 3.6 Flash на 17 процентов меньше output tokens, чем у предыдущей версии 3.5 Flash, по измерениям Artificial Analysis Index.

В отдельных синтетических тестах, включая Datacurve DeepSWE benchmark, Google сообщает о снижении использования token до 65 процентов. Цена составляет $1.50 за 1M input tokens и $7.50 за 1M output tokens, что делает модель подходящей для постоянно работающих reasoning loops, а не для разовых запросов.

На DeepSWE компания фиксирует 49 процентов успешных решений у 3.6 Flash против 37 процентов у предшественника. На MLE Bench показатель растет с 49.7 процента до 63.9 процента, а в тесте Google GDPval-AA v2, который пытается измерять реальную умственную работу, а не coding puzzles, 3.6 Flash набирает 1421 против 1349 у старой модели.

Figma, Hebbia и Harvey уже используют модель

Figma интегрировала 3.6 Flash в свою инфраструктуру прототипирования, и, по словам Matt Colyer, директора по product engineering компании, модель дает разработчикам более быстрый путь через итерации дизайна без снижения качества результата.

Legal technology platform Harvey и research tool Hebbia пропускают данные через модель для multimodal document work: загрузки сырых финансовых отчетов, разбора структуры документов, чтения встроенных диаграмм и подготовки черновиков отчетов для проверки.

Google также встроила client-side computer-use tool напрямую в Gemini API и Gemini Enterprise platforms, убрав custom intermediary software, которое инженеры раньше писали, чтобы заставить модели работать поверх операционной системы.

Компания сообщает об OSWorld-Verified score 83.0 процента, что выше прежних 78.4 процента, и утверждает, что обновленные safeguards против злоупотреблений в chemical, biological, radiological и nuclear сценариях повышают устойчивость к jailbreaking без роста числа отказов на безобидные запросы.

Более дешевый уровень для высоконагруженных background agent

Gemini 3.5 Flash-Lite решает другую задачу: document processing и agentic search в больших объемах, а не reasoning depth. Artificial Analysis Index измерил модель на уровне 350 output tokens в секунду, что, по словам Google, делает ее самой быстрой в серии 3.5.

Цена составляет $0.3 за 1M input tokens и $2.5 за 1M output tokens — достаточно дешево, чтобы инженерные команды могли отправлять простые, массовые subagent-запросы на минимальный уровень thinking и сохранять более высокий уровень thinking для многошаговой работы.

В длинном тесте Google GDM-MRCR v2 Gemini 3.5 Flash-Lite показала 72.2 процента успеха против 60.1 процента у предшественника, а ее GDPval-AA v2 score почти удвоился — с 642 до 1140. У модели есть тот же native computer-use tool, что и у 3.6 Flash.

Отдельно Google сообщает, что Gemini 3.5 Pro по-прежнему проходит partner testing перед полноценным релизом, а pre-training для следующей архитектуры Gemini 4 уже идет.

Gemini 3.5 Flash Cyber: ограниченная модель для исправления кода

Автоматические vulnerability scanners теперь находят flaws быстрее, чем большинство security teams успевают их закрывать, и именно на этот разрыв Google ориентирует Gemini 3.5 Flash Cyber.

Модель создана для проверки и исправления code vulnerabilities, а по результатам benchmark CyberGym Google называет ее конкурентоспособной с frontier models, хотя не публикует эти цифры с той же детализацией, что и для потребительских релизов.

Распространение остается ограниченным government и vetted partners в рамках pilot programme — как мерой защиты от того, чтобы модель генерировала exploit code для offensive use.

Внутри security agent CodeMender от Google несколько экземпляров 3.5 Flash Cyber работают параллельно, перепроверяя выводы друг друга, прежде чем сформировать единый remediation report, который затем утверждает human reviewer.

Команды инженеров, которые хотят интегрировать новые модели, могут получить доступ к ним через Gemini API в Google AI Studio, Android Studio или Gemini Enterprise Agent Platform. Пользователи также могут работать с новыми моделями в приложении Gemini, а 3.5 Flash-Lite дополнительно разворачивается в Google Search.

См. также: Bristol Myers Squibb покупает AI-систему Nvidia для drug discovery


Материал — перевод статьи с английского.

Оригинал: Google’s Gemini 3.6 Flash targets enterprise agent token costs