Gemini 3.6 Flash: Google продвигает модель для более дешевых агентных задач
Gemini 3.6 Flash - новая стабильная модель Google для кода, анализа документов, мультимодальных задач и длинного контекста. Ее главный смысл не в одном рекордном бенчмарке, а в попытке снизить стоимость многошаговых...

Gemini 3.6 Flash - новая стабильная модель Google для кода, анализа документов, мультимодальных задач и длинного контекста. Ее главный смысл не в одном рекордном бенчмарке, а в попытке снизить стоимость многошаговых агентных workflow: меньше выходных токенов, меньше лишних действий и меньше циклов правок.
Короткий вывод: кому тестировать, а кому подождать
Gemini 3.6 Flash стоит тестировать командам, которые уже используют Gemini 3.5 Flash в кодовых, документных или агентных сценариях и платят заметную долю бюджета за выходные токены. По состоянию на 23 июля 2026 года в прайсе Google Cloud для Generative AI on Gemini Enterprise Agent Platform у 3.6 Flash такая же стандартная цена ввода, как у 3.5 Flash в глобальном режиме, но ниже цена текстового вывода: $7,50 против $9,00 за 1 млн токенов.
Подождать с автоматической миграцией стоит тем, у кого в продакшене завязаны нестандартные параметры генерации или тонкая совместимость API. На странице Google Cloud для `gemini-3.6-flash` прямо перечислены потенциально несовместимые изменения: кастомные `temperature`, `top-K` и `top-P` игнорируются, кастомные frequency/presence penalty могут привести к ошибке, а запросы, где последний ход имеет роль модели, не поддерживаются.
Что объявлено и где модель доступна
По состоянию на 23 июля 2026 года страница модели в документации Google Cloud для Gemini Enterprise Agent Platform указывает идентификатор `gemini-3.6-flash`, статус GA и дату релиза 21 июля 2026 года. Там же указано, что модель доступна в глобальном регионе `global` и поддерживает Standard PayGo, Flex PayGo, Priority PayGo, Provisioned Throughput и batch inference.
Доступность по поверхностям нужно читать по нескольким источникам. В release notes Gemini API от 21 июля 2026 года Google пишет, что Gemini 3.6 Flash (`gemini-3.6-flash`) стала GA в Gemini API. Страница моделей Gemini API также относит Gemini 3.6 Flash к стабильным моделям Gemini 3. В блоге Google о запуске сказано, что модель доступна для разработчиков в Gemini API через Google AI Studio и Android Studio, для предприятий - в Gemini Enterprise Agent Platform и Gemini Enterprise app, а также в Google Antigravity и Gemini app. Модельная карточка DeepMind перечисляет каналы распространения: Gemini App, Gemini Enterprise App, Gemini Enterprise Agent Platform, Google AI Studio, Gemini API и Google Antigravity.
Эти формулировки не означают одинаковый набор функций во всех интерфейсах. Для эксплуатационного решения важнее проверять конкретную документацию нужной поверхности: например, Google Cloud-страница подробно описывает возможности именно для Gemini Enterprise Agent Platform, а Gemini API имеет собственную документацию и условия.
Характеристики: контекст, мультимодальность, вывод
По документации Google Cloud, проверенной 23 июля 2026 года, Gemini 3.6 Flash принимает текст, изображения, аудио и видео, но выводит текст. Контекстное окно составляет 1 048 576 токенов, максимальный текстовый вывод - 65 536 токенов.
Практический смысл этих лимитов - возможность работать с большими документами, длинными фрагментами кодовой базы, пачками изображений, видео и аудиозаписями без жесткой предварительной нарезки. Но это не универсальный live- или генеративно-визуальный API: на странице Google Cloud для этой модели Gemini Live API, tuning и Computer Use отмечены как неподдерживаемые.
Что Google называет улучшениями
В документации Google Cloud 3.6 Flash описана как модель, оптимизированная для многошаговой оркестрации, full-stack-рефакторинга и общего рассуждения. Google выделяет четыре группы улучшений по сравнению с предыдущими Flash-моделями:
- более высокая токенная эффективность относительно Gemini 3.5 Flash: меньше токенов и меньше ходов в многошаговых workflow;
- улучшенная генерация кода с меньшей долей ошибок компиляции и меньшим числом циклов правок;
- снижение action bias - склонности модели предпринимать действия, например править файлы, там, где пользователь просил только диагностику или чтение;
- улучшенное мультимодальное рассуждение, включая интерпретацию графиков, преобразование визуальных схем и генерацию веб-макетов из нескольких элементов.
На странице Google DeepMind также приведено сравнение «3.6 Flash vs. 3.5 Flash token efficiency SxS (API)»: Google утверждает, что новая модель показывает меньшую многословность и лучшую токенную эффективность в задаче OSWorld-Verified. Это официальный сравнительный тезис Google, а не независимый аудит.
Бенчмарки: прирост есть, но это методология поставщика
Страница Google DeepMind и модельная карточка Gemini 3.6 Flash приводят результаты «as of July 2026». Для оценки 3.6 Flash против 3.5 Flash наиболее показательно следующее:
| Метрика | Что измеряет по описанию Google | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| SWE-Bench Pro (Public) | агентные задачи программирования | 58,7% | 55,1% |
| DeepSWE v1.1 | long-horizon software engineering | 49% | 37% |
| Terminal-bench 2.1 | агентное программирование в терминале | 78,0% | 76,2% |
| MLE-Bench | machine learning engineering | 63,9% | 49,7% |
| GDPVal-AA v2 | knowledge work, Elo | 1421 | 1349 |
| OSWorld-Verified | agentic computer use | 83,0% | 78,4% |
| GDM-MRCR v2, 128k | long-context performance | 91,8% | 77,3% |
| GDM-MRCR v2, 1M | long-context performance | 54,0% | 26,6% |
Здесь важно развести терминологию. Строка OSWorld-Verified описывает бенчмарк класса «agentic computer use» - то есть поведение модели в тестовой среде с задачами управления компьютером. Она не означает, что продуктовая функция Google Computer Use API доступна для `gemini-3.6-flash`. Напротив, на странице Google Cloud для этой модели Computer Use как preview-инструмент указан со статусом «Not supported».
Эти цифры полезны как сигнал о направлении разработки: Google показывает улучшения в коде, агентных задачах, knowledge work - работе с информацией и документами - и длинном контексте. Но их нельзя автоматически переносить на конкретную внутреннюю кодовую базу, юридический архив или пользовательский интерфейс. Перед миграцией нужны собственные evals: тесты качества, стоимости, задержки, числа повторных попыток и доли нежелательных действий.
Независимый сервис Artificial Analysis ведет отдельный профиль Gemini 3.6 Flash с метриками интеллекта, производительности и цены. Это не первичный источник Google: методология, состав индекса и значения на странице Artificial Analysis могут обновляться независимо от документации и модельной карточки Google. Поэтому его данные лучше использовать как внешний ориентир, а не как подтверждение заявлений поставщика.
Экономика: где возникает экономия
По прайсу Google Cloud для Generative AI on Agent Platform, проверенному 23 июля 2026 года, стандартные цены в разделе Google models → Gemini 3 → Standard для Gemini 3.6 Flash составляют $1,50 за 1 млн входных токенов и $7,50 за 1 млн текстовых выходных токенов. Кэшированный ввод стоит $0,15 за 1 млн токенов. В этом же прайсе Priority для 3.6 Flash стоит $2,70 за 1 млн входных токенов и $13,50 за 1 млн текстовых выходных токенов, а Flex/Batch - $0,75 и $3,75 соответственно.
Для Gemini 3.5 Flash на той же странице указаны стандартные цены $1,50 за 1 млн входных токенов и $9,00 за 1 млн текстовых выходных токенов в Global; для Non-global - $1,65 и $9,90 соответственно. Поэтому прямое ценовое преимущество 3.6 Flash в этом конкретном прайсе прежде всего в output-части. Если к нему добавляется заявленное Google сокращение числа токенов и ходов в агентных цепочках, итоговая стоимость задачи может снижаться сильнее, чем видно из одной строки прайса.
Эти цены нельзя считать универсальными для всех каналов. Речь идет о Google Cloud / Gemini Enterprise Agent Platform pricing в долларах США; фактическая стоимость может зависеть от валюты, платформы, региона, SKU, режима потребления, grounding-функций, договорных enterprise-условий и последующих обновлений прайса.
Сравнение с 3.5 Flash: только проверенные параметры
| Параметр | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Статус в Gemini API models, 23 июля 2026 | Stable | Stable |
| Стандартный ввод, Google Cloud Agent Platform | $1,50 / 1 млн токенов | $1,50 / 1 млн токенов в Global |
| Текстовый вывод, Google Cloud Agent Platform | $7,50 / 1 млн токенов | $9,00 / 1 млн токенов в Global |
| Кэшированный ввод, Standard | $0,15 / 1 млн токенов | $0,15 / 1 млн токенов в Global |
| Контекст и max output | 1 048 576 / 65 536 токенов по Google Cloud | не сравнивается здесь: для публикационного сравнения нужен отдельный источник по конкретной поверхности |
| Заявленные улучшения Google | токенная эффективность, код, меньше action bias, мультимодальное рассуждение | базовая точка сравнения в документации Google |
| Миграционные риски | ограничения параметров и последнего хода с ролью model | существующие интеграции могут полагаться на старое поведение |
Главное отличие в продуктовой логике: 3.6 Flash продается не только как более сильная модель, а как способ удешевить выполнение многошаговых задач. Это особенно важно для агентов, где стоимость запроса складывается из планирования, вызовов инструментов, чтения результатов, исправлений и финального ответа.
Где модель может быть полезна
Первый сценарий - программирование и сопровождение кодовой базы. 3.6 Flash можно тестировать для рефакторинга, анализа pull request, генерации тестов, миграций между версиями фреймворков и работы в IDE-агентах. Если снижение action bias подтвердится в конкретной среде, это может уменьшить число нежелательных правок.
Второй сценарий - корпоративная работа с документами. Большое контекстное окно, ввод изображений, аудио и видео, а также RAG и URL context на Google Cloud-странице делают модель кандидатом для анализа договоров, отчетов, презентаций, финансовых материалов и внутренней документации.
Третий сценарий - агентные процессы: цепочки, где модель планирует действия, вызывает инструменты, анализирует результаты и продолжает выполнение. Здесь важны не только рассуждения, но и дисциплина: не править файлы без запроса, не делать лишние действия и не уходить в дорогие циклы повторных попыток.
Четвертый сценарий - мультимодальная аналитика: анализ скриншотов интерфейсов, схем, графиков, записей встреч и видеоматериалов. Ограничение прежнее: выход у этой модели текстовый, а не изображение или live-аудио.
Ограничения и риски
У Gemini 3.6 Flash остаются обычные риски больших языковых и мультимодальных моделей: фактические ошибки, уверенные неверные ответы и нестабильность на нестандартных задачах. Для свежих данных и корпоративных знаний модель нужно заземлять через поиск, RAG или внутренние проверяемые источники там, где эти функции поддерживаются выбранной поверхностью.
Миграционные ограничения заслуживают отдельного теста. Если приложение явно задает `temperature`, `top-K`, `top-P`, frequency penalty или presence penalty, поведение может измениться или запрос начнет возвращать ошибку. Если диалоговый стек иногда отправляет запрос с последним ходом от модели, это также нужно исправлять до переключения.
Наконец, бенчмарки не заменяют внутренних испытаний. Минимальный набор метрик для пилота: стоимость одной успешно завершенной задачи, средняя задержка, число вызовов инструментов, доля повторных попыток, доля нежелательных действий, качество финального результата и ручное время на проверку.
Рыночный контекст
Gemini 3.6 Flash отражает общий сдвиг рынка: поставщики моделей конкурируют не только за максимальные баллы, но и за стоимость выполнения реальных задач. Для компаний, строящих агентов, лишний шаг - это не абстрактная многословность, а деньги, задержка и дополнительный риск.
У Google здесь сильная инфраструктурная позиция: модель включена в Gemini API, Google AI Studio, Gemini Enterprise Agent Platform, Gemini Enterprise app, Gemini app и Google Antigravity, согласно источникам Google, проверенным 23 июля 2026 года. Но набор функций, лимиты, цены и условия надо сверять отдельно по той поверхности, через которую компания реально будет вызывать модель.
Более нейтральный вывод таков: Google позиционирует Gemini 3.6 Flash как модель для массовых агентных задач, где важны качество, скорость и стоимость. Для пользователей 3.5 Flash это очевидный кандидат на пилотную миграцию, но не на слепую замену без собственных тестов.
Источники
- Google Cloud, Gemini 3.6 Flash model page, проверено 23 июля 2026: https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/gemini/3-6-flash
- Google Cloud, Generative AI on Agent Platform pricing, проверено 23 июля 2026: https://cloud.google.com/gemini-enterprise-agent-platform/generative-ai/pricing
- Google AI for Developers, Gemini API release notes, 21 июля 2026: https://ai.google.dev/gemini-api/docs/changelog
- Google AI for Developers, Gemini API models, проверено 23 июля 2026: https://ai.google.dev/gemini-api/docs/models
- Google DeepMind, Gemini models and benchmarks, проверено 23 июля 2026: https://deepmind.google/models/gemini/
- Google DeepMind, Gemini 3.6 Flash model card, опубликовано 21 июля 2026: https://deepmind.google/models/model-cards/gemini-3-6-flash/
- Google blog, 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber, 21 июля 2026: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
- Artificial Analysis, Gemini 3.6 Flash profile, проверено 23 июля 2026: https://artificialanalysis.ai/models/gemini-3-6-flash