13 августа Google выпустила Gemini 3.7 Flash, новую версию рабочей модели, которая ставит в центр кодинг, агентные сценарии и работу со знаниями. Цены на API до конца 2026 года вдвое ниже обычных: 0,75 доллара за миллион входных токенов и 3,75 доллара за миллион выходных. Предыдущая версия, 3.6 Flash, вышла всего три недели назад, и такой короткий цикл Google объясняет обратной связью разработчиков и улучшением алгоритмов.
Что изменилось в Gemini 3.7 Flash
Google называет модель «самым умным рабочим инструментом для кода и агентов». Компания говорит, что модель лучше адаптируется при столкновении с препятствиями, уточняет намерения и точнее следует инструкциям. В корпоративном агенте для кода модель, которая делает меньше лишних правок, восстанавливается после ошибок и надёжнее выполняет многошаговые планы, сокращает число ручных вмешательств. Тот же принцип работает для бизнес-агентов, которые ходят по документам и приложениям: неверный вызов инструмента или плохо понятая инструкция рушат весь процесс.
Google говорит, что 3.7 Flash «думает старательнее»: тратит больше усилий на многошаговое планирование и вызовы инструментов. Цель - более дисциплинированное выполнение с меньшим числом повторов и ручного контроля. Это заметная эволюция от 3.6 Flash, где разработчики Google старались сокращать число шагов рассуждений и вызовов, чтобы не допустить зацикливания. В 3.7 акцент сместился на достаточные усилия при планировании и качество исполнения.
В DeepMind добавили, что модель стала лучше отлаживать код и решать проблемы, собирает более рабочие веб-макеты и приложения с меньшего числа промптов, лучше рассуждает и точнее работает на реальных бизнес-процессах.
Цифры на бенчмарках
На FrontierCode 1.1 Main, тесте качества продакшн-кода, Gemini 3.7 Flash набирает 43,6% против 34,4% у 3.6 Flash. Это чуть выше 42,7% у Claude Sonnet 5 и 41,3% у GPT-5.6 Terra, по данным Google. На DeepSWE v1.1, оценке длинной инженерной работы, модель достигает 65,3% против 49,0% у предшественницы, но GPT-5.6 Terra впереди с 69,6%.
Веб-разработка показывает заметный рост. На Code Arena у Gemini 3.7 Flash Elo 1588 против 1538 у 3.6 Flash, 1541 у Claude Sonnet 5 и 1523 у GPT-5.6 Terra. По словам Google, новая модель собирает более функциональные макеты и готовые приложения с меньшего числа промптов и точнее следует референсным скриншотам и дизайн-системам.
Цифры: Gemini 3.7 Flash - 43,6% на FrontierCode 1.1 (у 3.6 было 34,4%), 65,3% на DeepSWE v1.1, Elo 1588 на Code Arena. Цена до конца 2026 года: 0,75 доллара за миллион входных токенов, 3,75 доллара за миллион выходных. С 1 января 2027 года ставки удваиваются.
Общая таблица бенчмарков более смешанная, и это стоит учесть компаниям, которые выбирают модель под конкретные задачи, а не ищут одного «лучшего» игрока. На Terminal-bench 2.1 Gemini 3.7 Flash набирает 85,8% против 87,4% у GPT-5.6 Terra. Terra также впереди на Terminal-bench 3.0 и OSWorld-2.0. Claude Sonnet 5 лидирует на мультимодальном Agent's Last Exam с 33,3% против 26,3% у Gemini 3.7 Flash.
Иными словами, собственные результаты Google не показывают, что 3.7 Flash повсеместно вытесняет более дорогих конкурентов. Они показывают модель, которая стала заметно конкурентоспособнее в коде и агентных задачах, оставаясь в более дешёвой ценовой категории.
Бизнес-процессы: где рост заметнее всего
На AutomationBench, который Google описывает как тест автоматизации корпоративных процессов, Gemini 3.7 Flash набирает 30,4% против 17,0% у 3.6 Flash. В таблице Google у Claude Sonnet 5 - 10,7%, у GPT-5.6 Terra - 23,6%. На GDP.PDF, оценке понимания сложных PDF, модель достигает 34,0% против 22,0% у 3.6 Flash, 28,0% у Claude Sonnet 5 и 24,7% у GPT-5.6 Terra.
Эта комбинация важна для корпоративных агентов: реальные внедрения требуют большего, чем генерация текста или кода. Агенту нужно прочитать длинный отчёт, найти нужную информацию, решить, какой инструмент вызвать, обновить систему и подготовить документ для человека. Надёжность всей цепочки часто важнее результата на отдельном тесте рассуждений.
Google уже использует модель в Gemini Spark, личном AI-агенте компании. Подписчики Google AI Pro и Ultra получили 3.7 Flash в Spark с улучшенной работой со знаниями и инструментами Workspace: консолидация файлов, черновики писем, обновление статусов. Для предприятий модель доступна через Gemini Enterprise Agent Platform и приложение Gemini Enterprise.
«Модель стала заметно конкурентоспособнее в коде и агентных задачах, оставаясь в более дешёвой ценовой категории. Собственные результаты Google не показывают, что 3.7 Flash повсеместно вытесняет более дорогих конкурентов» - VentureBeat.
Экономика: считаем завершённые задачи
До 31 декабря разработчики платят 0,75 доллара за миллион входных токенов и 3,75 доллара за миллион выходных. Кеш контекста во вводный период стоит 0,075 доллара за миллион токенов. С 1 января 2027 года стандартные цены удваиваются: 1,50 доллара за входные и 7,50 за выходные, кеш - 0,15 доллара. Для сравнения: стандартный тариф Gemini 3.6 Flash - 1,50 и 7,50 доллара. Claude Sonnet 5 в таблице Google стоит 2 и 10 долларов, GPT-5.6 Terra - 2 и 12 долларов.
Для автономных агентов экономика заметнее: один запрос пользователя порождает длинную цепочку вызовов модели, токенов рассуждений и взаимодействий с инструментами. Модель, которая дешевле за токен, но требует заметно больше повторов, в итоге может оказаться дороже. И наоборот: сочетание низкой вводной цены и улучшенной точности с первого раза может изменить стоимость высоконагруженных агентов для кода и обработки документов, если эти улучшения сохранятся в проде.
Именно эту метрику компаниям и стоит тестировать: не цену миллиона токенов саму по себе, а стоимость успешно завершённой задачи.
Контекст: Google без флагмана
Запуск идёт на фоне спора о том, теряет ли Google позиции на фронтире. Gemini 3.5 Pro так и не вышла, хотя в мае компания обещала релиз в следующем месяце. В июле Google говорила, что модель проходит партнёрское тестирование. Reuters писал, что 3.5 Pro не достигла внутренних целей, особенно в коде, пока Google начинает обучение Gemini 4, «самой амбициозной модели». На прошлой неделе Google объявила о крупной перестройке руководства AI: Демис Хассабис отошёл от операционного управления DeepMind, бывший CTO Koray Kavukcuoglu теперь руководит подразделением, а часть ключевых исследователей ушла в стартап Discovery Loop.
В Artificial Analysis модель получает 56 баллов в индексе интеллекта против 52 у 3.6 Flash и 63 у Claude Opus 5. Ранние результаты Arena предварительно ставят 3.7 Flash на девятое место. Картина такая: Google укрепилась в быстром выпуске эффективных Flash-моделей, но флагман, способный вернуть лидерство, пока не вышел. Тестом станет Gemini 4.
Что это значит для бизнеса
Трёхнедельный цикл между 3.6 и 3.7 Flash говорит о том, что алгоритмические улучшения доходят до продакшена без ожидания нового поколения флагманов. Для разработчиков это создаёт свой вопрос: модели обновляются быстро, но перед сменой версии командам всё равно нужно прогнать свои репозитории, промпты и сценарии отказов.
Для бизнеса во Владивостоке и на Дальнем Востоке практический вывод в том, что внедрение искусственного интеллекта всё меньше упирается в выбор модели и всё больше в экономику завершённой задачи. Ии агенты для бизнеса, которые работают с документами и автоматизируют рутину, теперь можно строить на модели, которая вдвое дешевле конкурентов при сопоставимом качестве в бизнес-сценариях. Автоматизация бизнес-процессов становится доступнее: вводная цена даёт несколько месяцев на тест без большого бюджета. Посчитать, где агенты окупятся в вашей компании, поможет бесплатный аудит.