Gemini 3.7 Flash: новая модель Google для автономных AI-агентов в разработке
Google выкатил Gemini 3.7 Flash — модель, заточенную под автономных AI-агентов в кодерских пайплайнах. Спустя три недели после 3.6 Flash, что для их релизного цикла уже почти неприлично быстро.

Заявленный фокус: меньше дёргать живого разработчика на ретраях, больше доверять агенту длинные цепочки tool-calls и планирование. Цена на вход — $0.75 за миллион входных токенов и $3.75 за выход до конца 2026. Для прода это выглядит как попытка урвать долю у Anthropic и OpenAI, пока те ещё спят.
Что по цифрам
Циферки на бенчмарках подросли, и заметно. FrontierCode 1.1 — 43.6% против 34.4% у предыдущей версии. DeepSWE v1.1, длинный горизонт агентного кодинга — 65.3% против 49.0%. На WebDev Arena Elo поднялся с 1538 до 1588, то есть модель стала точнее генерить целые приложения с вменяемой вёрсткой и репликацией UI по скриншоту или дизайн-системе. Документы (GDP.pdf) — 34.0% против 22.0%. Автоматизация (AutomationBench) — 30.4% против 17.0%.
Если по-человечески: агенту наконец начали доверять длинные ветки выполнения без того, чтобы через каждые пять шагов не лезть в чат с «не, ты не понял, я имел в виду…». Под капотом модель «думает усерднее» на каждом вызове инструмента — то есть меньше лотереи в длинных run-loop'ах, меньше ситуаций, когда агент сходит с рельсов на третьем bash-запросе.
Как это едят и где споткнуться
Доступ — через Gemini Spark (подписки AI Pro и Ultra), Google Antigravity и AI Studio. Сто шестьдесят стран на старте. По безопасности усилили фильтры против misuse в доменах CBRN и кибер-наступательных сценариев — звучит как маркетинговый пункт, но для корпоративных юриков это галочка, без которой в прод не пустят.
Контекст поглубже: по данным Reuters, Сергей Брин в последние месяцы подгонял ключевых сотрудников AI-подразделения сосредоточиться на Gemini, пока Alphabet пытается закрыть разрыв с конкурентами. На прошлой неделе в Google DeepMind прошла масштабная перестановка руководства, а Пичаи на июльском earnings call защищал стратегию компании после задержки флагмана и потерь в AI-кодинге. 3.7 Flash — рабочая лошадка для тех, кому нужен длинный контекст и низкая цена токена, а не топовый reasoning. Ждут 3.5 Pro как показатель того, способен ли DeepMind держать темп с Anthropic и OpenAI.
Что с этим делать на проде
Если у вас уже крутится агентный пайплайн (Cursor-подобный клиент, in-house автономный кодер на базе Gemini API или собственный инструмент на Vertex), стоит прикинуть экономику. $0.75 за миллион входных токенов — это уровень, при котором один агентский забег на рефакторинг среднего модуля перестаёт быть болью по бюджету. Выход дороже ($3.75), но генерация кода агентом обычно сильно компактнее, чем болтовня в чате.
Перед раскаткой — проверить три вещи. Первое: поведение на длинных tool-call-цепочках в вашем конкретном стеке. Циферки бенчмарков — это красиво, а реальная ребаза на вашем монорепо покажет, где 65.3% DeepSWE превращаются в 80% успешных PR или в 40% с бесконечным циклом правок. Второе: ограничения по безопасности. Если в вашем сценарии агент трогает инфру (kubectl apply, terraform apply, деплой в k8s), новые фильтры могут резать легитимные команды — это надо ловить заранее, а не в три часа ночи на проде. Третье: бэкапы, бэкапы, бэкапы. Агент с автономией и длинным контекстом способен за один забег переписать полпроекта в стиле «оптимизация, доверьтесь мне». Коммитьте до запуска, диффьте после, настройте revert через git, а не через молитву. И не забывайте про rate limits и контекстное окно — даже «длинный контекст» имеет свой предел, и если агент его словит посреди рефакторинга, привет, костыль.