Google выпустил Gemini 3.7 Flash 13 августа 2026 года — через три недели после 3.6 Flash. Для разработчика тут три практических изменения: вдвое ниже цена, заметный скачок на агентных и кодовых бенчмарках и другой способ управлять мышлением модели — вместо thinking_budget в родном API Google появился thinking_level (через наш шлюз глубина задаётся своим параметром, об этом ниже).
Ниже — характеристики из документации, цифры бенчмарков и запросы, которые я прогнал через наш шлюз перед публикацией. Всё, что помечено как замер, — это реальные ответы API, а не пересказ анонса.
Что вышло
Модель в API называется gemini-3.7-flash. Ключевое из карточки модели:
| Параметр | Значение |
|---|---|
| Вход | текст, изображение, видео, аудио, PDF |
| Выход | текст |
| Лимит входа | 1 048 576 токенов |
| Лимит выхода | 65 536 токенов |
| Мышление | thinking_level: low, medium (по умолчанию), high |
| Есть | function calling, structured outputs, code execution, file search, search grounding, Google Maps, context caching, Batch / Flex / Priority |
| Preview | computer use |
| Нет | генерация изображений, генерация аудио, Live API |
Значение minimal для thinking_level в 3.7 Flash не поддерживается: в родном Gemini API оно возвращает ошибку валидации. Контекст остался прежним — тот же миллион токенов, что у 3.6 Flash.
Минимальный запрос
API GPTunneL совместим с OpenAI, поэтому вызов — обычный POST /v1/chat/completions. Ключ идёт в Authorization без префикса Bearer:
curl https://gptunnel.ru/v1/chat/completions \
-H "Authorization: <ВАШ_API_КЛЮЧ>" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [{"role": "user", "content": "Ответь одним словом: столица Франции?"}]
}'Ответ:
{
"model": "gemini-3.7-flash",
"choices": [{"message": {"role": "assistant", "content": "Париж"}, "finish_reason": "stop"}],
"usage": {
"prompt_tokens": 11,
"completion_tokens": 103,
"total_tokens": 114,
"prompt_cost": 0.00165,
"completion_cost": 0.07725,
"total_cost": 0.0789,
"prompt_tokens_details": {"cached_tokens": 0}
}
}Смотри на completion_tokens: одно слово «Париж» стоило 103 выходных токена. Это рассуждающая модель — токены мышления считаются как выход и оплачиваются по выходному тарифу. Если ты закладывал бюджет по длине видимого ответа, пересчитай.

Поле usage в ответе шлюза сразу содержит стоимость в рублях — по нему и считай расход, а не по своим оценкам токенизации.
Что выросло по бенчмаркам
Google меряет 3.7 Flash не на школьных задачах, а на длинных инженерных. Сравнение с 3.6 Flash:
| Бенчмарк | 3.6 Flash | 3.7 Flash |
|---|---|---|
| FrontierCode 1.1 Main (качество продакшн-кода) | 34,4% | 43,6% |
| DeepSWE v1.1 (длинные задачи разработки) | 49,0% | 65,3% |
| GDP.pdf (разбор сложных PDF) | 22,0% | 34,0% |
| AutomationBench | 17,0% | 30,4% |
| WebDev Arena (Elo) | 1538 | 1588 |
На FrontierCode 1.1 Main 43,6% — это выше Claude Sonnet 5 (42,7%) и GPT-5.6 Terra (41,3%). На юридическом Harvey LAB-AA модель даёт 90,7%.
Artificial Analysis ставит 3.7 Flash (high) 56 баллов Intelligence Index — плюс 4 к 3.6 Flash и вплотную к GPT-5.6 Terra и Muse Spark 1.2 (по 57). При этом скорость — около 340 выходных токенов в секунду, почти втрое быстрее GPT-5.6 Terra, а среднее время на задачу — 1,7 минуты. На агентном AA-AnalystAgent модель проходит 60% против 54% у Claude Opus 5 в режиме max.
Практический вывод: прирост лежит в длинных циклах с инструментами, а не в качестве болтовни. Если у тебя агент, который час чинит тесты, разница будет видна. Если классификатор тикетов — вряд ли.
Глубина рассуждений: reasoning_effort, а не thinking_level
Главное изменение в API 3.7 Flash: глубина рассуждений задаётся не числом токенов (thinking_budget), а строковым enum thinking_level со значениями low, medium (по умолчанию) и high. Так это называется в родном API Google — и мигрировать thinking_budget → thinking_level нужно тем, кто ходит к Gemini напрямую.
Через наш шлюз имя другое. GPTunneL говорит на OpenAI-совместимом диалекте, поэтому глубину он принимает в reasoning_effort:
curl https://gptunnel.ru/v1/chat/completions \
-H "Authorization: <ВАШ_API_КЛЮЧ>" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"reasoning_effort": "low",
"messages": [{"role": "user", "content": "<задача>"}]
}'Замер. Одна и та же арифметическая задача, по три прогона на уровень, считаем completion_tokens:
| Уровень | Прогоны | Среднее |
|---|---|---|
reasoning_effort: low | 502, 503, 537 | 514 |
reasoning_effort: medium | 1069, 768, 939 | 925 |
reasoning_effort: high | 1131, 1371, 1749 | 1417 |
Разница трёхкратная и монотонная — параметр работает. А вот гугловский thinking_level в теле запроса не даёт ничего: на той же задаче low — 1017, 896, 935, high — 1008, 908, 617, разброс внутри уровня больше разницы между уровнями. Ошибки при этом не будет: minimal, который родной Gemini API отвергает валидацией, наш шлюз спокойно принимает и отвечает. Поле просто игнорируется.
Что запомнить: в коде под GPTunneL — reasoning_effort, thinking_level оставь для прямых вызовов Google. И проверяй эффект по completion_tokens в usage, а не по документации вендора: на gpt-5.2 тот же reasoning_effort в моих прогонах дал разброс, перекрывающий разницу между уровнями, — то есть от модели к модели поведение отличается. Ответ, кстати, был правильным на всех уровнях — на этой задаче глубина влияла только на счёт.
Стриминг и структурированный вывод
Стриминг работает штатно, stream: true. Ответ на 300 слов приехал 28 чанками. Единственная неочевидная деталь — шлюз шлёт keepalive-комментарии : HELLO и : PROCESSING до первого чанка данных, и наивный парсер на них падает:
const res = await fetch("https://gptunnel.ru/v1/chat/completions", {
method: "POST",
headers: { Authorization: KEY, "Content-Type": "application/json" },
body: JSON.stringify({ model: "gemini-3.7-flash", stream: true, messages }),
});
for await (const chunk of res.body) {
for (const line of new TextDecoder().decode(chunk).split("\n")) {
if (!line.startsWith("data: ")) continue; // отсекает ": HELLO" и ": PROCESSING"
const payload = line.slice(6);
if (payload === "[DONE]") break;
process.stdout.write(JSON.parse(payload).choices[0].delta.content ?? "");
}
}Structured outputs тоже на месте — response_format со схемой возвращает валидный JSON:
-d '{
"model": "gemini-3.7-flash",
"response_format": {"type": "json_schema", "json_schema": {"name": "invoice", "strict": true,
"schema": {"type": "object", "properties": {"number": {"type": "string"}, "total": {"type": "number"}},
"required": ["number", "total"], "additionalProperties": false}}},
"messages": [{"role": "user", "content": "Счёт №A-114 на 25000 рублей. Верни JSON."}]
}'На выходе — {"number":"A-114","total":25000} за 304 выходных токена. Извлечение полей из документа стоит дороже, чем кажется по длине результата: платишь опять же за мышление.
Что сломается в проде
max_tokensсъедается мышлением. Замер: сmax_tokens: 16модель вернулаfinish_reason: "length"и пустую строку контента, потратив 13 выходных токенов. Ты платишь и не получаешь ничего. Ставь потолок с запасом на рассуждения, а короткие ответы проси промптом.- Таймауты. На высоком уровне рассуждений среднее время задачи — минуты. Клиентский таймаут в 30 секунд будет рвать нормальные ответы; ставь 180 секунд и ретраи с экспоненциальной паузой.
- Потолок выхода — 65 536 токенов. Генерацию длинных документов режь на части сам.
cached_tokensв ответе. Пока в замерах он был нулевым; на повторяющемся системном промпте считай экономию по этому полю, а не по обещаниям кеша.- Глубина рассуждений называется
reasoning_effort(см. выше), гугловскийthinking_levelшлюз молча игнорирует — легко потерять втрое больше токенов, чем рассчитывал.
3.7 Flash или 3.1 Pro
Частый вопрос при выборе. По каталогу GPTunneL Gemini 3.1 Pro стоит 600 ₽ за 1M входных токенов и 3000 ₽ за 1M выходных — вчетверо дороже 3.7 Flash при том же контексте в миллион токенов. Pro остаётся выбором для задач, где важна максимальная глубина одного ответа. Для агентных циклов, где модель вызывается сотни раз подряд, экономика Flash перевешивает: те же 340 токенов в секунду и вчетверо меньший счёт превращаются в другую скорость итераций.
Сколько стоит
В GPTunneL Gemini 3.7 Flash тарифицируется за токены: 150 ₽ за 1M токенов на входе и 750 ₽ за 1M на выходе, контекст — 1M токенов. Это ровно вдвое дешевле 3.6 Flash (300 ₽ и 1500 ₽), которая всё ещё в каталоге. У самого Google действует вводная цена $0,75 и $3,75 за 1M токенов до конца 2026 года, дальше — стандартные $1,50 и $7,50. Актуальные цифры по всем моделям — на странице цен.
Частые вопросы
Можно ли скачать Gemini 3.7 Flash? Нет. Открытых весов у линейки Gemini нет, модель работает только через API и облачные интерфейсы Google. Локально её не развернуть.
Это самая сильная Gemini? Она самая сильная в линейке Flash и по индексу Artificial Analysis (56) стоит рядом с флагманами конкурентов. Но Flash — это про скорость и цену: там, где нужна максимальная глубина одного ответа, Pro-линейка остаётся впереди.
Чем 3.7 Flash отличается от 3.6 Flash? Скачком на кодовых и агентных бенчмарках (DeepSWE 49,0% → 65,3%), новым thinking_level вместо thinking_budget в API Google и вдвое меньшей ценой. Лимиты контекста и выхода те же.
Нужен ли VPN? В GPTunneL — нет: модель доступна из России напрямую, оплата российскими картами в рублях, подписка не нужна, счёт идёт за фактические токены.
Попробуй сам
Возьми свою реальную задачу — не «напиши стихотворение», а тот самый агентный цикл с инструментами, который ты гоняешь на 3.6 Flash. Открой Gemini 3.7 Flash в GPTunneL или подставь gemini-3.7-flash в свой код с base_url=https://gptunnel.ru/v1 и сравни две цифры: total_cost и время до готового результата. Остальные бенчмарки за тебя уже посчитали.



