Google выпустил Gemini 3.7 Flash 13 августа 2026 года — через три недели после 3.6 Flash. Для разработчика тут три практических изменения: вдвое ниже цена, заметный скачок на агентных и кодовых бенчмарках и другой способ управлять мышлением модели — thinking_budget заменили на thinking_level.
Ниже — характеристики из документации, цифры бенчмарков и запросы, которые я прогнал через наш шлюз перед публикацией. Всё, что помечено как замер, — это реальные ответы API, а не пересказ анонса.
Что вышло
Модель в API называется gemini-3.7-flash. Ключевое из карточки модели:
| Параметр | Значение |
|---|---|
| Вход | текст, изображение, видео, аудио, PDF |
| Выход | текст |
| Лимит входа | 1 048 576 токенов |
| Лимит выхода | 65 536 токенов |
| Мышление | thinking_level: low, medium (по умолчанию), high |
| Есть | function calling, structured outputs, code execution, file search, search grounding, Google Maps, context caching, Batch / Flex / Priority |
| Preview | computer use |
| Нет | генерация изображений, генерация аудио, Live API |
Значение minimal для thinking_level в 3.7 Flash не поддерживается: в родном Gemini API оно возвращает ошибку валидации. Контекст остался прежним — тот же миллион токенов, что у 3.6 Flash.
Минимальный запрос
API GPTunneL совместим с OpenAI, поэтому вызов — обычный POST /v1/chat/completions. Ключ идёт в Authorization без префикса Bearer:
curl https://gptunnel.ru/v1/chat/completions \
-H "Authorization: <ВАШ_API_КЛЮЧ>" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [{"role": "user", "content": "Ответь одним словом: столица Франции?"}]
}'Ответ:
{
"model": "gemini-3.7-flash",
"choices": [{"message": {"role": "assistant", "content": "Париж"}, "finish_reason": "stop"}],
"usage": {
"prompt_tokens": 11,
"completion_tokens": 103,
"total_tokens": 114,
"prompt_cost": 0.00165,
"completion_cost": 0.07725,
"total_cost": 0.0789,
"prompt_tokens_details": {"cached_tokens": 0}
}
}Смотри на completion_tokens: одно слово «Париж» стоило 103 выходных токена. Это рассуждающая модель — токены мышления считаются как выход и оплачиваются по выходному тарифу. Если ты закладывал бюджет по длине видимого ответа, пересчитай.

Поле usage в ответе шлюза сразу содержит стоимость в рублях — по нему и считай расход, а не по своим оценкам токенизации.
Что выросло по бенчмаркам
Google меряет 3.7 Flash не на школьных задачах, а на длинных инженерных. Сравнение с 3.6 Flash:
| Бенчмарк | 3.6 Flash | 3.7 Flash |
|---|---|---|
| FrontierCode 1.1 Main (качество продакшн-кода) | 34,4% | 43,6% |
| DeepSWE v1.1 (длинные задачи разработки) | 49,0% | 65,3% |
| GDP.pdf (разбор сложных PDF) | 22,0% | 34,0% |
| AutomationBench | 17,0% | 30,4% |
| WebDev Arena (Elo) | 1538 | 1588 |
На FrontierCode 1.1 Main 43,6% — это выше Claude Sonnet 5 (42,7%) и GPT-5.6 Terra (41,3%). На юридическом Harvey LAB-AA модель даёт 90,7%.
Artificial Analysis ставит 3.7 Flash (high) 56 баллов Intelligence Index — плюс 4 к 3.6 Flash и вплотную к GPT-5.6 Terra и Muse Spark 1.2 (по 57). При этом скорость — около 340 выходных токенов в секунду, почти втрое быстрее GPT-5.6 Terra, а среднее время на задачу — 1,7 минуты. На агентном AA-AnalystAgent модель проходит 60% против 54% у Claude Opus 5 в режиме max.
Практический вывод: прирост лежит в длинных циклах с инструментами, а не в качестве болтовни. Если у тебя агент, который час чинит тесты, разница будет видна. Если классификатор тикетов — вряд ли.
thinking_level вместо thinking_budget
Главное изменение в API. Раньше глубина мышления задавалась числом токенов (thinking_budget), теперь — строковым enum:
from openai import OpenAI
client = OpenAI(api_key="<ВАШ_API_КЛЮЧ>", base_url="https://gptunnel.ru/v1")
r = client.chat.completions.create(
model="gemini-3.7-flash",
messages=[{"role": "user", "content": "Найди гонку в этом коде: ..."}],
extra_body={"thinking_level": "high"},
)
print(r.usage.completion_tokens)Замер. Через gptunnel.ru/v1 параметр принимается без ошибки, но на расход не влияет. Одна и та же комбинаторная задача, по три прогона на уровень: low — 755, 555, 576 выходных токенов; high — 451, 333, 491. Разброс внутри уровня больше, чем разница между уровнями, а minimal, который родной Gemini API отвергает, наш шлюз спокойно принимает и отвечает. То есть до модели поле не доезжает.
Что с этим делать: не планировать экономию на уровнях мышления и мерить расход на своей нагрузке. Ответ, кстати, во всех девяти прогонах был правильный.
Стриминг и структурированный вывод
Стриминг работает штатно, stream: true. Ответ на 300 слов приехал 28 чанками. Единственная неочевидная деталь — шлюз шлёт keepalive-комментарии : HELLO и : PROCESSING до первого чанка данных, и наивный парсер на них падает:
const res = await fetch("https://gptunnel.ru/v1/chat/completions", {
method: "POST",
headers: { Authorization: KEY, "Content-Type": "application/json" },
body: JSON.stringify({ model: "gemini-3.7-flash", stream: true, messages }),
});
for await (const chunk of res.body) {
for (const line of new TextDecoder().decode(chunk).split("\n")) {
if (!line.startsWith("data: ")) continue; // отсекает ": HELLO" и ": PROCESSING"
const payload = line.slice(6);
if (payload === "[DONE]") break;
process.stdout.write(JSON.parse(payload).choices[0].delta.content ?? "");
}
}Structured outputs тоже на месте — response_format со схемой возвращает валидный JSON:
-d '{
"model": "gemini-3.7-flash",
"response_format": {"type": "json_schema", "json_schema": {"name": "invoice", "strict": true,
"schema": {"type": "object", "properties": {"number": {"type": "string"}, "total": {"type": "number"}},
"required": ["number", "total"], "additionalProperties": false}}},
"messages": [{"role": "user", "content": "Счёт №A-114 на 25000 рублей. Верни JSON."}]
}'На выходе — {"number":"A-114","total":25000} за 304 выходных токена. Извлечение полей из документа стоит дороже, чем кажется по длине результата: платишь опять же за мышление.
Что сломается в проде
max_tokensсъедается мышлением. Замер: сmax_tokens: 16модель вернулаfinish_reason: "length"и пустую строку контента, потратив 13 выходных токенов. Ты платишь и не получаешь ничего. Ставь потолок с запасом на рассуждения, а короткие ответы проси промптом.- Таймауты. На высоком уровне рассуждений среднее время задачи — минуты. Клиентский таймаут в 30 секунд будет рвать нормальные ответы; ставь 180 секунд и ретраи с экспоненциальной паузой.
- Потолок выхода — 65 536 токенов. Генерацию длинных документов режь на части сам.
cached_tokensв ответе. Пока в замерах он был нулевым; на повторяющемся системном промпте считай экономию по этому полю, а не по обещаниям кеша.- Уровень мышления не управляется через шлюз (см. выше) — закладывай в бюджет верхнюю границу.
3.7 Flash или 3.1 Pro
Частый вопрос при выборе. По каталогу GPTunneL Gemini 3.1 Pro стоит 600 ₽ за 1M входных токенов и 3000 ₽ за 1M выходных — вчетверо дороже 3.7 Flash при том же контексте в миллион токенов. Pro остаётся выбором для задач, где важна максимальная глубина одного ответа. Для агентных циклов, где модель вызывается сотни раз подряд, экономика Flash перевешивает: те же 340 токенов в секунду и вчетверо меньший счёт превращаются в другую скорость итераций.
Сколько стоит
В GPTunneL Gemini 3.7 Flash тарифицируется за токены: 150 ₽ за 1M токенов на входе и 750 ₽ за 1M на выходе, контекст — 1M токенов. Это ровно вдвое дешевле 3.6 Flash (300 ₽ и 1500 ₽), которая всё ещё в каталоге. У самого Google действует вводная цена $0,75 и $3,75 за 1M токенов до конца 2026 года, дальше — стандартные $1,50 и $7,50. Актуальные цифры по всем моделям — на странице цен.
Частые вопросы
Можно ли скачать Gemini 3.7 Flash? Нет. Открытых весов у линейки Gemini нет, модель работает только через API и облачные интерфейсы Google. Локально её не развернуть.
Это самая сильная Gemini? Она самая сильная в линейке Flash и по индексу Artificial Analysis (56) стоит рядом с флагманами конкурентов. Но Flash — это про скорость и цену: там, где нужна максимальная глубина одного ответа, Pro-линейка остаётся впереди.
Чем 3.7 Flash отличается от 3.6 Flash? Скачком на кодовых и агентных бенчмарках (DeepSWE 49,0% → 65,3%), новым thinking_level вместо thinking_budget и вдвое меньшей ценой. Лимиты контекста и выхода те же.
Нужен ли VPN? В GPTunneL — нет: модель доступна из России напрямую, оплата российскими картами в рублях, подписка не нужна, счёт идёт за фактические токены.
Попробуй сам
Возьми свою реальную задачу — не «напиши стихотворение», а тот самый агентный цикл с инструментами, который ты гоняешь на 3.6 Flash. Открой Gemini 3.7 Flash в GPTunneL или подставь gemini-3.7-flash в свой код с base_url=https://gptunnel.ru/v1 и сравни две цифры: total_cost и время до готового результата. Остальные бенчмарки за тебя уже посчитали.



