Gemini 3.7 Flash: бенчмарки, цена и вызов по API

Gemini 3.7 Flash: бенчмарки, цена и вызов по API

Google выпустил Gemini 3.7 Flash 13 августа 2026 года — через три недели после 3.6 Flash. Для разработчика тут три практических изменения: вдвое ниже цена, заметный скачок на агентных и кодовых бенчмарках и другой способ управлять мышлением модели — thinking_budget заменили на thinking_level.

Ниже — характеристики из документации, цифры бенчмарков и запросы, которые я прогнал через наш шлюз перед публикацией. Всё, что помечено как замер, — это реальные ответы API, а не пересказ анонса.

Что вышло

Модель в API называется gemini-3.7-flash. Ключевое из карточки модели:

ПараметрЗначение
Входтекст, изображение, видео, аудио, PDF
Выходтекст
Лимит входа1 048 576 токенов
Лимит выхода65 536 токенов
Мышлениеthinking_level: low, medium (по умолчанию), high
Естьfunction calling, structured outputs, code execution, file search, search grounding, Google Maps, context caching, Batch / Flex / Priority
Previewcomputer use
Нетгенерация изображений, генерация аудио, Live API

Значение minimal для thinking_level в 3.7 Flash не поддерживается: в родном Gemini API оно возвращает ошибку валидации. Контекст остался прежним — тот же миллион токенов, что у 3.6 Flash.

Минимальный запрос

API GPTunneL совместим с OpenAI, поэтому вызов — обычный POST /v1/chat/completions. Ключ идёт в Authorization без префикса Bearer:

bash
curl https://gptunnel.ru/v1/chat/completions \
  -H "Authorization: <ВАШ_API_КЛЮЧ>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [{"role": "user", "content": "Ответь одним словом: столица Франции?"}]
  }'

Ответ:

JSON
{
  "model": "gemini-3.7-flash",
  "choices": [{"message": {"role": "assistant", "content": "Париж"}, "finish_reason": "stop"}],
  "usage": {
    "prompt_tokens": 11,
    "completion_tokens": 103,
    "total_tokens": 114,
    "prompt_cost": 0.00165,
    "completion_cost": 0.07725,
    "total_cost": 0.0789,
    "prompt_tokens_details": {"cached_tokens": 0}
  }
}

Смотри на completion_tokens: одно слово «Париж» стоило 103 выходных токена. Это рассуждающая модель — токены мышления считаются как выход и оплачиваются по выходному тарифу. Если ты закладывал бюджет по длине видимого ответа, пересчитай.

Схема: запрос проходит через камеру мышления, где расходуются невидимые токены, и выходит коротким ответом

Поле usage в ответе шлюза сразу содержит стоимость в рублях — по нему и считай расход, а не по своим оценкам токенизации.

Что выросло по бенчмаркам

Google меряет 3.7 Flash не на школьных задачах, а на длинных инженерных. Сравнение с 3.6 Flash:

Бенчмарк3.6 Flash3.7 Flash
FrontierCode 1.1 Main (качество продакшн-кода)34,4%43,6%
DeepSWE v1.1 (длинные задачи разработки)49,0%65,3%
GDP.pdf (разбор сложных PDF)22,0%34,0%
AutomationBench17,0%30,4%
WebDev Arena (Elo)15381588

На FrontierCode 1.1 Main 43,6% — это выше Claude Sonnet 5 (42,7%) и GPT-5.6 Terra (41,3%). На юридическом Harvey LAB-AA модель даёт 90,7%.

Artificial Analysis ставит 3.7 Flash (high) 56 баллов Intelligence Index — плюс 4 к 3.6 Flash и вплотную к GPT-5.6 Terra и Muse Spark 1.2 (по 57). При этом скорость — около 340 выходных токенов в секунду, почти втрое быстрее GPT-5.6 Terra, а среднее время на задачу — 1,7 минуты. На агентном AA-AnalystAgent модель проходит 60% против 54% у Claude Opus 5 в режиме max.

Практический вывод: прирост лежит в длинных циклах с инструментами, а не в качестве болтовни. Если у тебя агент, который час чинит тесты, разница будет видна. Если классификатор тикетов — вряд ли.

thinking_level вместо thinking_budget

Главное изменение в API. Раньше глубина мышления задавалась числом токенов (thinking_budget), теперь — строковым enum:

Python
from openai import OpenAI

client = OpenAI(api_key="<ВАШ_API_КЛЮЧ>", base_url="https://gptunnel.ru/v1")

r = client.chat.completions.create(
    model="gemini-3.7-flash",
    messages=[{"role": "user", "content": "Найди гонку в этом коде: ..."}],
    extra_body={"thinking_level": "high"},
)
print(r.usage.completion_tokens)

Замер. Через gptunnel.ru/v1 параметр принимается без ошибки, но на расход не влияет. Одна и та же комбинаторная задача, по три прогона на уровень: low — 755, 555, 576 выходных токенов; high — 451, 333, 491. Разброс внутри уровня больше, чем разница между уровнями, а minimal, который родной Gemini API отвергает, наш шлюз спокойно принимает и отвечает. То есть до модели поле не доезжает.

Что с этим делать: не планировать экономию на уровнях мышления и мерить расход на своей нагрузке. Ответ, кстати, во всех девяти прогонах был правильный.

Стриминг и структурированный вывод

Стриминг работает штатно, stream: true. Ответ на 300 слов приехал 28 чанками. Единственная неочевидная деталь — шлюз шлёт keepalive-комментарии : HELLO и : PROCESSING до первого чанка данных, и наивный парсер на них падает:

JavaScript
const res = await fetch("https://gptunnel.ru/v1/chat/completions", {
  method: "POST",
  headers: { Authorization: KEY, "Content-Type": "application/json" },
  body: JSON.stringify({ model: "gemini-3.7-flash", stream: true, messages }),
});

for await (const chunk of res.body) {
  for (const line of new TextDecoder().decode(chunk).split("\n")) {
    if (!line.startsWith("data: ")) continue;      // отсекает ": HELLO" и ": PROCESSING"
    const payload = line.slice(6);
    if (payload === "[DONE]") break;
    process.stdout.write(JSON.parse(payload).choices[0].delta.content ?? "");
  }
}

Structured outputs тоже на месте — response_format со схемой возвращает валидный JSON:

bash
-d '{
  "model": "gemini-3.7-flash",
  "response_format": {"type": "json_schema", "json_schema": {"name": "invoice", "strict": true,
    "schema": {"type": "object", "properties": {"number": {"type": "string"}, "total": {"type": "number"}},
    "required": ["number", "total"], "additionalProperties": false}}},
  "messages": [{"role": "user", "content": "Счёт №A-114 на 25000 рублей. Верни JSON."}]
}'

На выходе — {"number":"A-114","total":25000} за 304 выходных токена. Извлечение полей из документа стоит дороже, чем кажется по длине результата: платишь опять же за мышление.

Что сломается в проде

  • max_tokens съедается мышлением. Замер: с max_tokens: 16 модель вернула finish_reason: "length" и пустую строку контента, потратив 13 выходных токенов. Ты платишь и не получаешь ничего. Ставь потолок с запасом на рассуждения, а короткие ответы проси промптом.
  • Таймауты. На высоком уровне рассуждений среднее время задачи — минуты. Клиентский таймаут в 30 секунд будет рвать нормальные ответы; ставь 180 секунд и ретраи с экспоненциальной паузой.
  • Потолок выхода — 65 536 токенов. Генерацию длинных документов режь на части сам.
  • cached_tokens в ответе. Пока в замерах он был нулевым; на повторяющемся системном промпте считай экономию по этому полю, а не по обещаниям кеша.
  • Уровень мышления не управляется через шлюз (см. выше) — закладывай в бюджет верхнюю границу.

3.7 Flash или 3.1 Pro

Частый вопрос при выборе. По каталогу GPTunneL Gemini 3.1 Pro стоит 600 ₽ за 1M входных токенов и 3000 ₽ за 1M выходных — вчетверо дороже 3.7 Flash при том же контексте в миллион токенов. Pro остаётся выбором для задач, где важна максимальная глубина одного ответа. Для агентных циклов, где модель вызывается сотни раз подряд, экономика Flash перевешивает: те же 340 токенов в секунду и вчетверо меньший счёт превращаются в другую скорость итераций.

Сколько стоит

В GPTunneL Gemini 3.7 Flash тарифицируется за токены: 150 ₽ за 1M токенов на входе и 750 ₽ за 1M на выходе, контекст — 1M токенов. Это ровно вдвое дешевле 3.6 Flash (300 ₽ и 1500 ₽), которая всё ещё в каталоге. У самого Google действует вводная цена $0,75 и $3,75 за 1M токенов до конца 2026 года, дальше — стандартные $1,50 и $7,50. Актуальные цифры по всем моделям — на странице цен.

Частые вопросы

Можно ли скачать Gemini 3.7 Flash? Нет. Открытых весов у линейки Gemini нет, модель работает только через API и облачные интерфейсы Google. Локально её не развернуть.

Это самая сильная Gemini? Она самая сильная в линейке Flash и по индексу Artificial Analysis (56) стоит рядом с флагманами конкурентов. Но Flash — это про скорость и цену: там, где нужна максимальная глубина одного ответа, Pro-линейка остаётся впереди.

Чем 3.7 Flash отличается от 3.6 Flash? Скачком на кодовых и агентных бенчмарках (DeepSWE 49,0% → 65,3%), новым thinking_level вместо thinking_budget и вдвое меньшей ценой. Лимиты контекста и выхода те же.

Нужен ли VPN? В GPTunneL — нет: модель доступна из России напрямую, оплата российскими картами в рублях, подписка не нужна, счёт идёт за фактические токены.

Попробуй сам

Возьми свою реальную задачу — не «напиши стихотворение», а тот самый агентный цикл с инструментами, который ты гоняешь на 3.6 Flash. Открой Gemini 3.7 Flash в GPTunneL или подставь gemini-3.7-flash в свой код с base_url=https://gptunnel.ru/v1 и сравни две цифры: total_cost и время до готового результата. Остальные бенчмарки за тебя уже посчитали.