Gemini 3.8 Flash: что изменилось и как вызвать по API

Gemini 3.8 Flash: что изменилось и как вызвать по API

Google выпустил Gemini 3.8 Flash 2 сентября 2026 года — третий релиз линейки Flash за шесть недель. Модель уже в каталоге GPTunneL под id gemini-3.8-flash. Коротко: API не поменялся ни на один параметр, лимиты те же, прирост — в длинных агентных задачах и профессиональных доменах. Если у тебя код под 3.7 Flash, миграция — замена строки с именем модели.

Что вышло

Из карточки модели:

ПараметрЗначение
Входтекст, изображение, видео, аудио, PDF
Выходтекст
Лимит входа1 048 576 токенов
Лимит выхода65 536 токенов
Мышлениеlow, medium, high; minimal возвращает ошибку
Естьfunction calling, structured outputs, code execution, search grounding, context caching, Batch
Previewcomputer use
Нетгенерация изображений и аудио, Live API

Таблица совпадает с 3.7 Flash строка в строку. Google прямо пишет, что скорость и цена в родном API остались прежними, а изменилось поведение: модель делает больше шагов рассуждения и чаще повторно вызывает инструменты, прежде чем отдать ответ.

Минимальный запрос

Шлюз GPTunneL совместим с OpenAI, ключ идёт в Authorization без префикса Bearer:

bash
curl https://gptunnel.ru/v1/chat/completions \
  -H "Authorization: <ВАШ_API_КЛЮЧ>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [{"role": "user", "content": "Ответь одним словом: столица Франции?"}]
  }'

Ответ, который я получил перед публикацией:

JSON
{
  "model": "gemini-3.8-flash",
  "choices": [{"message": {"role": "assistant", "content": "Париж"}, "finish_reason": "stop"}],
  "usage": {
    "prompt_tokens": 11,
    "completion_tokens": 108,
    "total_tokens": 119,
    "prompt_cost": 0.0033,
    "completion_cost": 0.162,
    "total_cost": 0.1653,
    "prompt_tokens_details": {"cached_tokens": 0}
  }
}

Одно слово — 108 выходных токенов. Мышление тарифицируется как выход, и у 3.8 Flash его по замыслу Google стало больше. Считай расход по total_cost из usage, а не по длине видимого ответа.

Глубина рассуждений через шлюз задаётся параметром reasoning_effort со значениями low, medium, high; гугловский thinking_level шлюз молча игнорирует. Замеры по уровням на 3.7 Flash — в прошлой статье, механика у 3.8 та же.

Что выросло по бенчмаркам

Google сравнивает 3.8 Flash не с прошлой версией, а с флагманами конкурентов:

Бенчмарк3.7 Flash3.8 FlashClaude Opus 5GPT-5.6 Sol
Vals Finance Agent v259,0%61,4%58,6%53,8%
Harvey Legal Agent8,8%10,0%6,7%2,5%
HLE-Verified53,6%54,9%54,4%54,5%

На DeepSWE v1.1 — длинных задачах разработки от постановки до готового патча — Google показывает результат выше 70% при стоимости заметно ниже, чем у крупных моделей; точной цифры в анонсе нет. Сторонние обзоры приводят Terminal-Bench 2.1: 90,8% против 81,6% у 3.7 Flash.

Читать это надо трезво. Прирост над 3.7 Flash — 1–2 процентных пункта на профессиональных агентных тестах, а не скачок вроде DeepSWE 49% → 65% месяц назад. Обгон Opus 5 и Sol — на узких доменных бенчмарках финансов и права. На общих агентных задачах вроде OSWorld флагманы, по сторонним сводкам, остаются впереди. Если у тебя многошаговый агент с инструментами в предметной области — стоит перепрогнать. Если классификатор или саммари — разницы не увидишь.

3.8 Flash Cyber

Вместе с основной моделью Google выпустил вариант для кибербезопасности: поиск уязвимостей в двадцати языках с успехом выше 70% и автопатчинг на CWE-Bench 47,2% pass@1. В открытый API он не попал: доступ только по программе Fairwind для госорганов, операторов инфраструктуры и мейнтейнеров. Через GPTunneL его нет и не будет, пока Google не откроет модель публично.

Что проверить перед переключением

  • max_tokens. Потолок ест мышление раньше ответа: на 3.7 Flash при max_tokens: 16 приходил пустой контент с finish_reason: "length". У 3.8 рассуждений больше — ставь запас ещё щедрее.
  • Таймауты. Дополнительные шаги и повторные вызовы инструментов — это время. Клиентский таймаут в 30 секунд будет рвать нормальные ответы на high; 180 секунд и ретраи с экспоненциальной паузой.
  • Счёт. Больше рассуждений при той же цене за токен — больше токенов за задачу. Сравни total_cost на своих запросах до и после, а не тарифы в каталоге.
  • Structured outputs и стриминг работают как раньше: response_format со схемой и stream: true. Keepalive-комментарии : HELLO и : PROCESSING перед первым чанком шлюз по-прежнему шлёт — парсер должен пропускать строки без data: .

Сколько стоит

В GPTunneL Gemini 3.8 Flash тарифицируется за токены: 300 ₽ за 1M на входе и 1500 ₽ за 1M на выходе, контекст — 1M токенов. Это вдвое дороже 3.7 Flash, которая остаётся в каталоге по 150 ₽ и 750 ₽, — так что для задач, где прироста 3.8 не видно, старую модель имеет смысл оставить. У Google действует вводная цена $0,75 и $3,75 за 1M токенов до 31 декабря 2026 года, с января — $1,50 и $7,50. Актуальные цифры по всем моделям — на странице цен. Подписка не нужна, оплата российскими картами в рублях, доступ без VPN.

Попробуй сам

Подставь gemini-3.8-flash вместо gemini-3.7-flash в свой код с base_url=https://gptunnel.ru/v1 и прогони тот же агентный цикл. Сравни две цифры: total_cost и долю задач, доведённых до конца. Или открой Gemini 3.8 Flash в GPTunneL и проверь на своей задаче в чате.