Google выпустил Gemini 3.8 Flash 2 сентября 2026 года — третий релиз линейки Flash за шесть недель. Модель уже в каталоге GPTunneL под id gemini-3.8-flash. Коротко: API не поменялся ни на один параметр, лимиты те же, прирост — в длинных агентных задачах и профессиональных доменах. Если у тебя код под 3.7 Flash, миграция — замена строки с именем модели.
Что вышло
Из карточки модели:
| Параметр | Значение |
|---|---|
| Вход | текст, изображение, видео, аудио, PDF |
| Выход | текст |
| Лимит входа | 1 048 576 токенов |
| Лимит выхода | 65 536 токенов |
| Мышление | low, medium, high; minimal возвращает ошибку |
| Есть | function calling, structured outputs, code execution, search grounding, context caching, Batch |
| Preview | computer use |
| Нет | генерация изображений и аудио, Live API |
Таблица совпадает с 3.7 Flash строка в строку. Google прямо пишет, что скорость и цена в родном API остались прежними, а изменилось поведение: модель делает больше шагов рассуждения и чаще повторно вызывает инструменты, прежде чем отдать ответ.
Минимальный запрос
Шлюз GPTunneL совместим с OpenAI, ключ идёт в Authorization без префикса Bearer:
curl https://gptunnel.ru/v1/chat/completions \
-H "Authorization: <ВАШ_API_КЛЮЧ>" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"messages": [{"role": "user", "content": "Ответь одним словом: столица Франции?"}]
}'Ответ, который я получил перед публикацией:
{
"model": "gemini-3.8-flash",
"choices": [{"message": {"role": "assistant", "content": "Париж"}, "finish_reason": "stop"}],
"usage": {
"prompt_tokens": 11,
"completion_tokens": 108,
"total_tokens": 119,
"prompt_cost": 0.0033,
"completion_cost": 0.162,
"total_cost": 0.1653,
"prompt_tokens_details": {"cached_tokens": 0}
}
}Одно слово — 108 выходных токенов. Мышление тарифицируется как выход, и у 3.8 Flash его по замыслу Google стало больше. Считай расход по total_cost из usage, а не по длине видимого ответа.
Глубина рассуждений через шлюз задаётся параметром reasoning_effort со значениями low, medium, high; гугловский thinking_level шлюз молча игнорирует. Замеры по уровням на 3.7 Flash — в прошлой статье, механика у 3.8 та же.
Что выросло по бенчмаркам
Google сравнивает 3.8 Flash не с прошлой версией, а с флагманами конкурентов:
| Бенчмарк | 3.7 Flash | 3.8 Flash | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Vals Finance Agent v2 | 59,0% | 61,4% | 58,6% | 53,8% |
| Harvey Legal Agent | 8,8% | 10,0% | 6,7% | 2,5% |
| HLE-Verified | 53,6% | 54,9% | 54,4% | 54,5% |
На DeepSWE v1.1 — длинных задачах разработки от постановки до готового патча — Google показывает результат выше 70% при стоимости заметно ниже, чем у крупных моделей; точной цифры в анонсе нет. Сторонние обзоры приводят Terminal-Bench 2.1: 90,8% против 81,6% у 3.7 Flash.
Читать это надо трезво. Прирост над 3.7 Flash — 1–2 процентных пункта на профессиональных агентных тестах, а не скачок вроде DeepSWE 49% → 65% месяц назад. Обгон Opus 5 и Sol — на узких доменных бенчмарках финансов и права. На общих агентных задачах вроде OSWorld флагманы, по сторонним сводкам, остаются впереди. Если у тебя многошаговый агент с инструментами в предметной области — стоит перепрогнать. Если классификатор или саммари — разницы не увидишь.
3.8 Flash Cyber
Вместе с основной моделью Google выпустил вариант для кибербезопасности: поиск уязвимостей в двадцати языках с успехом выше 70% и автопатчинг на CWE-Bench 47,2% pass@1. В открытый API он не попал: доступ только по программе Fairwind для госорганов, операторов инфраструктуры и мейнтейнеров. Через GPTunneL его нет и не будет, пока Google не откроет модель публично.
Что проверить перед переключением
max_tokens. Потолок ест мышление раньше ответа: на 3.7 Flash приmax_tokens: 16приходил пустой контент сfinish_reason: "length". У 3.8 рассуждений больше — ставь запас ещё щедрее.- Таймауты. Дополнительные шаги и повторные вызовы инструментов — это время. Клиентский таймаут в 30 секунд будет рвать нормальные ответы на
high; 180 секунд и ретраи с экспоненциальной паузой. - Счёт. Больше рассуждений при той же цене за токен — больше токенов за задачу. Сравни
total_costна своих запросах до и после, а не тарифы в каталоге. - Structured outputs и стриминг работают как раньше:
response_formatсо схемой иstream: true. Keepalive-комментарии: HELLOи: PROCESSINGперед первым чанком шлюз по-прежнему шлёт — парсер должен пропускать строки безdata:.
Сколько стоит
В GPTunneL Gemini 3.8 Flash тарифицируется за токены: 300 ₽ за 1M на входе и 1500 ₽ за 1M на выходе, контекст — 1M токенов. Это вдвое дороже 3.7 Flash, которая остаётся в каталоге по 150 ₽ и 750 ₽, — так что для задач, где прироста 3.8 не видно, старую модель имеет смысл оставить. У Google действует вводная цена $0,75 и $3,75 за 1M токенов до 31 декабря 2026 года, с января — $1,50 и $7,50. Актуальные цифры по всем моделям — на странице цен. Подписка не нужна, оплата российскими картами в рублях, доступ без VPN.
Попробуй сам
Подставь gemini-3.8-flash вместо gemini-3.7-flash в свой код с base_url=https://gptunnel.ru/v1 и прогони тот же агентный цикл. Сравни две цифры: total_cost и долю задач, доведённых до конца. Или открой Gemini 3.8 Flash в GPTunneL и проверь на своей задаче в чате.



