Google Gemini 3.7 Flash моделін 2026 жылғы 13 тамызда — 3.6 Flash шыққаннан үш апта кейін жариялады. Әзірлеуші үшін мұнда үш нақты өзгеріс бар: баға екі есе арзандады, кодтау мен агенттік бенчмарктарда секіріс болды, ал модельдің ойлауын басқару тәсілі ауысты — thinking_budget орнына thinking_level келді.
Төменде — құжаттамадағы сипаттамалар, бенчмарк сандары және жарияламас бұрын біздің шлюз арқылы өткізген сұрауларым. «Өлшем» деп белгіленгеннің бәрі — API-дің нақты жауабы, анонстың қайталауы емес.
Не шықты
API-дегі модель атауы — gemini-3.7-flash. Модель картасынан негізгісі:
| Сипаттама | Мәні |
|---|---|
| Кіріс | мәтін, сурет, бейне, аудио, PDF |
| Шығыс | мәтін |
| Кіріс шегі | 1 048 576 токен |
| Шығыс шегі | 65 536 токен |
| Ойлау | thinking_level: low, medium (әдепкі), high |
| Бар | function calling, structured outputs, code execution, file search, search grounding, Google Maps, context caching, Batch / Flex / Priority |
| Preview | computer use |
| Жоқ | сурет генерациясы, аудио генерациясы, Live API |
thinking_level үшін minimal мәні 3.7 Flash-та қолданылмайды: Gemini-дің өз API-і оған валидация қатесін қайтарады. Контекст өзгерген жоқ — 3.6 Flash сияқты сол миллион токен.
Ең қарапайым сұрау
GPTunneL API-і OpenAI-мен үйлесімді, сондықтан шақыру — кәдімгі POST /v1/chat/completions. Кілт Authorization тақырыбына Bearer префиксі қойылмай жіберіледі:
curl https://gptunnel.ru/v1/chat/completions \
-H "Authorization: <СІЗДІҢ_API_КІЛТІҢІЗ>" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [{"role": "user", "content": "Бір сөзбен жауап бер: Францияның астанасы?"}]
}'Жауабы:
{
"model": "gemini-3.7-flash",
"choices": [{"message": {"role": "assistant", "content": "Париж"}, "finish_reason": "stop"}],
"usage": {
"prompt_tokens": 11,
"completion_tokens": 103,
"total_tokens": 114,
"prompt_cost": 0.00165,
"completion_cost": 0.07725,
"total_cost": 0.0789,
"prompt_tokens_details": {"cached_tokens": 0}
}
}completion_tokens өрісіне қара: бір ғана «Париж» сөзі 103 шығыс токенге түсті. Бұл — ойлайтын модель, ойлау токендері шығыс ретінде саналып, шығыс тарифімен төленеді. Егер бюджетті көрінетін жауаптың ұзындығы бойынша есептеген болсаң, қайта санап шық.

Шлюз қайтаратын usage өрісінде құны бірден тұрады — шығынды өз бағалауың бойынша емес, сол өріс бойынша есепте.
Бенчмарктар не көрсетеді
Google 3.7 Flash-ты оқулық тапсырмаларында емес, ұзақ инженерлік тапсырмаларда өлшейді. 3.6 Flash-пен салыстыру:
| Бенчмарк | 3.6 Flash | 3.7 Flash |
|---|---|---|
| FrontierCode 1.1 Main (өнімдік код сапасы) | 34,4% | 43,6% |
| DeepSWE v1.1 (ұзақ әзірлеу тапсырмалары) | 49,0% | 65,3% |
| GDP.pdf (күрделі PDF талдау) | 22,0% | 34,0% |
| AutomationBench | 17,0% | 30,4% |
| WebDev Arena (Elo) | 1538 | 1588 |
FrontierCode 1.1 Main-дегі 43,6% — Claude Sonnet 5 (42,7%) мен GPT-5.6 Terra-дан (41,3%) жоғары. Заң саласындағы Harvey LAB-AA-да модель 90,7% береді.
Artificial Analysis 3.7 Flash-қа (high) Intelligence Index бойынша 56 балл қояды — 3.6 Flash-тан төрт балл жоғары және GPT-5.6 Terra мен Muse Spark 1.2-ге (57-ден) тақау. Жылдамдығы — секундына шамамен 340 шығыс токен, бұл GPT-5.6 Terra-дан үш есеге жуық жылдам, ал бір тапсырманың орташа уақыты — 1,7 минут. Агенттік AA-AnalystAgent-те модель 60% өтеді, Claude Opus 5-те max режимінде — 54%.
Практикалық қорытынды: өсім құралдармен жұмыс істейтін ұзақ циклдерде жатыр, әңгіме сапасында емес. Егер сенде тесттерді бір сағат бойы түзейтін агент болса, айырманы көресің. Тікеттерді сұрыптайтын классификатор болса — екіталай.
thinking_budget орнына thinking_level
API-дегі ең маңызды өзгеріс. Бұрын ойлау тереңдігі токен санымен (thinking_budget) берілетін, енді — жол түріндегі enum:
from openai import OpenAI
client = OpenAI(api_key="<СІЗДІҢ_API_КІЛТІҢІЗ>", base_url="https://gptunnel.ru/v1")
r = client.chat.completions.create(
model="gemini-3.7-flash",
messages=[{"role": "user", "content": "Осы кодтағы жарысты тап: ..."}],
extra_body={"thinking_level": "high"},
)
print(r.usage.completion_tokens)Өлшем. gptunnel.ru/v1 арқылы параметр қатесіз қабылданады, бірақ шығынға әсер етпейді. Бір ғана комбинаторика тапсырмасы, әр деңгейге үш жүгіріс: low — 755, 555, 576 шығыс токен; high — 451, 333, 491. Бір деңгейдің ішіндегі шашырау деңгейлер арасындағы айырмадан үлкен, ал Gemini-дің өз API-і қабылдамайтын minimal мәнін біздің шлюз тыныш қабылдап, жауап береді. Яғни өріс модельге жетпейді.
Мұнымен не істеу керек: ойлау деңгейлері арқылы үнемдеуді жоспарлама, шығынды өз жүктемеңде өлше. Айтпақшы, тоғыз жүгірістің бәрінде жауап дұрыс болды.
Стриминг және құрылымдалған шығыс
Стриминг stream: true арқылы қалыпты жұмыс істейді. 300 сөздік жауап 28 бөліктермен келді. Жалғыз айқын емес нәрсе — шлюз бірінші дата-бөлікке дейін : HELLO және : PROCESSING деген keepalive-түсініктемелерін жібереді, ал аңғал парсер соларға сүрінеді:
const res = await fetch("https://gptunnel.ru/v1/chat/completions", {
method: "POST",
headers: { Authorization: KEY, "Content-Type": "application/json" },
body: JSON.stringify({ model: "gemini-3.7-flash", stream: true, messages }),
});
for await (const chunk of res.body) {
for (const line of new TextDecoder().decode(chunk).split("\n")) {
if (!line.startsWith("data: ")) continue; // ": HELLO" мен ": PROCESSING" осында кесіледі
const payload = line.slice(6);
if (payload === "[DONE]") break;
process.stdout.write(JSON.parse(payload).choices[0].delta.content ?? "");
}
}Structured outputs та орнында — схемасы бар response_format жарамды JSON қайтарады:
-d '{
"model": "gemini-3.7-flash",
"response_format": {"type": "json_schema", "json_schema": {"name": "invoice", "strict": true,
"schema": {"type": "object", "properties": {"number": {"type": "string"}, "total": {"type": "number"}},
"required": ["number", "total"], "additionalProperties": false}}},
"messages": [{"role": "user", "content": "№A-114 шот, сомасы 25000. JSON қайтар."}]
}'Шығысы — {"number":"A-114","total":25000}, 304 шығыс токенге. Құжаттан бірер өрісті суырып алу нәтиженің ұзындығына қарағанда қымбатқа түседі: бәрібір ойлау үшін төлейсің.
Өнімде не сынады
max_tokensойлауға жұмсалып кетеді. Өлшедім:max_tokens: 16қойғанда модельfinish_reason: "length"және бос контент қайтарды, бірақ 13 шығыс токен жұмсады. Ақшаң кетті, нәтиже жоқ. Шекті ойлауға қор қалдырып қой, ал қысқа жауапты промпт арқылы сұра.- Таймауттар. Жоғары ойлау деңгейінде тапсырманың орташа уақыты минуттармен өлшенеді. Клиенттегі 30 секундтық таймаут қалыпты жауаптарды үзеді; 180 секунд қойып, экспоненциалды кідіріспен қайталау жаса.
- Шығыс шегі — 65 536 токен. Ұзын құжаттарды өзің бөлікке бөл.
- Жауаптағы
cached_tokens. Менің өлшемдерімде ол нөл болды; қайталанатын жүйелік промптта үнемдеуді уәде бойынша емес, осы өріс бойынша есепте. - Ойлау деңгейі шлюз арқылы басқарылмайды (жоғарыдан қара) — бюджетке жоғарғы шекті сал.
3.7 Flash па, әлде 3.1 Pro ма
Модель таңдағанда жиі туатын сұрақ. GPTunneL каталогында Gemini 3.1 Pro 1M кіріс токен үшін 3000 ₸, 1M шығыс токен үшін 15 000 ₸ тұрады — сол миллиондық контекстте 3.7 Flash-тан төрт есе қымбат. Pro бір жауаптың тереңдігі шешуші болатын тапсырмаларда қалады. Модель қатарынан жүздеген рет шақырылатын агенттік циклдерде Flash экономикасы басым: секундына 340 токен және төрт есе аз шот итерация жылдамдығын мүлде басқа деңгейге шығарады.
Қанша тұрады
GPTunneL-де Gemini 3.7 Flash токен бойынша тарифтеледі: 1M кіріс токен үшін 750 ₸ және 1M шығыс токен үшін 3750 ₸, контекст — 1M токен. Бұл әлі каталогта тұрған 3.6 Flash-тан (1500 ₸ және 7500 ₸) дәл екі есе арзан. Google-дің өзінде 2026 жылдың соңына дейін 1M токенге $0,75 және $3,75 деген кіріспе баға қолданылады, одан кейін — стандартты $1,50 және $7,50. Барлық модельдің өзекті бағасы — бағалар бетінде.
Жиі қойылатын сұрақтар
Gemini 3.7 Flash-ты жүктеп алуға бола ма? Жоқ. Gemini желісінің ашық салмақтары жоқ, модель тек API және Google-дің бұлттық интерфейстері арқылы жұмыс істейді. Оны өз серверіңе орнату мүмкін емес.
Бұл ең күшті Gemini ме? Flash желісіндегі ең күштісі, ал Artificial Analysis индексіндегі 56 балл оны бәсекелес флагмандардың қатарына қояды. Бірақ Flash — жылдамдық пен баға туралы: бір жауаптың тереңдігі шешуші жерде Pro желісі әлі де алда.
3.7 Flash 3.6 Flash-тан немен ерекшеленеді? Кодтау мен агенттік бенчмарктардағы секіріспен (DeepSWE 49,0% → 65,3%), thinking_budget орнына келген жаңа thinking_level-мен және екі есе арзан бағамен. Контекст пен шығыс шектеулері сол күйінде.
Google Cloud жобасы керек пе? GPTunneL-де керек емес: бір кілт бүкіл каталогқа жарайды, жазылым жоқ, төлем нақты жұмсалған токендер үшін алынады.
Өзің байқап көр
Нақты тапсырма ал — «өлең жаз» емес, дәл қазір 3.6 Flash-та жүргізіп жүрген құралдары бар агенттік циклді. GPTunneL-де Gemini 3.7 Flash-ты аш немесе кодыңа base_url=https://gptunnel.ru/v1 қойып, gemini-3.7-flash дегенді қой да, екі санды салыстыр: total_cost және дайын нәтижеге дейінгі уақыт. Бенчмарктарды сен үшін санап қойған.



