12 августа xAI выложила Grok 4.6. Для прода апдейт модели — это не новость, а тикет: поменять одну строку в конфиге и понять, что после этого поедет. Ниже — минимальный запрос, который запускается как есть, цифры бенчмарков без округлений в свою пользу и три места, где Grok 4.6 обходится дороже, чем выглядит в прайсе.
Минимальный запрос
API GPTunneL совместим с OpenAI, поэтому переезд на Grok 4.6 — это base_url и имя модели:
curl https://gptunnel.ru/v1/chat/completions \
-H "Authorization: <ВАШ_API_КЛЮЧ>" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6",
"messages": [
{"role": "user", "content": "Разбери этот стектрейс и предложи патч"}
]
}'То же самое официальным клиентом OpenAI:
from openai import OpenAI
client = OpenAI(
api_key="<ВАШ_API_КЛЮЧ>",
base_url="https://gptunnel.ru/v1",
)
resp = client.chat.completions.create(
model="grok-4.6",
messages=[{"role": "user", "content": "Разбери этот стектрейс и предложи патч"}],
)
print(resp.choices[0].message.content)Одна деталь, на которой теряют полчаса: идентификатор модели пишется по-разному. В каталоге GPTunneL это grok-4.6, в прямом API xAI — grok-4-6, в OpenRouter — x-ai/grok-4-6. Если код ходит в два провайдера сразу, держи маппинг в конфиге, а не в строковых литералах по коду.
Что поменялось относительно Grok 4.5
Grok 4.6 — не новая базовая модель. xAI прямо говорит, что это post-training поверх той же базы на 1,5 трлн параметров, что и у Grok 4.5: дополнительный прогон обучения, перегенерированные SFT-траектории и агентный RL на коде, вебе, CAD и оптимизации ядер. Размер модели не вырос.
Технические границы:
- контекст — 500 000 токенов;
- knowledge cutoff — 1 февраля 2026, всё свежее только через веб-поиск и инструменты;
- заявленный фокус — долгоживущие агенты, работа с большой кодовой базой, интерактивные и визуальные задачи.
Практически заметное изменение поведения — самопроверка. Модель прогоняет код перед тем, как идти дальше по плану, и перечитывает файл после правки вместо того, чтобы верить собственному diff. Для агента это плюс к проценту доведённых до конца задач и минус к бюджету: тех же самых шагов становится больше, а платишь ты за токены, а не за результат.
Бенчмарки
Цифры из таблиц xAI и Artificial Analysis, рядом — лучший результат конкурента на том же тесте:
| Бенчмарк | Grok 4.5 | Grok 4.6 | Лучший конкурент |
|---|---|---|---|
| AA Intelligence Index | 56 | 61 | Fable 5 Max — 62 |
| DeepSWE | 54% | 65,9% | GPT-5.6 Sol — 73% |
| Terminal-Bench v3.0 | 15,7% | 26% | 34–35% |
| APEX-Agents | 47,1% | 57,5% | — |
| AA-Briefcase | — | 1577 | Fable 5 Max — 1574 |
| Harvey LAB | — | 15,8% | Fable 5 Max — 11,3% |
Читается это так. По сводному индексу Grok 4.6 встал вровень с максимальным режимом рассуждений GPT-5.6 Sol и отстал от Fable 5 Max на один пункт — то есть по «общему интеллекту» разница между топами уже в пределах шума. Там, где надо перелопатить много документов и структурировать результат, 4.6 лидирует: AA-Briefcase и юридический Harvey LAB он выигрывает у обоих конкурентов. Там, где надо жить в терминале, — заметно проигрывает: 26% против 34–35%.
Отдельная строчка, ради которой всё и затевалось, — CursorBench 3.2: 70,8% при $2,81 за задачу против 70,5% у Fable 5 при $17,32 и 70% у Opus 5 при $8,23. Одинаковое качество, разница в счёте в 3–6 раз.
Порог 200K токенов, за которым счёт удваивается

Главный подводный камень релиза лежит не в качестве, а в тарифной сетке. У xAI цена Grok 4.6 разбита на два бэнда:
| Токенов в промпте | Input | Cached input | Output |
|---|---|---|---|
| до 200 000 | $2 / 1M | $0,50 / 1M | $6 / 1M |
| от 200 000 | $4 / 1M | $1 / 1M | $12 / 1M |
Ловушка в том, что удвоенная ставка применяется ко всем токенам запроса, а не к превышению. Запрос на 201 000 токенов платит двойную цену за все 201 000, а не за лишнюю тысячу. Разница между промптом на 199K и на 201K — ровно в два раза по деньгам при разнице в 1% по содержанию.
Отсюда простое правило: перед отправкой считай длину промпта и решай осознанно.
LONG_CTX_BAND = 200_000
def will_double(prompt_tokens: int) -> bool:
return prompt_tokens >= LONG_CTX_BAND
# в агенте: либо ужимаем историю, либо принимаем 2x осознанно
if will_double(estimated):
history = compact(history, target=180_000)Второй момент — кешированный вход. Это единственная строка, где 4.6 дороже 4.5: $0,50 против $0,30 за миллион. Если у тебя большой системный промпт живёт на кеше и дёргается тысячами запросов в сутки, апдейт версии сам по себе поднимет счёт, даже если ничего больше не менять.
В каталоге GPTunneL у grok-4.6 одна ставка за 1K токенов, без бэндов — актуальные цифры в карточке модели рядом с текстом и на странице цен.
Стриминг
Долгие агентные ответы без стрима выглядят как зависший запрос, и первым это замечает не пользователь, а таймаут прокси. Минимальный стрим на Node:
const res = await fetch("https://gptunnel.ru/v1/chat/completions", {
method: "POST",
headers: {
Authorization: process.env.GPTUNNEL_API_KEY,
"Content-Type": "application/json",
},
body: JSON.stringify({
model: "grok-4.6",
stream: true,
messages: [{ role: "user", content: "Опиши план рефакторинга модуля auth" }],
}),
});
for await (const chunk of res.body) {
for (const line of chunk.toString().split("\n")) {
if (!line.startsWith("data: ")) continue;
const payload = line.slice(6);
if (payload === "[DONE]") break;
process.stdout.write(JSON.parse(payload).choices[0]?.delta?.content ?? "");
}
}Что сломается в проде
- Таймауты. Агентные прогоны на 4.6 длиннее, чем на 4.5, — самопроверка стоит времени. Дефолтные 60 секунд в HTTP-клиенте режут ответ на середине; ставь 600 и включай стрим, чтобы соединение не молчало.
- Ретраи. Экспонента с джиттером на 429 и 5xx, без ретраев на 4xx.
400с текстом про неизвестную модель — это не сбой сети, а тот самыйgrok-4.6противgrok-4-6, ретраить бесполезно. - Бюджет считается на задачу, а не на токен. Модель, которая перепроверяет себя, тратит больше токенов и чаще доводит задачу до конца. Меряй стоимость завершённого прогона, число вмешательств человека и время до готового результата — по цене за миллион ты выберешь не ту модель.
- 500K — это меньше, чем было у соседей. У GPT-5.6 Sol 1,05M, у Fable 5 — 1M. RAG-пайплайн, рассчитанный на миллион токенов контекста, на Grok 4.6 придётся резать, и резать желательно до 200K (см. выше).
- Свежие данные. Cutoff — февраль 2026. Всё, что произошло позже, модель знает только из веб-поиска и переданных тобой инструментов.
Grok 4.6 в Cursor и других средах
Модель раскатана в Cursor и Grok Build, доступна через API xAI, OpenRouter, Vercel и Cloudflare. Первую неделю после релиза, до 19 августа, xAI удваивает включённый объём использования Grok 4.6 в Grok Build и Cursor — если хочешь сравнить её с Composer или Fable на своём репозитории, это самое дешёвое окно.
Разумный сценарий подключения в Cursor — не ставить 4.6 моделью по умолчанию, а отдать ей длинные задачи: разбор большого репозитория, миграции, доведение фичи от issue до PR. Короткие правки дешевле гонять на быстрых моделях, тем более что роутер это умеет сам.
Попробуй сам
Grok 4.6 уже в каталоге GPTunneL: он доступен и в чате, и по тому же OpenAI-совместимому API, что и остальные модели, — один ключ, один баланс, без VPN и с оплатой в рублях. Возьми ключ в кабинете, поменяй model на grok-4.6 и прогони на своём реальном сценарии: issue → план → патч → тесты. Описание эндпоинтов, лимитов и параметров — в документации, остальные модели линейки — на странице Grok.



