Grok 4.6 по API: бенчмарки, цена и порог в 200K токенов

Grok 4.6 по API: бенчмарки, цена и порог в 200K токенов

12 августа xAI выложила Grok 4.6. Для прода апдейт модели — это не новость, а тикет: поменять одну строку в конфиге и понять, что после этого поедет. Ниже — минимальный запрос, который запускается как есть, цифры бенчмарков без округлений в свою пользу и три места, где Grok 4.6 обходится дороже, чем выглядит в прайсе.

Минимальный запрос

API GPTunneL совместим с OpenAI, поэтому переезд на Grok 4.6 — это base_url и имя модели:

bash
curl https://gptunnel.ru/v1/chat/completions \
  -H "Authorization: <ВАШ_API_КЛЮЧ>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.6",
    "messages": [
      {"role": "user", "content": "Разбери этот стектрейс и предложи патч"}
    ]
  }'

То же самое официальным клиентом OpenAI:

Python
from openai import OpenAI

client = OpenAI(
    api_key="<ВАШ_API_КЛЮЧ>",
    base_url="https://gptunnel.ru/v1",
)

resp = client.chat.completions.create(
    model="grok-4.6",
    messages=[{"role": "user", "content": "Разбери этот стектрейс и предложи патч"}],
)
print(resp.choices[0].message.content)

Одна деталь, на которой теряют полчаса: идентификатор модели пишется по-разному. В каталоге GPTunneL это grok-4.6, в прямом API xAI — grok-4-6, в OpenRouter — x-ai/grok-4-6. Если код ходит в два провайдера сразу, держи маппинг в конфиге, а не в строковых литералах по коду.

Что поменялось относительно Grok 4.5

Grok 4.6 — не новая базовая модель. xAI прямо говорит, что это post-training поверх той же базы на 1,5 трлн параметров, что и у Grok 4.5: дополнительный прогон обучения, перегенерированные SFT-траектории и агентный RL на коде, вебе, CAD и оптимизации ядер. Размер модели не вырос.

Технические границы:

  • контекст — 500 000 токенов;
  • knowledge cutoff — 1 февраля 2026, всё свежее только через веб-поиск и инструменты;
  • заявленный фокус — долгоживущие агенты, работа с большой кодовой базой, интерактивные и визуальные задачи.

Практически заметное изменение поведения — самопроверка. Модель прогоняет код перед тем, как идти дальше по плану, и перечитывает файл после правки вместо того, чтобы верить собственному diff. Для агента это плюс к проценту доведённых до конца задач и минус к бюджету: тех же самых шагов становится больше, а платишь ты за токены, а не за результат.

Бенчмарки

Цифры из таблиц xAI и Artificial Analysis, рядом — лучший результат конкурента на том же тесте:

БенчмаркGrok 4.5Grok 4.6Лучший конкурент
AA Intelligence Index5661Fable 5 Max — 62
DeepSWE54%65,9%GPT-5.6 Sol — 73%
Terminal-Bench v3.015,7%26%34–35%
APEX-Agents47,1%57,5%
AA-Briefcase1577Fable 5 Max — 1574
Harvey LAB15,8%Fable 5 Max — 11,3%

Читается это так. По сводному индексу Grok 4.6 встал вровень с максимальным режимом рассуждений GPT-5.6 Sol и отстал от Fable 5 Max на один пункт — то есть по «общему интеллекту» разница между топами уже в пределах шума. Там, где надо перелопатить много документов и структурировать результат, 4.6 лидирует: AA-Briefcase и юридический Harvey LAB он выигрывает у обоих конкурентов. Там, где надо жить в терминале, — заметно проигрывает: 26% против 34–35%.

Отдельная строчка, ради которой всё и затевалось, — CursorBench 3.2: 70,8% при $2,81 за задачу против 70,5% у Fable 5 при $17,32 и 70% у Opus 5 при $8,23. Одинаковое качество, разница в счёте в 3–6 раз.

Порог 200K токенов, за которым счёт удваивается

Ступени стоимости запроса: после порога в 200 тысяч токенов ставка резко удваивается

Главный подводный камень релиза лежит не в качестве, а в тарифной сетке. У xAI цена Grok 4.6 разбита на два бэнда:

Токенов в промптеInputCached inputOutput
до 200 000$2 / 1M$0,50 / 1M$6 / 1M
от 200 000$4 / 1M$1 / 1M$12 / 1M

Ловушка в том, что удвоенная ставка применяется ко всем токенам запроса, а не к превышению. Запрос на 201 000 токенов платит двойную цену за все 201 000, а не за лишнюю тысячу. Разница между промптом на 199K и на 201K — ровно в два раза по деньгам при разнице в 1% по содержанию.

Отсюда простое правило: перед отправкой считай длину промпта и решай осознанно.

Python
LONG_CTX_BAND = 200_000

def will_double(prompt_tokens: int) -> bool:
    return prompt_tokens >= LONG_CTX_BAND

# в агенте: либо ужимаем историю, либо принимаем 2x осознанно
if will_double(estimated):
    history = compact(history, target=180_000)

Второй момент — кешированный вход. Это единственная строка, где 4.6 дороже 4.5: $0,50 против $0,30 за миллион. Если у тебя большой системный промпт живёт на кеше и дёргается тысячами запросов в сутки, апдейт версии сам по себе поднимет счёт, даже если ничего больше не менять.

В каталоге GPTunneL у grok-4.6 одна ставка за 1K токенов, без бэндов — актуальные цифры в карточке модели рядом с текстом и на странице цен.

Стриминг

Долгие агентные ответы без стрима выглядят как зависший запрос, и первым это замечает не пользователь, а таймаут прокси. Минимальный стрим на Node:

JavaScript
const res = await fetch("https://gptunnel.ru/v1/chat/completions", {
  method: "POST",
  headers: {
    Authorization: process.env.GPTUNNEL_API_KEY,
    "Content-Type": "application/json",
  },
  body: JSON.stringify({
    model: "grok-4.6",
    stream: true,
    messages: [{ role: "user", content: "Опиши план рефакторинга модуля auth" }],
  }),
});

for await (const chunk of res.body) {
  for (const line of chunk.toString().split("\n")) {
    if (!line.startsWith("data: ")) continue;
    const payload = line.slice(6);
    if (payload === "[DONE]") break;
    process.stdout.write(JSON.parse(payload).choices[0]?.delta?.content ?? "");
  }
}

Что сломается в проде

  • Таймауты. Агентные прогоны на 4.6 длиннее, чем на 4.5, — самопроверка стоит времени. Дефолтные 60 секунд в HTTP-клиенте режут ответ на середине; ставь 600 и включай стрим, чтобы соединение не молчало.
  • Ретраи. Экспонента с джиттером на 429 и 5xx, без ретраев на 4xx. 400 с текстом про неизвестную модель — это не сбой сети, а тот самый grok-4.6 против grok-4-6, ретраить бесполезно.
  • Бюджет считается на задачу, а не на токен. Модель, которая перепроверяет себя, тратит больше токенов и чаще доводит задачу до конца. Меряй стоимость завершённого прогона, число вмешательств человека и время до готового результата — по цене за миллион ты выберешь не ту модель.
  • 500K — это меньше, чем было у соседей. У GPT-5.6 Sol 1,05M, у Fable 5 — 1M. RAG-пайплайн, рассчитанный на миллион токенов контекста, на Grok 4.6 придётся резать, и резать желательно до 200K (см. выше).
  • Свежие данные. Cutoff — февраль 2026. Всё, что произошло позже, модель знает только из веб-поиска и переданных тобой инструментов.

Grok 4.6 в Cursor и других средах

Модель раскатана в Cursor и Grok Build, доступна через API xAI, OpenRouter, Vercel и Cloudflare. Первую неделю после релиза, до 19 августа, xAI удваивает включённый объём использования Grok 4.6 в Grok Build и Cursor — если хочешь сравнить её с Composer или Fable на своём репозитории, это самое дешёвое окно.

Разумный сценарий подключения в Cursor — не ставить 4.6 моделью по умолчанию, а отдать ей длинные задачи: разбор большого репозитория, миграции, доведение фичи от issue до PR. Короткие правки дешевле гонять на быстрых моделях, тем более что роутер это умеет сам.

Попробуй сам

Grok 4.6 уже в каталоге GPTunneL: он доступен и в чате, и по тому же OpenAI-совместимому API, что и остальные модели, — один ключ, один баланс, без VPN и с оплатой в рублях. Возьми ключ в кабинете, поменяй model на grok-4.6 и прогони на своём реальном сценарии: issue → план → патч → тесты. Описание эндпоинтов, лимитов и параметров — в документации, остальные модели линейки — на странице Grok.