Наш инференс

Grom 1.5

Модель, с которой начинается GPTunneL. Отвечает первой, видит картинки, держит длинный контекст и работает на нашем железе — а не в чужом облаке.

500 мс
до первого токена
120
токенов в секунду на пике
256K
окно контекста
Зачем

Модель, которая встречает

Grom вырос из простой задачи. Человек регистрируется, открывает чат — и должен получить ответ сразу, а не выбирать между двумя сотнями моделей и считать, во что обойдётся первый вопрос. Поэтому свою первую модель мы настроили под одно: быстрый и внятный ответ на повседневный вопрос. Переписать письмо, объяснить ошибку в логе, вытащить цифры со скриншота, накидать план поездки — то, из чего состоит большая часть запросов. С Grom можно начать, не пополняя баланс: попробуй, разберись в интерфейсе, реши пару своих задач. Когда упрёшься в потолок — в том же окне ждут GPT, Claude, Gemini и ещё две сотни моделей, и вот там уже платишь за то, что используешь.
Скорость

Начинает печатать, пока другие думают

Первый токен уходит примерно через полсекунды, дальше поток разгоняется до 120 токенов в секунду. Крупные модели сначала долго прогревают запрос — на коротком вопросе эта пауза заметнее, чем разница в тексте ответа.

Ответ длиной 500 токеновштриховка — ожидание первого токена
Grom 1.5наша модель
4,7 с
0120 ток/с · 500 ms
Claude Sonnet-5
8,8 с
068 ток/с · 1400 ms
GPT 5
9,7 с
062 ток/с · 1600 ms
Qwen 3.5 Plus
11,0 с
055 ток/с · 1900 ms

Наши замеры: короткий промпт без режима рассуждений, чужие модели дёргали через GPTunneL, Grom — на своём инференсе. Реальные цифры зависят от нагрузки, длины запроса и того, что происходит у вендора.

Vision

Видит картинку, а не только текст

Кидай скриншот, фото документа или график. Модель разбирает, что на изображении, и отвечает текстом — отдельная OCR-обвязка не нужна.

Мальчик с мячом на проезжей части, сзади приближается автомобиль
Что происходит на фото? Есть ли риск?
1200 × 896 · изображение → ≈1 100 токенов

  • Скриншоты и документы.Текст с фотографии, таблица, чек, экран с ошибкой — всё читается прямо из картинки.
  • Картинка попадает в общий контекст.Можно уточнять дальше по переписке, не прикладывая файл заново.
  • Работает и в чате, и по API.Формат запроса — как у остальных моделей платформы.
Контекст

256 000 токенов в одном диалоге

Это порядка шестисот страниц текста. Договор целиком, логи сборки, месячная переписка — можно положить в диалог и спрашивать по ним, не нарезая документ на куски.

256K токенов
  • Договор на 60 страниц18%
  • Логи сборки за день23%
  • История диалога12%
  • Свободно под ответы и уточнения47%

Кэш префикса в памяти GPU

Длинный документ не пересчитывается на каждый вопрос: посчитанные ключи и значения внимания остаются в памяти ускорителя. Первый вопрос по файлу оплачивает обработку, следующие стартуют с уже прогретого контекста.

Первый вопрос по документу1900 ms
Следующий вопрос, контекст в кэше480 ms
Сравнение

Где Grom выигрывает, а где — нет

Честно: это модель среднего размера. Она берёт скоростью, ценой и тем, что крутится у нас. Сложную аналитику и большой код лучше отдавать фронтир-моделям — они в том же окне чата, переключение занимает секунду.

Grom 1.5наш инференсClaude Sonnet-5anthropicGPT 5openaiQwen 3.5 Plusalibaba
Первый токен~500 мс1,3–1,8 с1,5–2 с1,8–2,5 с
Скорость генерациидо 120 ток/с~70 ток/с~60 ток/с~55 ток/с
Окно контекста256K1M400K1M
Картинки на входедададада
Сложные рассуждения, большой кодбазовый уровеньзаметно сильнеезаметно сильнеесильнее
Цена в чатестарт без пополненияпо прайсупо прайсупо прайсу
Где считается запроснаши серверыоблако вендораоблако вендораоблако вендора

Скорость — наши замеры в GPTunneL на коротком промпте без режима рассуждений; у фронтир-моделей цифры сильно зависят от нагрузки вендора. Окна контекста — по данным поставщиков на июль 2026.

Инфраструктура

Тяжёлый запрос не тормозит лёгкий

Перед моделью стоит балансировщик. Он смотрит на вес запроса — сколько токенов на входе, нужен ли длинный контекст — и решает, на каком железе его считать.

Короткий вопросдо 2K токенов
Диалог с файлом20–60K токенов
Длинный контекстдо 256K токенов
Балансировщиксчитает вес запроса и держит очередь
пул AA5000 24 ГБкороткие запросы, квантизованная модель
пул BA100диалоги с файлами и средний контекст
пул CH200длинный контекст и большие батчи

Часть парка — наши собственные серверы, часть арендуем в дата-центрах в России. Grom — модель среднего размера: в квантизации она помещается на относительно бюджетные карты, поэтому мы держим её горячей сразу в нескольких пулах и переживаем пики без очереди.

API

Grom по API — по запросу

Модель живёт не только в чате. Командам открываем доступ по API с понятными лимитами и обязательствами.

Тот же ключ

Grom подключается тем же API-ключом GPTunneL, что и остальные модели платформы. Отдельная интеграция не нужна.

TPM под задачу

Согласуем лимит токенов в минуту и держим ёмкость под вас, а не общую очередь.

SLA в договоре

Доступность, время ответа и приоритет обработки фиксируем письменно.

On-premise

Если данные нельзя выпускать наружу — разворачиваем Grom в вашем контуре, на вашем железе.

Вопросы про Grom

С Grom можно начать без пополнения баланса — на то он и был сделан: чтобы новый пользователь сразу получил рабочую нейросеть, а не форму оплаты. Остальные модели тарифицируются по прайсу, платишь только за то, что используешь.

Попробуй Grom прямо сейчас

Регистрация занимает минуту, первый ответ — полсекунды. Рядом — вся линейка Гром и ещё две сотни моделей.