Grom 1.5
Модель, с которой начинается GPTunneL. Отвечает первой, видит картинки, держит длинный контекст и работает на нашем железе — а не в чужом облаке.
Начинает печатать, пока другие думают
Первый токен уходит примерно через полсекунды, дальше поток разгоняется до 120 токенов в секунду. Крупные модели сначала долго прогревают запрос — на коротком вопросе эта пауза заметнее, чем разница в тексте ответа.
Наши замеры: короткий промпт без режима рассуждений, чужие модели дёргали через GPTunneL, Grom — на своём инференсе. Реальные цифры зависят от нагрузки, длины запроса и того, что происходит у вендора.
Видит картинку, а не только текст
Кидай скриншот, фото документа или график. Модель разбирает, что на изображении, и отвечает текстом — отдельная OCR-обвязка не нужна.

- Скриншоты и документы.Текст с фотографии, таблица, чек, экран с ошибкой — всё читается прямо из картинки.
- Картинка попадает в общий контекст.Можно уточнять дальше по переписке, не прикладывая файл заново.
- Работает и в чате, и по API.Формат запроса — как у остальных моделей платформы.
256 000 токенов в одном диалоге
Это порядка шестисот страниц текста. Договор целиком, логи сборки, месячная переписка — можно положить в диалог и спрашивать по ним, не нарезая документ на куски.
- Договор на 60 страниц18%
- Логи сборки за день23%
- История диалога12%
- Свободно под ответы и уточнения47%
Кэш префикса в памяти GPU
Длинный документ не пересчитывается на каждый вопрос: посчитанные ключи и значения внимания остаются в памяти ускорителя. Первый вопрос по файлу оплачивает обработку, следующие стартуют с уже прогретого контекста.
Где Grom выигрывает, а где — нет
Честно: это модель среднего размера. Она берёт скоростью, ценой и тем, что крутится у нас. Сложную аналитику и большой код лучше отдавать фронтир-моделям — они в том же окне чата, переключение занимает секунду.
| Grom 1.5наш инференс | Claude Sonnet-5anthropic | GPT 5openai | Qwen 3.5 Plusalibaba | |
|---|---|---|---|---|
| Первый токен | ~500 мс | 1,3–1,8 с | 1,5–2 с | 1,8–2,5 с |
| Скорость генерации | до 120 ток/с | ~70 ток/с | ~60 ток/с | ~55 ток/с |
| Окно контекста | 256K | 1M | 400K | 1M |
| Картинки на входе | да | да | да | да |
| Сложные рассуждения, большой код | базовый уровень | заметно сильнее | заметно сильнее | сильнее |
| Цена в чате | старт без пополнения | по прайсу | по прайсу | по прайсу |
| Где считается запрос | наши серверы | облако вендора | облако вендора | облако вендора |
Скорость — наши замеры в GPTunneL на коротком промпте без режима рассуждений; у фронтир-моделей цифры сильно зависят от нагрузки вендора. Окна контекста — по данным поставщиков на июль 2026.
Тяжёлый запрос не тормозит лёгкий
Перед моделью стоит балансировщик. Он смотрит на вес запроса — сколько токенов на входе, нужен ли длинный контекст — и решает, на каком железе его считать.
Часть парка — наши собственные серверы, часть арендуем в дата-центрах в России. Grom — модель среднего размера: в квантизации она помещается на относительно бюджетные карты, поэтому мы держим её горячей сразу в нескольких пулах и переживаем пики без очереди.
Grom по API — по запросу
Модель живёт не только в чате. Командам открываем доступ по API с понятными лимитами и обязательствами.
Тот же ключ
Grom подключается тем же API-ключом GPTunneL, что и остальные модели платформы. Отдельная интеграция не нужна.
TPM под задачу
Согласуем лимит токенов в минуту и держим ёмкость под вас, а не общую очередь.
SLA в договоре
Доступность, время ответа и приоритет обработки фиксируем письменно.
On-premise
Если данные нельзя выпускать наружу — разворачиваем Grom в вашем контуре, на вашем железе.
Нужен Grom по API?
Напишите — обсудим нагрузку, лимиты, SLA и цену.
Вопросы про Grom
Попробуй Grom прямо сейчас
Регистрация занимает минуту, первый ответ — полсекунды. Рядом — вся линейка Гром и ещё две сотни моделей.