Біздің инференс

Grom 1.5

GPTunneL осы модельден басталады. Бірінші болып жауап береді, суретті көреді, ұзын контексті ұстайды және бөтен бұлтта емес, өз темірімізде жұмыс істейді.

500 мс
алғашқы токенге дейін
120
шыңында секундына токен
256K
контекст терезесі
Не үшін

Қарсы алатын модель

Grom қарапайым міндеттен туды. Адам тіркеледі, чатты ашады — және екі жүз модельдің арасынан таңдап, алғашқы сұрақ қанша тұратынын есептеп отырмай, жауапты бірден алуы керек. Сондықтан алғашқы өз моделімізді бір нәрсеге баптадық: күнделікті сұраққа жылдам әрі түсінікті жауап. Хатты қайта жазу, логтағы қатені түсіндіру, скриншоттан сандарды алу, жоспар құру — сұраныстардың басым бөлігі осылардан тұрады. Grom-мен балансты толтырмай бастауға болады: байқап көр, интерфейсті меңгер, бірер нақты міндетті шеш. Шегіне жеткенде сол терезеде GPT, Claude, Gemini және тағы екі жүз модель дайын тұр — ал онда не қолдансаң, соған төлейсің.
Жылдамдық

Басқалары ойланып жатқанда, ол жаза бастайды

Алғашқы токен жарты секундтай уақытта кетеді, одан кейін ағын секундына 120 токенге дейін үдейді. Ірі модельдер сұранысты ұзақ қыздырады — қысқа сұрақта бұл кідіріс жауап мәтініндегі айырмашылықтан гөрі анық сезіледі.

500 токендік жауапштрих — алғашқы токенді күту
Grom 1.5біздің модель
4,7 с
0120 ток/с · 500 ms
Claude Sonnet-5
8,8 с
068 ток/с · 1400 ms
GPT 5
9,7 с
062 ток/с · 1600 ms
Qwen 3.5 Plus
11,0 с
055 ток/с · 1900 ms

Біздің өлшеулеріміз: пайымдау режимінсіз қысқа промпт, бөтен модельдер GPTunneL арқылы шақырылды, Grom — өз инференсімізде. Нақты сандар жүктемеге, сұраныс ұзындығына және вендор жағындағы жағдайға байланысты.

Vision

Мәтінді ғана емес, суретті де көреді

Скриншот, құжаттың фотосы немесе график тастай бер. Модель суретте не бар екенін талдап, мәтінмен жауап береді — бөлек OCR қажет емес.

Жол бойында доп теуіп жүрген бала, артынан көлік жақындап келеді
Фотода не болып жатыр? Қауіп бар ма?
1200 × 896 · сурет → ≈1 100 токен

  • Скриншоттар мен құжаттар.Фотодағы мәтін, кесте, чек, қате шыққан экран — бәрі суреттен тікелей оқылады.
  • Сурет ортақ контекстке түседі.Файлды қайта тіркемей, әңгімені жалғастыра беруге болады.
  • Чатта да, API арқылы да жұмыс істейді.Сұраныс форматы платформаның басқа модельдеріндегідей.
Контекст

Бір диалогта 256 000 токен

Бұл шамамен алты жүз бет мәтін. Толық шарт, құрастыру логтары, айлық хат алмасу — құжатты бөлшектемей диалогқа салып, сол бойынша сұрай беруге болады.

256K токен
  • 60 беттік шарт18%
  • Бір күндік құрастыру логтары23%
  • Диалог тарихы12%
  • Жауаптар мен нақтылауларға бос орын47%

GPU жадындағы префикс кэші

Ұзын құжат әр сұраққа қайта есептелмейді: есептелген назар кілттері мен мәндері үдеткіш жадында қалады. Файл бойынша алғашқы сұрақ өңдеуді төлейді, келесілері қызып қалған контекстен басталады.

Құжат бойынша алғашқы сұрақ1900 ms
Келесі сұрақ, контекст кэште480 ms
Салыстыру

Grom қай жерде ұтады, қай жерде — жоқ

Шынын айтқанда: бұл — орташа өлшемдегі модель. Ол жылдамдығымен, бағасымен және бізде жұмыс істейтінімен ұтады. Күрделі талдау мен үлкен кодты фронтир-модельдерге беру дұрыс — олар сол чат терезесінде, бір басуда.

Grom 1.5біздің инференсClaude Sonnet-5anthropicGPT 5openaiQwen 3.5 Plusalibaba
Алғашқы токен~500 мс1,3–1,8 с1,5–2 с1,8–2,5 с
Генерация жылдамдығы120 ток/с дейін~70 ток/с~60 ток/с~55 ток/с
Контекст терезесі256K1M400K1M
Кірістегі суреттериәиәиәиә
Күрделі пайымдау, үлкен кодбазалық деңгейайтарлықтай күштіайтарлықтай күштікүштірек
Чаттағы бағатолтырусыз бастаупрайс бойыншапрайс бойыншапрайс бойынша
Сұраныс қайда есептеледібіздің серверлервендор бұлтывендор бұлтывендор бұлты

Жылдамдық — пайымдау режимінсіз қысқа промптта GPTunneL ішінде жүргізілген өз өлшеулеріміз; фронтир-модельдерде сандар вендор жүктемесіне қарай қатты өзгереді. Контекст терезелері — жеткізушілердің 2026 жылғы шілдедегі деректері бойынша.

Инфрақұрылым

Ауыр сұраныс жеңілін тежемейді

Модельдің алдында балансировщик тұр. Ол сұраныстың салмағын қарайды — кірісте қанша токен бар, ұзын контекст керек пе — және оны қай темірде есептеу керегін шешеді.

Қысқа сұрақ2K токенге дейін
Файлмен диалог20–60K токен
Ұзын контекст256K токенге дейін
Балансировщиксұраныс салмағын есептеп, кезекті ұстайды
A пулыA5000 24 ГБқысқа сұраныстар, кванттау қолданылған модель
B пулыA100файлмен диалогтар және орташа контекст
C пулыH200ұзын контекст және үлкен батчтар

Парктің бір бөлігі — өз серверлеріміз, бір бөлігін дата-орталықтардан жалға аламыз. Grom — орташа өлшемдегі модель: кванттау кезінде салыстырмалы қарапайым карталарға сыяды, сондықтан оны бірнеше пулда бірден ыстық ұстап, шыңдарды кезексіз өткереміз.

API

Grom API арқылы — сұраныс бойынша

Модель тек чатта өмір сүрмейді. Командаларға түсінікті лимиттермен және міндеттемелермен API-қолжетімділік ашамыз.

Сол бір кілт

Grom платформаның басқа модельдері сияқты сол GPTunneL API-кілтімен қосылады. Бөлек интеграция қажет емес.

Міндетке сай TPM

Минутына токен лимитін келісіп, ортақ кезек емес, сізге арналған қуат ұстаймыз.

Шарттағы SLA

Қолжетімділік, жауап беру уақыты және өңдеу басымдығы жазбаша бекітіледі.

On-premise

Деректерді сыртқа шығаруға болмаса — Grom-ды сіздің контурыңызда, өз теміріңізде орнатамыз.

Gromға қатысты сұрақтар

Grom-мен балансты толтырмай бастауға болады — ол дәл сол үшін жасалған: жаңа қолданушы төлем формасын емес, жұмыс істейтін нейрожеліні бірден алуы керек. Қалған модельдер прайс бойынша есептеледі, не қолдансаң, соған төлейсің.

Grom-ды дәл қазір байқап көр

Тіркелу бір минут алады, алғашқы жауап — жарты секунд. Қасында — бүкіл Гром желісі және тағы екі жүз модель.