Наш инференс

Линейка Гром

Полный цикл — внутри команды: исследуем архитектуры, обучаем и дообучаем модели на своих данных, держим инференс на собственных мощностях. Это даёт контроль над качеством, латентностью и себестоимостью генерации.

Инфраструктура

Своё железо, свой контур

Модели Гром работают на наших серверах в России: мы сами держим стойки, сеть и очередь запросов, поэтому отвечаем за скорость и стабильность, а не пересылаем ответственность зарубежному провайдеру. Под инференс собран парк ускорителей — NVIDIA H200 и A100, A5000 и другие карты: каждая задача едет на том железе, которое ей подходит, от быстрых текстовых ответов до генерации видео и апскейла на 100 мегапикселей. Работать с моделями можно двумя способами: в интерфейсе GPTunneL — как с любой другой моделью в чате, или по API — тем же ключом, что и к остальным двумстам нейросетям, отдельная интеграция не нужна. Для бизнеса по запросу согласуем повышенный SLA: выделенные мощности, гарантированное время отклика и приоритетная очередь. Если требования к безопасности жёстче — модели Гром разворачиваются on-premise, внутри контура компании.