13 августа OpenAI показала Ultrafast — режим, в котором флагманская GPT-5.6 Sol выдаёт ответ до 14 раз быстрее обычного. Это не новая модель и не облегчённая версия: интеллект тот же, меняется только скорость выдачи токенов. Пока режим доступен ограниченному кругу клиентов в API, но сама Sol уже работает в GPTunneL — что она умеет, мы разбирали в отдельной статье.
Что такое Ultrafast
Ultrafast — не модель, а сервисный режим рядом с обычным Standard. Запрос уходит в ту же GPT-5.6 Sol, ответ тот же по качеству, но токены приходят в разы быстрее.
Раньше развилка была неприятной: нужна скорость — бери модель поменьше и попроще, а значит смирись с более слабыми ответами. Именно её OpenAI и убирает. Формулировка компании прямая: до сих пор скорость реального времени означала переход на меньшую или узкоспециализированную модель.
Не путай Ultrafast с режимом Ultra, который у Sol был с самого анонса. Ultra — наоборот про «подумать подольше»: модель запускает несколько внутренних подагентов и параллельно решает разные части сложной задачи. Ultrafast — про мгновенный ответ на том же уровне интеллекта. Это два конца одной шкалы.
Главные цифры
- до 750 выходных токенов в секунду — пиковая скорость режима;
- до 14× относительно Standard: базовая скорость Sol — около 53 токенов в секунду;
- без потери качества — модель не урезают и не заменяют на дистиллят.
Чтобы почувствовать разницу: 53 токена в секунду — это примерно темп человека, который бегло читает вслух, и за ответом можно следить глазами. 750 токенов в секунду — это когда абзац появляется целиком раньше, чем ты дочитал его первую строку.
Откуда берётся скорость
Ultrafast работает не на привычных GPU, а на железе Cerebras — архитектуре Wafer-Scale Engine. Чип там размером с целую кремниевую пластину и несёт 44 ГБ SRAM прямо на борту.
Смысл в том, где живут веса модели. На обычных ускорителях их приходится постоянно гонять между памятью чипа и внешней памятью, и именно эта пропускная способность, а не вычисления, упирается в потолок при работе больших моделей. Cerebras держит веса на самом чипе — узкое место исчезает, отсюда и кратный отрыв по скорости.

Что показали на бенчмарках
Главный аргумент — что скорость не куплена качеством.
- Humanity's Last Exam. 2500 вопросов уровня PhD по химии, экономике, литературе и другим областям. Sol в Ultrafast прошла весь набор за 11 часов 11 минут, Claude Fable 5 на том же наборе — за 78 часов 27 минут, то есть больше трёх суток непрерывных вычислений. Разница примерно семикратная при сопоставимой точности.
- GDP-Val, набор задач, имитирующих реальную оплачиваемую работу: сквозное ускорение в 5,6 раза без просадки качества.
- По замерам Cerebras, Sol в Ultrafast быстрее Fable 5 в 11 раз и в 5 раз быстрее Opus 4.8, запущенной в её собственном быстром режиме.
Оговорка по-честному: все цифры выше — от OpenAI и Cerebras, независимых замеров пока нет. Ждём, когда режим откроют шире и его прогонят сторонние лаборатории.
Кому нужна такая скорость
OpenAI прямо называет сценарии, где секунды решают:
- разбор инцидентов — модель читает логи и трейсы, пока авария ещё идёт, а не после;
- голосовые ассистенты и живая поддержка — в диалоге голосом пауза в несколько секунд убивает разговор;
- финансовая аналитика — исследование рынка ощущается как живая беседа, а не как отправка запроса и ожидание;
- электронная торговля — подбор и рекомендации в момент, когда покупатель ещё на странице;
- агенты-разработчики — длинные цепочки действий перестают упираться в скорость генерации;
- ресёрч. Самый заметный эффект: прогоны, которые раньше ставили на ночь, теперь укладываются в рабочий день — и вместо одной итерации в сутки получается несколько.
Среди тех, кто уже тестирует режим, OpenAI называет Jane Street, Podium, Basis и Rogo — то есть финансы, поддержка и внутренние продуктовые команды.
Sol, Terra или Luna — какую модель брать
В семействе GPT-5.6 три модели, и Ultrafast не отменяет выбора между ними: он про скорость одной конкретной Sol, а не про цену.
| Модель | Зачем нужна | Цена |
|---|---|---|
| GPT-5.6 Sol | Флагман: сложный код, исследования, длинные агентные цепочки | Самая дорогая в тройке |
| GPT-5.6 Terra | Рабочая лошадка: почти то же качество заметно дешевле | Примерно вдвое-втрое дешевле Sol |
| GPT-5.6 Luna | Массовые запросы, автоматизация, высокая нагрузка | Самая дешёвая — в десятки раз дешевле Sol |
Практическое правило простое: черновики, классификацию и однотипные задачи гони через Luna, повседневную работу — через Terra, а Sol береги для того, где реально нужен максимум. Актуальные цифры по всем трём — на странице цен, они пересчитываются из каталога платформы. Подробный разбор различий — в статье про GPT-5.6 Sol.
Когда Ultrafast откроют всем
Пока это ограниченное превью: доступ есть у небольшой группы компаний, расширять его OpenAI обещает по мере роста мощностей. Записаться в очередь можно, указав свой сценарий, требования по задержке и ожидаемые объёмы.
Цену режима не назвали — ни в анонсе, ни в документации. Логично ожидать, что скорость будет стоить дороже стандартного тарифа, но пока это только ожидание, а не факт.
Где попробовать GPT-5.6 Sol сейчас
Сам Ultrafast в закрытом превью, а вот флагман доступен уже сегодня: открой GPT-5.6 Sol в GPTunneL — без VPN, с оплатой российскими картами в рублях и без обязательной подписки. Рядом в том же чате Terra и Luna, а также Claude, Gemini, DeepSeek и остальной каталог — переключаться между ними можно в одном окне и с одного баланса.
Частые вопросы
Ultrafast — это новая модель? Нет. Это режим работы существующей GPT-5.6 Sol. Веса, качество ответов и возможности те же, отличается только скорость выдачи.
Можно ли включить Ultrafast в GPTunneL? Пока нет: режим находится в закрытом превью OpenAI API и публично не открыт. Как только он станет доступен, мы напишем об этом в блоге. Sol в стандартном режиме работает у нас уже сейчас.
Насколько Ultrafast быстрее на самом деле? По данным OpenAI — до 750 токенов в секунду против примерно 53 в стандартном режиме, то есть до 14 раз. «До» здесь важно: пиковая скорость и средняя по реальным задачам — не одно и то же.
Падает ли качество ответов в быстром режиме? OpenAI и Cerebras заявляют, что нет, и подкрепляют это результатами HLE и GDP-Val. Независимых замеров пока нет.
Чем Sol отличается от Terra и Luna? Sol — флагман для сложных задач, Terra — баланс качества и цены, Luna — самая быстрая и дешёвая для потока. Подробности — в разборе GPT-5.6 Sol.
Попробуй сам
Ultrafast — это сигнал, куда движется индустрия: скорость перестаёт быть платой за интеллект. Пока режим открывают избранным, самая сильная модель OpenAI уже доступна без ожидания — запусти GPT-5.6 Sol в GPTunneL и сравни её с Terra и Luna на своих задачах.
Новые модели и режимы появляются у нас в день открытия API — следи за новостями в блоге.



