Ultrafast: OpenAI ускорила GPT-5.6 Sol в 14 раз

Ultrafast: OpenAI ускорила GPT-5.6 Sol в 14 раз

13 августа OpenAI показала Ultrafast — режим, в котором флагманская GPT-5.6 Sol выдаёт ответ до 14 раз быстрее обычного. Это не новая модель и не облегчённая версия: интеллект тот же, меняется только скорость выдачи токенов. Пока режим доступен ограниченному кругу клиентов в API, но сама Sol уже работает в GPTunneL — что она умеет, мы разбирали в отдельной статье.

Что такое Ultrafast

Ultrafast — не модель, а сервисный режим рядом с обычным Standard. Запрос уходит в ту же GPT-5.6 Sol, ответ тот же по качеству, но токены приходят в разы быстрее.

Раньше развилка была неприятной: нужна скорость — бери модель поменьше и попроще, а значит смирись с более слабыми ответами. Именно её OpenAI и убирает. Формулировка компании прямая: до сих пор скорость реального времени означала переход на меньшую или узкоспециализированную модель.

Не путай Ultrafast с режимом Ultra, который у Sol был с самого анонса. Ultra — наоборот про «подумать подольше»: модель запускает несколько внутренних подагентов и параллельно решает разные части сложной задачи. Ultrafast — про мгновенный ответ на том же уровне интеллекта. Это два конца одной шкалы.

Главные цифры

  • до 750 выходных токенов в секунду — пиковая скорость режима;
  • до 14× относительно Standard: базовая скорость Sol — около 53 токенов в секунду;
  • без потери качества — модель не урезают и не заменяют на дистиллят.

Чтобы почувствовать разницу: 53 токена в секунду — это примерно темп человека, который бегло читает вслух, и за ответом можно следить глазами. 750 токенов в секунду — это когда абзац появляется целиком раньше, чем ты дочитал его первую строку.

Откуда берётся скорость

Ultrafast работает не на привычных GPU, а на железе Cerebras — архитектуре Wafer-Scale Engine. Чип там размером с целую кремниевую пластину и несёт 44 ГБ SRAM прямо на борту.

Смысл в том, где живут веса модели. На обычных ускорителях их приходится постоянно гонять между памятью чипа и внешней памятью, и именно эта пропускная способность, а не вычисления, упирается в потолок при работе больших моделей. Cerebras держит веса на самом чипе — узкое место исчезает, отсюда и кратный отрыв по скорости.

Схематичная иллюстрация: кремниевая пластина-чип, на которой целиком помещаются веса модели

Что показали на бенчмарках

Главный аргумент — что скорость не куплена качеством.

  • Humanity's Last Exam. 2500 вопросов уровня PhD по химии, экономике, литературе и другим областям. Sol в Ultrafast прошла весь набор за 11 часов 11 минут, Claude Fable 5 на том же наборе — за 78 часов 27 минут, то есть больше трёх суток непрерывных вычислений. Разница примерно семикратная при сопоставимой точности.
  • GDP-Val, набор задач, имитирующих реальную оплачиваемую работу: сквозное ускорение в 5,6 раза без просадки качества.
  • По замерам Cerebras, Sol в Ultrafast быстрее Fable 5 в 11 раз и в 5 раз быстрее Opus 4.8, запущенной в её собственном быстром режиме.

Оговорка по-честному: все цифры выше — от OpenAI и Cerebras, независимых замеров пока нет. Ждём, когда режим откроют шире и его прогонят сторонние лаборатории.

Кому нужна такая скорость

OpenAI прямо называет сценарии, где секунды решают:

  • разбор инцидентов — модель читает логи и трейсы, пока авария ещё идёт, а не после;
  • голосовые ассистенты и живая поддержка — в диалоге голосом пауза в несколько секунд убивает разговор;
  • финансовая аналитика — исследование рынка ощущается как живая беседа, а не как отправка запроса и ожидание;
  • электронная торговля — подбор и рекомендации в момент, когда покупатель ещё на странице;
  • агенты-разработчики — длинные цепочки действий перестают упираться в скорость генерации;
  • ресёрч. Самый заметный эффект: прогоны, которые раньше ставили на ночь, теперь укладываются в рабочий день — и вместо одной итерации в сутки получается несколько.

Среди тех, кто уже тестирует режим, OpenAI называет Jane Street, Podium, Basis и Rogo — то есть финансы, поддержка и внутренние продуктовые команды.

Sol, Terra или Luna — какую модель брать

В семействе GPT-5.6 три модели, и Ultrafast не отменяет выбора между ними: он про скорость одной конкретной Sol, а не про цену.

МодельЗачем нужнаЦена
GPT-5.6 SolФлагман: сложный код, исследования, длинные агентные цепочкиСамая дорогая в тройке
GPT-5.6 TerraРабочая лошадка: почти то же качество заметно дешевлеПримерно вдвое-втрое дешевле Sol
GPT-5.6 LunaМассовые запросы, автоматизация, высокая нагрузкаСамая дешёвая — в десятки раз дешевле Sol

Практическое правило простое: черновики, классификацию и однотипные задачи гони через Luna, повседневную работу — через Terra, а Sol береги для того, где реально нужен максимум. Актуальные цифры по всем трём — на странице цен, они пересчитываются из каталога платформы. Подробный разбор различий — в статье про GPT-5.6 Sol.

Когда Ultrafast откроют всем

Пока это ограниченное превью: доступ есть у небольшой группы компаний, расширять его OpenAI обещает по мере роста мощностей. Записаться в очередь можно, указав свой сценарий, требования по задержке и ожидаемые объёмы.

Цену режима не назвали — ни в анонсе, ни в документации. Логично ожидать, что скорость будет стоить дороже стандартного тарифа, но пока это только ожидание, а не факт.

Где попробовать GPT-5.6 Sol сейчас

Сам Ultrafast в закрытом превью, а вот флагман доступен уже сегодня: открой GPT-5.6 Sol в GPTunneL — без VPN, с оплатой российскими картами в рублях и без обязательной подписки. Рядом в том же чате Terra и Luna, а также Claude, Gemini, DeepSeek и остальной каталог — переключаться между ними можно в одном окне и с одного баланса.

Частые вопросы

Ultrafast — это новая модель? Нет. Это режим работы существующей GPT-5.6 Sol. Веса, качество ответов и возможности те же, отличается только скорость выдачи.

Можно ли включить Ultrafast в GPTunneL? Пока нет: режим находится в закрытом превью OpenAI API и публично не открыт. Как только он станет доступен, мы напишем об этом в блоге. Sol в стандартном режиме работает у нас уже сейчас.

Насколько Ultrafast быстрее на самом деле? По данным OpenAI — до 750 токенов в секунду против примерно 53 в стандартном режиме, то есть до 14 раз. «До» здесь важно: пиковая скорость и средняя по реальным задачам — не одно и то же.

Падает ли качество ответов в быстром режиме? OpenAI и Cerebras заявляют, что нет, и подкрепляют это результатами HLE и GDP-Val. Независимых замеров пока нет.

Чем Sol отличается от Terra и Luna? Sol — флагман для сложных задач, Terra — баланс качества и цены, Luna — самая быстрая и дешёвая для потока. Подробности — в разборе GPT-5.6 Sol.

Попробуй сам

Ultrafast — это сигнал, куда движется индустрия: скорость перестаёт быть платой за интеллект. Пока режим открывают избранным, самая сильная модель OpenAI уже доступна без ожидания — запусти GPT-5.6 Sol в GPTunneL и сравни её с Terra и Luna на своих задачах.

Новые модели и режимы появляются у нас в день открытия API — следи за новостями в блоге.