Muse Spark 1.3 от Meta: бенчмарки, цена и когда её брать

Muse Spark 1.3 от Meta: бенчмарки, цена и когда её брать

2 сентября Meta выложила Muse Spark 1.3 — обновление своей старшей модели, заточенное под код и долгие агентные сценарии. Цукерберг описал релиз формулой «frontier performance almost too cheap to meter», и в этот раз маркетинговая фраза почти совпадает с цифрами: по стоимости одной задачи Spark действительно дешевле всех, кто держится в её весовой категории.

При этом заявленные Meta числа выше независимых замеров, а половина обзоров меряет модель по конфигурации, которой в API нет. Разберём, где проходит эта граница.

Минимальный запрос

API GPTunneL совместим с OpenAI, поэтому подключение — это base_url и имя модели:

bash
curl https://gptunnel.ru/v1/chat/completions \
  -H "Authorization: <ВАШ_API_КЛЮЧ>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "muse-spark-1.3",
    "messages": [
      {"role": "user", "content": "Найди причину падения в этом стектрейсе и предложи патч"}
    ]
  }'

То же официальным клиентом OpenAI:

Python
from openai import OpenAI

client = OpenAI(
    api_key="<ВАШ_API_КЛЮЧ>",
    base_url="https://gptunnel.ru/v1",
)

resp = client.chat.completions.create(
    model="muse-spark-1.3",
    messages=[{"role": "user", "content": "Найди причину падения и предложи патч"}],
    stream=True,
)
for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="")

Полный список параметров — в документации и на странице /docs.

Бенчмарки

Meta показывает Spark 1.3 в двух конфигурациях, и это важно для чтения любой таблицы. xhigh — то, что раздают всем через Muse Code и Model API. max — вариант в закрытом превью для партнёров: он проходит дополнительное тестирование безопасности, и когда его откроют, Meta не говорит.

БенчмаркSpark 1.3 xhighSpark 1.3 maxОриентир
AA Intelligence Index6162Claude Fable 5.1 — 66
Tau3-Bench Banking47%52%лучший результат таблицы
Terminal-Bench 2.185%86%Meta заявляет 88,8%
GDPval-AA v21709 Elo1754 Elo
GPQA Diamond94%94%
Humanity's Last Exam47%47%
AA-LCR (длинный контекст)79%79%у 1.2 было 83%

Источник цифр по колонкам xhigh/max — независимые прогоны Artificial Analysis; 75,4% на DeepSWE 1.1 и 88,8% на Terminal-Bench 2.1 — из собственной карточки Meta.

Расхождение по Terminal-Bench в три пункта — не подтасовка, а разные условия прогона, но при выборе модели ориентироваться стоит на нижнюю цифру: свой скаффолд и свои таймауты вы под бенчмарк подгонять не будете.

Публичная xhigh идёт вровень с GPT-5.6 Sol и Grok 4.6 и не дотягивает до Claude Fable 5.1 пяти пунктов индекса. «Почти Fable» — это про агентные ряды и про цену, а не про общий уровень интеллекта.

Подвох: max, которого у вас нет

Половина заголовков про релиз меряет Spark по версии max — а в API её нет. Разрыв между конфигурациями невелик на индексе (61 против 62), но на агентных задачах он заметен: 47% против 52% на Tau3-Bench Banking, 1709 против 1754 Elo на GDPval-AA v2. Платит max за это токенами рассуждений: на GDPval их уходит на 62% больше, на банковских задачах — на 28%.

Если вы читаете чужой обзор и цифра выглядит слишком хорошо, проверьте, о какой конфигурации речь.

Цена: где Spark действительно выигрывает

У Meta модель стоит $1,25 за миллион входящих токенов и $4,25 за миллион исходящих ($0,15 за кешированный вход) — столько же, сколько стоила 1.2. Но показатель, ради которого релиз стоит рассматривать, другой: стоимость одной задачи Intelligence Index — $0,55. Это лучший результат среди всех моделей с индексом 59 и выше; GPT-5.6 Sol (max) обходится в $0,95, Grok 4.6 (high) — в $0,94, то есть на 70% дороже.

Экономия набегает не только из ставки за токен. По замерам Meta, 1.3 закрывает инженерные сравнения примерно на 20% меньшим числом вызовов инструментов и на 25% меньшим числом токенов, чем 1.2. Для агента, который крутится в цикле часами, это и есть основная статья счёта.

В GPTunneL Spark 1.3 стоит 0,25 ₽ за 1 000 входящих токенов и 0,85 ₽ за 1 000 исходящих — 250 ₽ и 850 ₽ за миллион. Для сравнения, у Claude Fable 5.1 в том же каталоге 2 ₽ и 10 ₽ за тысячу: вход дешевле в восемь раз, выход — почти в двенадцать. Актуальные цифры — на странице цен, там же калькулятор запроса.

Отдельно про тариф Contributor у самой Meta: $0,10 и $0,20 за миллион, до двадцати раз дешевле базового. Цена этой скидки — право Meta обучаться на ваших промптах и ответах модели. Для продукта, который гоняет через модель чужие данные, это не тариф, а вопрос к юристам.

Где Spark проседает

  • Длинный контекст стал хуже, а не лучше. AA-LCR — 79% против 83% у 1.2. Миллион токенов в окне модель держит, но извлекать из него факты она стала чуть менее надёжно. Если у вас RAG на большом окне, замерьте на своих документах, прежде чем переключать трафик.
  • Фактология. AA-Omniscience — 42% у xhigh и 44% у max. Модель для работы с кодом и инструментами, а не энциклопедия; вопросы «на знание» лучше закрывать поиском в сети.
  • Агентные ряды. На собственной карточке Meta Spark 1.3 забирает DeepSWE v1.1, SWEAtlas CodeBase QnA и обе полосы MRCR, сводит вничью Terminal-Bench 2.1 — и проигрывает все шесть агентных строк Claude Opus 5 или GPT-5.6 Sol.

Что проверить до переезда

Стриминг. Модель с адаптивными рассуждениями отвечает неравномерно: пауза перед первым токеном заметно длиннее, чем у Flash-моделей. Без stream: true это упирается в таймаут прокси, а не в лимиты модели.

Стоимость длинного промпта. Окно в миллион токенов соблазняет положить в контекст всё. При 0,25 ₽ за тысячу токенов входа полный миллион — это 250 ₽ за один запрос. Кеширование входа снимает часть счёта, но считать надо заранее.

Что модель принимает. В каталоге у Spark 1.3 заявлены рассуждения, работа с изображениями и разбор PDF. Если ваш пайплайн завязан на вызов инструментов, проверьте поведение на своём наборе функций до того, как переносить прод.

Частые вопросы о Muse Spark 1.3

Чем Muse Spark отличается от LLaMA? Это разные ветки. LLaMA — открытые модели с опубликованными весами, их можно развернуть у себя. Muse Spark — закрытый флагман: весов нет, зато выше уровень в коде и агентных сценариях. Обе линейки собраны на странице моделей Meta.

Что значит xhigh в названии? Уровень усилия рассуждений. xhigh — конфигурация, доступная в API; max — версия для партнёров, в открытом доступе её пока нет.

Стоит ли переезжать с Claude Fable 5.1? Если задача — код и агенты с понятным набором инструментов, разница в цене оправдывает тест: пять пунктов индекса против восьмикратной разницы в стоимости входа. Если важны длинный контекст и точность на фактах — оставайтесь на Fable и сравните на своих данных.

Модель понимает русский? Да, линейка многоязычная. Промпты на русском работают, но системные инструкции для агентов надёжнее держать на английском.

Итог

Muse Spark 1.3 — не «убийца Fable», а самая дешёвая точка входа в верхний эшелон: индекс 61 при стоимости задачи вдвое ниже конкурентов. Берите под агентов и код, где цена цикла важнее последних пяти пунктов бенчмарка, и перепроверьте на своих данных длинный контекст — именно там модель по сравнению с предыдущей версией просела.

Подключается она одной строкой: открой Muse Spark 1.3 в GPTunneL, поменяй имя модели в конфиге и прогони свой набор запросов — баланс общий с остальными моделями каталога, отдельная подписка не нужна.

Meta признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации.