Meta-ның Muse Spark 1.3: бенчмарктер, баға және оны қашан алу керек

Meta-ның Muse Spark 1.3: бенчмарктер, баға және оны қашан алу керек

2 қыркүйекте Meta Muse Spark 1.3 моделін шығарды — бұл оның үлкен моделінің код пен ұзақ агенттік сценарийлерге бейімделген жаңаруы. Цукерберг релизді «frontier performance almost too cheap to meter» деп сипаттады, және бұл жолы маркетингтік тіркес сандармен дерлік сәйкес келеді: бір тапсырманың құны бойынша Spark өз салмақ санатындағы ең арзан модель.

Түйіні мынада: Meta жариялаған сандар тәуелсіз өлшемдерден жоғары, ал шолулардың жартысы API-де жоқ конфигурацияны өлшейді. Осы шекара қайда өтетінін талдайық.

Ең қарапайым сұраныс

GPTunneL API OpenAI-мен үйлесімді, сондықтан қосылу — бұл base_url мен модель атауы:

bash
curl https://gptunnel.ru/v1/chat/completions \
  -H "Authorization: <СЕНІҢ_API_КІЛТІҢ>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "muse-spark-1.3",
    "messages": [
      {"role": "user", "content": "Осы стектрейстегі құлау себебін тауып, патч ұсын"}
    ]
  }'

Ресми OpenAI клиентімен дәл сол:

Python
from openai import OpenAI

client = OpenAI(
    api_key="<СЕНІҢ_API_КІЛТІҢ>",
    base_url="https://gptunnel.ru/v1",
)

resp = client.chat.completions.create(
    model="muse-spark-1.3",
    messages=[{"role": "user", "content": "Құлау себебін тауып, патч ұсын"}],
    stream=True,
)
for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="")

Параметрлердің толық тізімі — құжаттамада және /docs бетінде.

Бенчмарктер

Meta Spark 1.3-ті екі конфигурацияда шығарады, және кез келген кестені оқығанда бұл маңызды. xhigh — Muse Code пен Model API арқылы бәріне берілетін нұсқа. max — серіктестерге арналған жабық превьюдегі нұсқа: ол қосымша қауіпсіздік тексерісінен өтіп жатыр, оны қашан ашатынын Meta айтпайды.

БенчмаркSpark 1.3 xhighSpark 1.3 maxБағдар
AA Intelligence Index6162Claude Fable 5.1 — 66
Tau3-Bench Banking47%52%кестедегі ең үздік нәтиже
Terminal-Bench 2.185%86%Meta 88,8% деп мәлімдейді
GDPval-AA v21709 Elo1754 Elo
GPQA Diamond94%94%
Humanity's Last Exam47%47%
AA-LCR (ұзын контекст)79%79%1.2-де 83% болған

xhigh/max бағандарындағы сандардың дереккөзі — Artificial Analysis тәуелсіз өлшемдері; DeepSWE 1.1-дегі 75,4% пен Terminal-Bench 2.1-дегі 88,8% — Meta-ның өз карточкасынан.

Terminal-Bench бойынша үш тармақтық айырма — бұрмалау емес, прогон шарттары басқа. Бірақ модель таңдағанда төменгі санға сүйенген жөн: өз скаффолдың мен таймауттарыңды бенчмаркқа лайықтап отырмайсың.

Баршаға қолжетімді xhigh GPT-5.6 Sol мен Grok 4.6 деңгейінде тұр әрі Claude Fable 5.1-ге бес тармақ жетпейді. «Fable-ға жақын» дегені — агенттік жолдар мен баға туралы, жалпы интеллект деңгейі туралы емес.

Түйін: сенде жоқ max

Релиз туралы шолулардың жартысы Spark-ты max нұсқасымен өлшейді, ал ол API-де жоқ. Индекстегі айырма шағын (61-ге қарсы 62), бірақ агенттік тапсырмаларда ол байқалады: Tau3-Bench Banking-те 47%-ға қарсы 52%, GDPval-AA v2-де 1709-ға қарсы 1754 Elo. Max бұл үшін пайымдау токендерімен төлейді: GDPval-да 62%, банк тапсырмаларында 28% көп кетеді.

Бөгде шолудағы сан тым жақсы көрінсе, қай конфигурация туралы екенін тексер.

Баға: Spark нақты ұтатын жер

Meta-да модель миллион кіріс токен үшін $1,25, миллион шығыс токен үшін $4,25 тұрады (кешке түскен кіріс — $0,15) — 1.2-мен бірдей. Бірақ релизді қарастыруға тұрарлық ететін көрсеткіш басқа: Intelligence Index-тің бір тапсырмасының құны — $0,55. Бұл индексі 59 және одан жоғары барлық модельдер арасындағы ең үздік нәтиже; GPT-5.6 Sol (max) $0,95, Grok 4.6 (high) $0,94 тұрады, яғни 70% қымбат.

Үнем токен мөлшерлемесінен ғана жиналмайды. Meta өлшемдері бойынша, 1.3 инженерлік салыстыруларды 1.2-ге қарағанда шамамен 20% аз құрал шақыруымен және 25% аз токенмен жабады. Сағаттап циклде айналатын агент үшін шоттың негізгі бабы — осы.

GPTunneL-де Spark 1.3 миллион кіріс токен үшін 1 250 ₸, миллион шығыс токен үшін 4 250 ₸ тұрады. Салыстыру үшін, сол каталогтағы Claude Fable 5.1 — миллионы үшін 10 000 ₸ және 50 000 ₸: кірісі сегіз есе, шығысы он екіге жуық есе арзан. Өзекті сандар — бағалар бетінде, сол жерде сұраныс калькуляторы да бар.

Meta-ның өзіндегі Contributor тарифі туралы бөлек: миллионы үшін $0,10 және $0,20, базалықтан жиырма есеге дейін арзан. Бұл жеңілдіктің бағасы — Meta-ның сенің промттарың мен модель жауаптарында оқу құқығы. Модель арқылы бөгде деректерді айдайтын өнім үшін бұл тариф емес, заңгерлерге қойылатын сұрақ.

Spark қай жерде шегінеді

  • Ұзын контекст жақсармай, нашарлады. AA-LCR — 1.2-дегі 83%-ға қарсы 79%. Модель терезеде миллион токен ұстайды, бірақ одан фактілерді сәл сенімсіздеу шығарады. Үлкен терезеде RAG жасасаң, трафикті ауыстырар алдында өз құжаттарыңда өлшеп ал.
  • Фактология. AA-Omniscience — xhigh-та 42%, max-та 44%. Бұл кодпен және құралдармен жұмысқа арналған модель, энциклопедия емес; «білуге» арналған сұрақтарды желіден іздеумен жапқан дұрыс.
  • Агенттік жолдар. Meta-ның өз карточкасында Spark 1.3 DeepSWE v1.1, SWEAtlas CodeBase QnA және MRCR-дың екі жолағын алады, Terminal-Bench 2.1-де тең түседі — және алты агенттік жолдың бәрін Claude Opus 5 не GPT-5.6 Sol-ға ұтылады.

Көшер алдында нені тексеру керек

Стриминг. Бейімделгіш пайымдауы бар модель біркелкі жауап бермейді: бірінші токенге дейінгі үзіліс Flash класындағы модельдерге қарағанда әлдеқайда ұзақ. stream: true болмаса, бұл модель шектеуіне емес, прокси таймаутына тіреледі.

Ұзын промпттың құны. Миллион токендік терезе бәрін контекстке салуға азғырады. Миллион кіріс токен үшін 1 250 ₸ болғанда, толық терезе — бір сұраныс үшін 1 250 ₸. Кіріс кештеу шоттың бір бөлігін алып тастайды, бірақ есептеуді алдын ала жасаған жөн.

Модель нені қабылдайды. Каталогта Spark 1.3-те пайымдау, суреттермен жұмыс және PDF талдау көрсетілген. Пайплайның құрал шақыруға байланған болса, продқа көшірер алдында өз функциялар жиынында мінез-құлқын тексер.

Muse Spark 1.3 туралы жиі қойылатын сұрақтар

Muse Spark LLaMA-дан несімен ерекшеленеді? Бұл әртүрлі тармақтар. LLaMA — салмақтары жарияланған ашық модельдер, оларды өзіңде орналастыруға болады. Muse Spark — жабық флагман: салмағы жоқ, бірақ кодта және агенттік сценарийлерде деңгейі жоғары. Екі желі де Meta модельдері бетінде жинақталған.

Атаудағы xhigh нені білдіреді? Пайымдау күшінің деңгейін. xhigh — API-де қолжетімді конфигурация; max — серіктестерге арналған нұсқа, ашық қолжетімділікте әзірге жоқ.

Claude Fable 5.1-ден көшу керек пе? Тапсырма код және құралдар жиыны айқын агенттер болса, бағадағы айырма тестілеуді ақтайды: индекстің бес тармағына қарсы кіріс құнындағы сегіз еселік айырма. Ұзын контекст пен фактілердегі дәлдік маңызды болса — Fable-да қал да, өз деректеріңде салыстыр.

Ол қандай тілдерді біледі? Желі көптілді әрі ондаған тілде сенімді жауап береді, дегенмен агенттерге арналған жүйелік нұсқауларды ағылшынша ұстаған сенімдірек.

Қорытынды

Muse Spark 1.3 — «Fable өлтіруші» емес, жоғарғы эшелонға ең арзан кіру нүктесі: индексі 61, ал тапсырма құны бәсекелестерден екі есе төмен. Оны цикл бағасы бенчмарктің соңғы бес тармағынан маңызды болатын агенттер мен код үшін ал да, ұзын контекстті өз деректеріңде қайта тексер — алдыңғы нұсқамен салыстырғанда модель дәл сол жерде шегінген.

Қосылу бір жол: GPTunneL-де Muse Spark 1.3-ті аш, конфигтегі модель атауын ауыстыр да, өз сұраныстар жиынын айдап шық — баланс каталогтың қалған модельдерімен ортақ, бөлек жазылым қажет емес.