Google 2026 жылғы 30 қыркүйекте Gemini 4 Argon моделін таныстырды. Ресми анонста ол күрделі бағдарламалауға, құқық пен қаржыдағы кәсіби жұмысқа және киберқорғанысқа арналған жаңа фронтир-модель ретінде сипатталған. Әзірге модель жалпыға қолжетімді емес: алғашқы қолжетімділікті Google іріктеген Fairwind бағдарламасының қатысушылары мен шақырылған тестілеушілер алады.
Мұндай релизде өнім тұрғысынан бір сұрақ маңызды: енді қандай тапсырманы модельге басынан аяғына дейін, тексерілген нәтижеге дейін тапсыруға болады? Argon-ды өзіміз әлі сынаған жоқпыз, сондықтан Google мен тәуелсіз Vals рейтингі жариялаған деректерді талдаймын: нақты жұмыс мысалдары, бенчмарктер және қолжетімділік шарттары. Анонсқа дейін Gemini 4 туралы не белгілі болғанын тамыздағы мақалада қарастырғанбыз.
Миллион шығыс токені
Google шығыс көлемінің шегін 64 мыңнан 1 миллион токенге дейін көтерді. Компания мұны былай түсіндіреді: бір траекторияда жүздеген мың токенге орын болса, модель ұзағырақ ой қорытып, күрделі тапсырманы бір жүрісте шеше алады.
- Бұрын
- 64K
- Gemini 4 Argon
- 1M
Бұл кіріс контекстінің көлемі емес, шығыс шегі.
Қысқа хат немесе аударма үшін мұндай үлкен қор әдетте қажет емес. Ол бұрын модельді тоқтатып, қайта іске қосуға тура келген жерде керек: кодты ірі көлемде көшіруде, көпқадамды зерттеуде, осалдықты тексерумен бірге талдауда. Дегенмен шектің өзі сапаны дәлелдемейді: модель қате болжамды да ұзағырақ дамытуы мүмкін. Сондықтан аяқталған жұмыстың мысалдары маңыздырақ.
Argon Google ішінде не істеп жатыр
Анонстағы ең көрнекі мысалдар кодқа қатысты. Бұл тәуелсіз тексерілмеген Google-дың ішкі деректері, бірақ олар модель қандай жұмысқа жасалғанын жақсы көрсетеді.
C/C++ кодын Rust-қа көшіру. Argon агенттері Google-дың код базаларын Rust-қа көшіріп жатыр: re2 және libgav1 сияқты кітапханалардағы ондаған мың жолдан бастап Fuchsia операциялық жүйесінің Zircon ядросындағы 800 мыңнан астам жолға дейін. Google мұндай қайта жазулар продакшенге шықпас бұрын автоматты және қолмен аудиттен, эмуляциядағы тестілеуден және ревьюден өтетінін бөлек атап өтеді.
libgav1-ді жылдамдату. Бұл видеодекодердің Rust-тағы порты бұрыннан бар еді. Агенттер ондағы SIMD кодының 32 мың жолын ауыстырды: профильдеуге негізделген көп эксперимент жүргізіп, компилятор не шығаратынын зерттеп, компилятор өзі векторландыратын қауіпсіз Rust кодын жазды. Декодер бұрынғы Rust портынан 2,7 есе жылдам жұмыс істей бастады, шығыстағы видео бірдей. Салыстыру оңтайландырылған C++ нұсқасымен емес, Rust портымен жасалған: C++ туралы Google тек онымен арадағы айырма қысқарғанын айтады.
Дата-орталықтардағы жад. Агенттер бүкіл сервер паркі бойынша профильдеу телеметриясын талдап, жадты оңтайландыру жолдарын тапты және оларды енгізді. Енгізгеннен кейін 300 TiB-тан астам жад босады, жалпы үнемді Google 500 TiB-тан 1 PiB-қа дейін бағалайды.
Үш жағдайда да нәтижені сырттан тексеру жолы бар: тесттер мен эмуляция, декодер шығысын салыстыру, профильдеуіш. Мұндай тапсырмалар ұзақ агенттік жұмысқа лайық: нәтиженің дұрыстығын модельдің мәтініне сүйенбей бағалауға болады.
Киберқорғаныс: табу, растау, түзету
Google дерегінше, Argon бағдарламалардағы аса қауіпті осалдықтарды өзі табады, растайды және түзетулер дайындайды. Сенімді қорғаушылар мен өзінің ішкі командаларына Google модельді киберқауіпсіздік шектеулерінсіз береді.
Анонстағы ең нақты мысал Wiz компаниясынан. Scan for Good бастамасы аясында компания маңызды қоғамдық инфрақұрылымдағы қауіпті осалдықтарды тегін іздейді. Argon көмегімен ол бүкіл әлемдегі ауруханалар қолданатын медициналық бағдарламадан аса қауіпті осалдықты тапты: ол арқылы құпия жеке деректер ашық тұрған. Бұған дейінгі фронтир-модельдер оны байқамаған.
Осалдықтарды түзету қабілетін тексеретін CWE-bench v1 бойынша Google Argon үшін 68% нәтиже келтіреді: осы нәтижемен ол бірінші орынды бөліседі. Google мен Wiz-дің ішкі тесттерінде Argon осалдықтарды табуда Gemini 3.8 Flash Cyber-ден де озады, соның ішінде бастапқы кодқа қолжетімділіксіз жұмыс істеп тұрған веб-жүйелерде.
Бенчмарктер және Vals Index
Google-дың өз нәтижелері:
| Тест | Нені тексереді | Argon |
|---|---|---|
| DeepSWE v1.1 | ұзақ бағдарламалау тапсырмалары | 77,9% |
| AutomationBench | бизнес-процестерді толық орындау | 51,3% |
| LVBench | ұзақ видеоларды түсіну | 91,7% |
Әр жолдағы пайыздарды өзара салыстыруға болмайды: тесттердің тапсырмалары мен бағалау өлшемдері әртүрлі. Google сондай-ақ Vals Finance Agent v2 (көпқадамды қаржылық зерттеу) және Harvey's Legal Agent Benchmark (құқықтық зерттеу және құжат дайындау) бойынша көш бастап тұрғанын айтады, бірақ анонста олар бойынша сандар жоқ.
Тәуелсіз тексеруді Vals Index береді. Ол қаржы, бағдарламалау, құқық және салық тапсырмаларын әр саланың АҚШ ЖІӨ-дегі үлесіне қарай салмақтап біріктіреді. Қаржының салмағы 15,3-тің 8-і, яғни индекстің шамамен 52%-ы, бағдарламалаудікі шамамен 37%. Басқа салаға модель таңдағанда осы салмақты ескерген жөн.
30 қыркүйектегі кестенің басы және салыстыру үшін Gemini 3.8 Flash:
| Модель | Дәлдік |
|---|---|
| Gemini 4 Argon | 68,90% |
| Claude Sonnet 5.5 | 67,04% |
| Claude Opus 5.5 | 66,97% |
| Gemini 3.8 Flash | 54,83% |
Argon бірінші орында, Claude Sonnet 5.5-тен 1,86 пункт алда. Тікелей салыстырғанда ескер: Vals белгісі бойынша Claude нәтижелерінің бір бөлігінде провайдер бас тартқаннан кейін тапсырмаларды резервтік модель орындаған. Gemini 3.8 Flash Argon-нан шамамен 14 пунктке артта. Бұл Vals тапсырмалар жинағындағы нәтижелер, сенің тапсырмаларыңда да осындай айырма болатынына кепілдік емес.
Құжаттармен жұмыс үшін практикалық қорытынды мынадай. Қаржы мен құқықта жоғары балл есептерді және олардың нақты жағдайға жарамдылығын тексеруді алмастырмайды. Тапсырманы әр маңызды қорытынды құжатқа сілтейтіндей, ал деректегі олқылықтар бөлек тізіммен берілетіндей етіп қой: сонда модель жетіспейтін мәліметті шындыққа ұқсайтын мәтінмен қай жерде толтырғаны көрінеді.
Қолжетімділік неге кезең-кезеңімен ашылады
Осалдықты өзі тауып, түзете алатын модель шабуылға да көмектесуі мүмкін. Сондықтан Google Argon-ды кезең-кезеңімен шығарып, қорғаушылардан бастайды. Алғашқы шеңберді Fairwind бағдарламасы құрайды. Оның бетіндегі сипаттамаға сәйкес, бұл іріктелген сенімді ұйымдар мен қорғаушылар: мемлекеттік құрылымдар, денсаулық сақтау, телеком және басқа да өмірлік маңызды инфрақұрылым. Өтінімдер тексеріледі, қолжетімділік шектеулі, ал қатысушылар Argon-ға оның киберқауіпсіздік мүмкіндіктерімен бірге эксклюзивті қолжетімділік алады. Бағдарлама ережелері бұл қолжетімділікті бөлісуге және қайта сатуға тыйым салады, сондықтан оның негізінде үшінші тарап сервистері жұмыс істей алмайды.
Сонымен қатар Google АҚШ үкіметінің модельдерге релизге дейінгі ерікті қолжетімділік процедурасына қатысып, алғашқы тестілеушілердің пікірі бойынша қорғанысты жетілдіріп жатыр. Жұмыс төрт бағытта жүреді: кибершабуылдарға және химиялық, биологиялық, радиологиялық немесе ядролық қаруға көмектесуден бас тарту; промпт-инъекцияларға төзімділік; модельдің ой қорытуы мен әрекеттерін бақылап, ол пайдаланушы ниетінен шығып кетсе, жұмысын тоқтату; тест орталарын оқшаулау. Анонсқа сәйкес, кең нұсқа зиянды сұрауларды орындамай, қос мақсаттағы заңды зерттеулерге мүмкіндік сақтауы керек. Бұл күнделікті қауіпсіздік тапсырмаларына қалай әсер ететіні әзірге белгісіз.
Әзірлеушілерге, компанияларға және қарапайым пайдаланушыларға шығаруды Google ақылы API клиенттері мен Google AI Ultra жазылушыларынан бастайды. Күні аталмаған.
Argon-ның GPTunneL-де қашан пайда болатыны және біздің тарифіміз әлі жарияланған жоқ. Қазір қолжетімді модельдерді Gemini бетінен, олардың құнын біздің бағалар бетінен қара.
Қолжетімділік ашылғанша не істеу керек
Argon тексерілетін нәтижесі бар ұзақ жұмысқа арналған, мұны бенчмарк пайыздарынан гөрі Google мысалдары жақсы көрсетеді. Егер сенде осындай тапсырмалар болса (кодты көшіру, профиль бойынша оңтайландыру, қаржылық модель, осалдықтарды талдау), олардан қабылдау өлшемі бар 10-нан 20-ға дейін тапсырма жина да, қазіргі модельде қазір-ақ жүргізіп көр: қабылданған нәтижелер үлесі, қолмен түзетулер саны және уақыт. Argon саған қолжетімді болғанда, сол жинақ оның сенің тапсырмаларыңдағы сапаны жақсартатынын не жақсартпайтынын көрсетеді. Қазіргі модель тұрақты шешіп жүрген қысқа тапсырмаларды көшірудің қажеті жоқ: олар үшін Gemini 3.8 Flash пен желінің басқа модельдерін немесе мәтіндік модельдер каталогын қара.
