Новинка: Grom Zvuk — наша музыкальная модельПослушать и попробовать

Gemini 4 Argon: что меняет новая модель Google

Gemini 4 Argon: что меняет новая модель Google

Google анонсировала Gemini 4 Argon 30 сентября 2026 года. В официальном анонсе это новая фронтир-модель для сложной разработки, профессиональной работы в праве и финансах и киберзащиты. Общедоступного запуска пока нет: первыми доступ получают отобранные Google участники программы Fairwind и приглашённые тестировщики.

Для продукта в таком релизе важен один вопрос: какие задачи теперь можно отдать модели целиком, от постановки до проверенного результата. Своего теста Argon у нас нет, поэтому разбираю то, что опубликовали Google и независимый рейтинг Vals: примеры реальной работы, бенчмарки и условия доступа. Что было известно о Gemini 4 до анонса, мы разбирали в августе.

Миллион токенов вывода

Google подняла максимальный объём вывода с 64 тысяч до 1 миллиона токенов. Компания объясняет это так: когда у модели есть запас на сотни тысяч токенов в одной траектории, она может дольше рассуждать и решить сложную задачу за один заход.

Максимум токенов вывода
Раньше
64K
Gemini 4 Argon
1M

Это лимит вывода, а не размер входного контекста.

Для короткого письма или перевода такой запас обычно не нужен. Он нужен там, где модель раньше приходилось останавливать и запускать заново: в крупной миграции кода, многошаговом исследовании, разборе уязвимости с проверкой. При этом лимит сам по себе не доказывает качество: модель может дольше развивать и ошибочную гипотезу. Поэтому важнее примеры законченной работы.

Что Argon уже делает внутри Google

Самые показательные примеры в анонсе касаются кода. Это внутренние данные Google без независимой проверки, но они хорошо показывают, под какие задачи сделана модель.

Перенос C/C++ на Rust. Агенты на Argon переводят кодовые базы Google на Rust: от десятков тысяч строк в библиотеках вроде re2 и libgav1 до более чем 800 тысяч строк ядра Zircon в операционной системе Fuchsia. Google отдельно пишет, что такие переписывания проходят автоматический и ручной аудит, тестирование в эмуляции и ревью до выхода в продакшен.

Ускорение libgav1. Для этого видеодекодера уже существовал порт на Rust. Агенты заменили в нём 32 тысячи строк SIMD-кода: гоняли эксперименты с профилированием, изучали, что генерирует компилятор, и писали безопасный Rust, который компилятор векторизует сам. Декодер стал в 2,7 раза быстрее прежнего Rust-порта, видео на выходе идентичное. Сравнение именно с Rust-портом, а не с оптимизированным C++: про C++ Google пишет только, что разрыв с ним сократился.

Память в дата-центрах. Агенты разобрали телеметрию профилирования по всему парку серверов, нашли и применили оптимизации памяти. После выкатки освободилось больше 300 TiB, общую экономию Google оценивает в диапазоне от 500 TiB до 1 PiB.

У всех трёх случаев есть внешний способ проверить результат: тесты и эмуляция, сравнение вывода декодера, профилировщик. Это хорошие кандидаты для длительной агентной работы: правильность результата можно оценить, не полагаясь на текст модели.

Киберзащита: найти, подтвердить, исправить

По данным Google, Argon сам находит критические уязвимости в ПО, подтверждает их и готовит исправления. Доверенным специалистам по защите и своим внутренним командам Google выдаёт модель без кибер-ограничений.

Самый конкретный пример в анонсе принадлежит Wiz. В программе Scan for Good компания бесплатно ищет опасные уязвимости в критической общественной инфраструктуре. С помощью Argon она нашла критическую уязвимость в медицинском ПО, которым пользуются больницы по всему миру: через неё были доступны чувствительные персональные данные. Предыдущие фронтир-модели эту проблему пропустили.

На CWE-bench v1, где проверяют умение исправлять уязвимости, Google приводит для Argon 68%: с этим результатом он делит первое место. По внутренним тестам Google и Wiz он также лучше Gemini 3.8 Flash Cyber находит уязвимости, в том числе в живых веб-системах без доступа к исходному коду.

Бенчмарки и Vals Index

Собственные результаты Google:

ТестЧто проверяетArgon
DeepSWE v1.1длительные задачи разработки77,9%
AutomationBenchбизнес-процессы целиком51,3%
LVBenchпонимание длинных видео91,7%

Проценты в разных строках между собой не сравниваются: у тестов разные задачи и критерии. Google также заявляет лидерство в Vals Finance Agent v2 (многошаговые финансовые исследования) и Harvey's Legal Agent Benchmark (юридические исследования и подготовка документов), но чисел по ним в анонсе нет.

Независимую сверку даёт Vals Index. Он сводит задачи из финансов, разработки, права и налогов с весами по доле отрасли в ВВП США. Финансы весят 8 из 15,3, это около 52% индекса, разработка около 37%. Этот вес стоит учитывать, если выбираешь модель для другой сферы.

Верх таблицы и Gemini 3.8 Flash для сравнения, данные на 30 сентября:

МодельТочность
Gemini 4 Argon68,90%
Claude Sonnet 5.567,04%
Claude Opus 5.566,97%
Gemini 3.8 Flash54,83%

Argon первый, на 1,86 п. впереди Claude Sonnet 5.5. Для прямого сравнения учти, что у части результатов Claude, по пометке Vals, задачи после отказа провайдера выполняла резервная модель. Gemini 3.8 Flash отстаёт от Argon примерно на 14 п. Это результаты конкретного набора задач Vals, а не гарантия такого же разрыва на твоих задачах.

Для работы с документами вывод практический. В финансах и праве высокий балл не заменяет проверку расчётов и применимости к конкретной ситуации. Ставь задачу так, чтобы каждый существенный вывод ссылался на документ, а пробелы в данных шли отдельным списком: так видно, где модель заполнила недостающее правдоподобным текстом.

Почему доступ открывают по частям

Модель, которая сама находит и чинит уязвимости, может помочь и атаке. Поэтому Google выпускает Argon поэтапно и начинает с защитников. Первый круг формирует программа Fairwind. По описанию на её странице, это отобранные доверенные организации и специалисты по защите: государственные структуры, здравоохранение, телеком и другая жизненно важная инфраструктура. Заявки проверяют, доступ ограничен, участники получают эксклюзивный доступ к Argon с его возможностями в кибербезопасности. Правила программы запрещают делиться этим доступом и перепродавать его, поэтому сторонние сервисы на нём строиться не могут.

Параллельно Google участвует в добровольной процедуре предрелизного доступа к моделям для правительства США и дорабатывает защиту по отзывам первых тестировщиков. Работа идёт в четырёх направлениях: отказ помогать с кибератаками и химическим, биологическим, радиологическим или ядерным оружием; устойчивость к промпт-инъекциям; мониторинг рассуждений и действий модели с остановкой, если она выходит за рамки намерений пользователя; изоляция тестовых сред. Массовая версия, по анонсу, должна отказывать во вредных запросах, сохраняя легитимные исследования двойного назначения. Как это скажется на обычных задачах безопасности, пока неизвестно.

Выпуск для разработчиков, компаний и обычных пользователей Google начнёт с платных клиентов API и подписчиков Google AI Ultra. Даты нет.

Сроки появления Argon в GPTunneL и наш тариф пока не объявлены. Доступные сейчас модели смотри на странице Gemini, их стоимость указана в нашем прайсе.

Что делать до открытия доступа

Argon сделан для длинной работы с проверяемым итогом, и примеры Google показывают это лучше, чем проценты в бенчмарках. Если у тебя есть такие задачи (миграция кода, оптимизация по профилю, финансовая модель, разбор уязвимостей), собери из них от 10 до 20 штук с критерием приёмки и прогони сейчас на текущей модели: доля принятых результатов, число ручных исправлений и время. Когда Argon станет тебе доступен, тот же набор покажет, даёт ли он прирост качества на твоих задачах. Короткие задачи, которые уже стабильно решает текущая модель, переносить незачем: для них смотри Gemini 3.8 Flash и другие модели линейки или каталог текстовых моделей.