Google анонсировала Gemini 4 Argon 30 сентября 2026 года. В официальном анонсе это новая фронтир-модель для сложной разработки, профессиональной работы в праве и финансах и киберзащиты. Общедоступного запуска пока нет: первыми доступ получают отобранные Google участники программы Fairwind и приглашённые тестировщики.
Для продукта в таком релизе важен один вопрос: какие задачи теперь можно отдать модели целиком, от постановки до проверенного результата. Своего теста Argon у нас нет, поэтому разбираю то, что опубликовали Google и независимый рейтинг Vals: примеры реальной работы, бенчмарки и условия доступа. Что было известно о Gemini 4 до анонса, мы разбирали в августе.
Миллион токенов вывода
Google подняла максимальный объём вывода с 64 тысяч до 1 миллиона токенов. Компания объясняет это так: когда у модели есть запас на сотни тысяч токенов в одной траектории, она может дольше рассуждать и решить сложную задачу за один заход.
- Раньше
- 64K
- Gemini 4 Argon
- 1M
Это лимит вывода, а не размер входного контекста.
Для короткого письма или перевода такой запас обычно не нужен. Он нужен там, где модель раньше приходилось останавливать и запускать заново: в крупной миграции кода, многошаговом исследовании, разборе уязвимости с проверкой. При этом лимит сам по себе не доказывает качество: модель может дольше развивать и ошибочную гипотезу. Поэтому важнее примеры законченной работы.
Что Argon уже делает внутри Google
Самые показательные примеры в анонсе касаются кода. Это внутренние данные Google без независимой проверки, но они хорошо показывают, под какие задачи сделана модель.
Перенос C/C++ на Rust. Агенты на Argon переводят кодовые базы Google на Rust: от десятков тысяч строк в библиотеках вроде re2 и libgav1 до более чем 800 тысяч строк ядра Zircon в операционной системе Fuchsia. Google отдельно пишет, что такие переписывания проходят автоматический и ручной аудит, тестирование в эмуляции и ревью до выхода в продакшен.
Ускорение libgav1. Для этого видеодекодера уже существовал порт на Rust. Агенты заменили в нём 32 тысячи строк SIMD-кода: гоняли эксперименты с профилированием, изучали, что генерирует компилятор, и писали безопасный Rust, который компилятор векторизует сам. Декодер стал в 2,7 раза быстрее прежнего Rust-порта, видео на выходе идентичное. Сравнение именно с Rust-портом, а не с оптимизированным C++: про C++ Google пишет только, что разрыв с ним сократился.
Память в дата-центрах. Агенты разобрали телеметрию профилирования по всему парку серверов, нашли и применили оптимизации памяти. После выкатки освободилось больше 300 TiB, общую экономию Google оценивает в диапазоне от 500 TiB до 1 PiB.
У всех трёх случаев есть внешний способ проверить результат: тесты и эмуляция, сравнение вывода декодера, профилировщик. Это хорошие кандидаты для длительной агентной работы: правильность результата можно оценить, не полагаясь на текст модели.
Киберзащита: найти, подтвердить, исправить
По данным Google, Argon сам находит критические уязвимости в ПО, подтверждает их и готовит исправления. Доверенным специалистам по защите и своим внутренним командам Google выдаёт модель без кибер-ограничений.
Самый конкретный пример в анонсе принадлежит Wiz. В программе Scan for Good компания бесплатно ищет опасные уязвимости в критической общественной инфраструктуре. С помощью Argon она нашла критическую уязвимость в медицинском ПО, которым пользуются больницы по всему миру: через неё были доступны чувствительные персональные данные. Предыдущие фронтир-модели эту проблему пропустили.
На CWE-bench v1, где проверяют умение исправлять уязвимости, Google приводит для Argon 68%: с этим результатом он делит первое место. По внутренним тестам Google и Wiz он также лучше Gemini 3.8 Flash Cyber находит уязвимости, в том числе в живых веб-системах без доступа к исходному коду.
Бенчмарки и Vals Index
Собственные результаты Google:
| Тест | Что проверяет | Argon |
|---|---|---|
| DeepSWE v1.1 | длительные задачи разработки | 77,9% |
| AutomationBench | бизнес-процессы целиком | 51,3% |
| LVBench | понимание длинных видео | 91,7% |
Проценты в разных строках между собой не сравниваются: у тестов разные задачи и критерии. Google также заявляет лидерство в Vals Finance Agent v2 (многошаговые финансовые исследования) и Harvey's Legal Agent Benchmark (юридические исследования и подготовка документов), но чисел по ним в анонсе нет.
Независимую сверку даёт Vals Index. Он сводит задачи из финансов, разработки, права и налогов с весами по доле отрасли в ВВП США. Финансы весят 8 из 15,3, это около 52% индекса, разработка около 37%. Этот вес стоит учитывать, если выбираешь модель для другой сферы.
Верх таблицы и Gemini 3.8 Flash для сравнения, данные на 30 сентября:
| Модель | Точность |
|---|---|
| Gemini 4 Argon | 68,90% |
| Claude Sonnet 5.5 | 67,04% |
| Claude Opus 5.5 | 66,97% |
| Gemini 3.8 Flash | 54,83% |
Argon первый, на 1,86 п. впереди Claude Sonnet 5.5. Для прямого сравнения учти, что у части результатов Claude, по пометке Vals, задачи после отказа провайдера выполняла резервная модель. Gemini 3.8 Flash отстаёт от Argon примерно на 14 п. Это результаты конкретного набора задач Vals, а не гарантия такого же разрыва на твоих задачах.
Для работы с документами вывод практический. В финансах и праве высокий балл не заменяет проверку расчётов и применимости к конкретной ситуации. Ставь задачу так, чтобы каждый существенный вывод ссылался на документ, а пробелы в данных шли отдельным списком: так видно, где модель заполнила недостающее правдоподобным текстом.
Почему доступ открывают по частям
Модель, которая сама находит и чинит уязвимости, может помочь и атаке. Поэтому Google выпускает Argon поэтапно и начинает с защитников. Первый круг формирует программа Fairwind. По описанию на её странице, это отобранные доверенные организации и специалисты по защите: государственные структуры, здравоохранение, телеком и другая жизненно важная инфраструктура. Заявки проверяют, доступ ограничен, участники получают эксклюзивный доступ к Argon с его возможностями в кибербезопасности. Правила программы запрещают делиться этим доступом и перепродавать его, поэтому сторонние сервисы на нём строиться не могут.
Параллельно Google участвует в добровольной процедуре предрелизного доступа к моделям для правительства США и дорабатывает защиту по отзывам первых тестировщиков. Работа идёт в четырёх направлениях: отказ помогать с кибератаками и химическим, биологическим, радиологическим или ядерным оружием; устойчивость к промпт-инъекциям; мониторинг рассуждений и действий модели с остановкой, если она выходит за рамки намерений пользователя; изоляция тестовых сред. Массовая версия, по анонсу, должна отказывать во вредных запросах, сохраняя легитимные исследования двойного назначения. Как это скажется на обычных задачах безопасности, пока неизвестно.
Выпуск для разработчиков, компаний и обычных пользователей Google начнёт с платных клиентов API и подписчиков Google AI Ultra. Даты нет.
Сроки появления Argon в GPTunneL и наш тариф пока не объявлены. Доступные сейчас модели смотри на странице Gemini, их стоимость указана в нашем прайсе.
Что делать до открытия доступа
Argon сделан для длинной работы с проверяемым итогом, и примеры Google показывают это лучше, чем проценты в бенчмарках. Если у тебя есть такие задачи (миграция кода, оптимизация по профилю, финансовая модель, разбор уязвимостей), собери из них от 10 до 20 штук с критерием приёмки и прогони сейчас на текущей модели: доля принятых результатов, число ручных исправлений и время. Когда Argon станет тебе доступен, тот же набор покажет, даёт ли он прирост качества на твоих задачах. Короткие задачи, которые уже стабильно решает текущая модель, переносить незачем: для них смотри Gemini 3.8 Flash и другие модели линейки или каталог текстовых моделей.
