Запрос «скачать нейросеть» в 2026 году означает две вещи. Первая: приложение DeepSeek, ChatGPT или Алисы из магазина, которое само ничего не считает, а ходит в облако. Вторая: локальная модель — файл с весами, который лежит на диске и работает на твоём процессоре или видеокарте без интернета. Эта статья про второе.
Если ты это читаешь, скорее всего, у тебя уже стоит что-то серьёзное: RTX 4070 или 4090, свежая 50-я серия, а может, MacBook Pro на M4 Max с 64 ГБ памяти. Такое железо простаивает: в играх видеокарта работает пару часов в день, а 24 ГБ видеопамяти держат модель уровня Qwen3.8 27B, которая пишет код, разбирает документы и отвечает на русском не хуже облачных сервисов годичной давности; в 16 ГБ влезают gpt-oss 20B и Gemma 4 12B. Даже RTX 3060 на 12 ГБ или Mac на M2 с 16 ГБ — уже рабочая машина для локальной нейросети, просто модель будет меньше.
Ниже: что именно скачивать, сколько памяти требует модель каждого размера, какие открытые модели говорят по-русски, как установить Ollama и LM Studio по шагам и что сломается в первый вечер. В конце — честная граница: где локальная модель выигрывает у облака, а где проигрывает.
Что именно ты скачиваешь
Локальная нейросеть — это два файла:
- Раннер — программа, которая загружает модель в память и даёт к ней доступ через чат или API. Почти все домашние раннеры внутри используют движок llama.cpp.
- Веса модели в формате GGUF. Один файл на модель, обычно в квантизации
Q4_K_M: веса сжаты до 4 бит, файл в 3–4 раза меньше оригинала, потеря качества на типовых задачах — единицы процентов. Ориентир размера: около 0,6 ГБ на каждый миллиард параметров, плюс 1–2 ГБ на контекст.
Раннеры, которые имеет смысл ставить в 2026 году:
| Программа | Для кого | ОС | Русский интерфейс |
|---|---|---|---|
| Ollama 0.34 | стандарт по умолчанию: команда в терминале, приложение с чатом и API. MIT | Windows 10 22H2+, macOS 14+, Linux | нет |
| LM Studio 0.4 | всё мышкой: поиск моделей, чат, локальный сервер. Бесплатна и для работы | Windows x64/ARM, macOS только Apple Silicon, Linux | да, локализация сообщества |
| Jan 0.8 | аналог LM Studio с открытым кодом | Windows, macOS, Linux | нет данных |
| llama.cpp | минимум зависимостей, свой сервер и веб-интерфейс llama-server. MIT | всё, включая сборки CUDA, Vulkan, ROCm, SYCL | нет |
| KoboldCpp 1.120 | один exe-файл без установки, чат в браузере. AGPL | Windows, macOS, Linux | нет |
GPT4All в таблицы не попал: последний релиз 3.10 вышел в феврале 2025 года, новые модели он не поддерживает.
Сколько памяти нужно
Модель целиком должна поместиться в память видеокарты (VRAM) или, на Mac с Apple Silicon, в общую память. Если не помещается — раннер сгружает часть слоёв в обычную ОЗУ, и скорость падает в несколько раз. Поэтому выбор модели начинается не с бенчмарков, а с цифры на коробке видеокарты.

| Размер модели | Файл Q4_K_M | Нужно памяти | Подходит |
|---|---|---|---|
| 2–4B | 1,5–3,4 ГБ | 4–6 ГБ | любая видеокарта на 6–8 ГБ, встроенная графика, процессор |
| 7–9B | 4,5–6,6 ГБ | 8 ГБ | RTX 4060 / 5060, Mac 16 ГБ |
| 12–14B | 7,6–9 ГБ | 12 ГБ | RTX 3060 12 ГБ / 5070, Mac 16–24 ГБ |
| 27–32B | 17–20 ГБ | 24 ГБ | RTX 3090 / 4090 / 5090, Mac 32 ГБ+ |
| 30B MoE (3B активных) | 21–24 ГБ | 24 ГБ VRAM или 32 ГБ ОЗУ | сносно идёт на процессоре |
| 70B | около 40 ГБ | 48 ГБ | две карты по 24 ГБ, Mac 64 ГБ+ |
| gpt-oss 120B | 65 ГБ | 80 ГБ | Mac Studio 96–128 ГБ |
Цифры в столбце «нужно памяти» — с контекстом 8–32 тысячи токенов. Контекст в 64–128 тысяч удваивает расход, поэтому «модель влезла, но с длинным документом упала» — самая частая ошибка.
Что по железу:
- NVIDIA. Работает всё от GTX 750 Ti и новее, драйвер 551.61+. Ориентиры из открытых замеров: RTX 5090 на модели 8B в Q4 — около 140 токенов в секунду, на 32B — 50–60; карта на 16 ГБ на модели 14B — 20–50.
- Apple Silicon. Единая память считается за VRAM, а Ollama и LM Studio используют движок MLX. По таблице замеров llama.cpp на модели 7B в Q4: M4 — 24 токена в секунду, M4 Max — 83, M5 Max — 120. Intel-Mac: Ollama только на процессоре, LM Studio не запускается вовсе.
- AMD и Intel Arc. AMD — через ROCm 7 или Vulkan, Intel Arc — через Vulkan в Ollama и SYCL-сборки llama.cpp. Работает, но медленнее NVIDIA того же класса и с оговорками по драйверам.
- Только процессор. Модель 8B в Q4 на десктопе с DDR5 — примерно 8–15 токенов в секунду, читать в реальном времени можно. Узкое место — пропускная способность памяти, а не ядра. MoE-модели с 3B активных параметров (Qwen3.5 35B-A3B, GLM-4.7-Flash) на процессоре заметно быстрее плотных того же веса.
Если у тебя ноутбук с 8 ГБ ОЗУ без видеокарты — реально работают только модели 2–4B, и разговор с ними быстро упирается в потолок.
Вариант 1: Ollama — три команды
Ollama ставится как обычная программа и добавляет команду ollama в терминал. С 2025 года у неё есть и приложение с окном чата, так что терминал нужен только для установки.

Windows — установщик OllamaSetup.exe без прав администратора, либо:
winget install Ollama.OllamamacOS — DMG с сайта или Homebrew:
brew install --cask ollama-appLinux:
curl -fsSL https://ollama.com/install.sh | shДальше первая модель. Команда скачает 6,6 ГБ и откроет чат в терминале:
ollama run qwen3.5:9b
Полезные команды на первую неделю:
| Команда | Что делает |
|---|---|
ollama pull gemma4:e4b | скачать модель без запуска чата |
ollama list | что уже скачано и сколько занимает |
ollama ps | что сейчас загружено в память и куда — GPU или CPU |
ollama rm qwen3.5:9b | удалить модель с диска |
ollama serve | поднять API на localhost:11434 |
Две настройки, которые придётся менять почти сразу:
- Контекст. По умолчанию Ollama выбирает окно по объёму VRAM: до 24 ГБ — всего 4 тысячи токенов, и длинный документ просто обрежется. Ползунок есть в приложении, для сервера — переменная
OLLAMA_CONTEXT_LENGTH=32000. Помни про таблицу выше: длиннее контекст — больше памяти. - Где лежат модели. Windows —
%HOMEPATH%\.ollama, macOS —~/.ollama/models, Linux —/usr/share/ollama. Переезд на другой диск — переменная окруженияOLLAMA_MODELS, после неё перезапуск.
API совместим с OpenAI: любой клиент, который умеет ходить в api.openai.com, перенастраивается на http://localhost:11434/v1 с любым ключом. Это же делает Ollama бэкендом для Claude Code, opencode и Cline — команда ollama launch подключает их сама.
Вариант 2: LM Studio — для тех, кто не хочет терминал
LM Studio — приложение с тремя экранами: поиск моделей, чат и локальный сервер. С июля 2025 года бесплатна и для рабочего использования, интерфейс переведён на русский силами сообщества.
Требования: 16 ГБ ОЗУ рекомендовано, видеокарта от 4 ГБ на Windows, процессор с AVX2. На Mac — только Apple Silicon, macOS 14+. Есть сборка для Windows на ARM (Snapdragon X).
Порядок:
- Скачать установщик с lmstudio.ai или
winget install ElementLabs.LMStudio/brew install --cask lm-studio. - Открыть вкладку поиска, ввести
qwen3.5илиgemma-4. Программа сама показывает, какая квантизация влезет в твою память, и подсвечивает те, что не влезут. - Скачать, перейти в чат, загрузить модель. Параметры контекста и распределения по GPU — в правой панели.

Отдельно стоит вкладка «Сервер»: LM Studio поднимает OpenAI-совместимый API на localhost:1234, поддерживает MCP-инструменты и headless-режим через CLI lms. В версии 0.4.16 добавили LM Link и приложение Locally для iPhone — модель на домашнем ПК, чат с телефона.
Что выбрать между ними: Ollama — если планируешь подключать модель к другим программам и скриптам, LM Studio — если основной сценарий «открыл и спросил». Обе умеют жить на одном компьютере одновременно.
Какую модель скачать в 2026 году
Открытых моделей стало много, и большинство из них умеют русский без дообучения. Таблица — то, что реально имеет смысл ставить дома, с тегами Ollama:
| Модель | Тег Ollama | Файл | Особенности |
|---|---|---|---|
| Qwen3.5 4B / 9B / 27B | qwen3.5:4b / :9b / :27b | 3,4 / 6,6 / 17 ГБ | текст + картинки, 256K контекст, 201 язык. Apache 2.0 |
| Qwen3.5 35B-A3B | qwen3.5:35b | 24 ГБ | MoE, быстрая на процессоре. Apache 2.0 |
| Qwen3.8 27B | qwen3.8:27b | 18 ГБ | самая сильная плотная модель для 24 ГБ, картинки и видео. Apache 2.0 |
| Gemma 4 E4B / 12B / 26B / 31B | gemma4:e4b / :12b / :26b / :31b | 9,6 / 7,6 / 19 / 20 ГБ | картинки, у E4B ещё и аудио, 140+ языков. Apache 2.0 |
| gpt-oss 20B | gpt-oss:20b | 14 ГБ | рассуждения, 128K, от OpenAI. Apache 2.0 |
| GLM-4.7-Flash 30B-A3B | glm-4.7-flash | 24 ГБ памяти | MoE, 200K, агентные задачи. MIT |
| Ministral 3 (3B / 8B / 14B) | по имени в LM Studio | 2–9 ГБ | 256K, картинки, компактная. Apache 2.0 |
| DeepSeek-R1 Distill 8B / 14B | deepseek-r1:8b / :14b | 5–9 ГБ | цепочки рассуждений, дистилляты 2025 года. MIT |
Все лицензии из таблицы разрешают коммерческое использование без роялти.
Модели, обученные на русском специально: T-Pro 2.0 от Т-Банка (32B на базе Qwen3, Apache 2.0, GGUF на Hugging Face), YandexGPT 5 Lite 8B (GGUF, 32K контекст) и GigaChat3-10B-A1.8B от Сбера (MIT, есть GGUF). Они дообучены под русский, а в остальном не сильнее исходных моделей: T-Pro — это тот же Qwen3-32B. Разумная схема — Qwen или Gemma как основная модель и одна русская рядом для писем и документов.
Практический выбор по памяти:
- 8 ГБ VRAM или Mac 16 ГБ —
qwen3.5:9bлибоgemma4:e4b. - 12–16 ГБ —
gemma4:12b,gpt-oss:20b,deepseek-r1:14b. - 24 ГБ —
qwen3.8:27bдля общих задач,glm-4.7-flashилиqwen3.5:35bдля агентов и скорости. - Только процессор, 32 ГБ ОЗУ —
qwen3.5:35b: активных параметров 3B, поэтому идёт быстрее, чем 9B плотная.
«Скачать DeepSeek на ПК» — что на самом деле возможно
DeepSeek ищут для скачивания чаще любой другой модели, поэтому про него отдельно. Флагман DeepSeek V4 — это 1,6 триллиона параметров, V4 Flash — 284 миллиарда. Веса V4 Flash открыты под MIT, но файл в квантизации Q4 занимает около 155 ГБ, а для работы нужно порядка 180 ГБ памяти. Домой это не ставится, и в библиотеке Ollama V4 доступен только с тегом :cloud, то есть через облако Ollama.
Локально с именем DeepSeek можно запустить только дистилляты R1 2025 года (deepseek-r1:8b, :14b, :32b). Это Qwen и Llama, дообученные на ответах R1: рассуждать умеют, но до V4 им далеко. Если нужен именно V4 — он есть в GPTunneL: контекст 1 миллион токенов, оплата за токены, без VPN.
Картинки, видео и речь локально
Текст — самая лёгкая модальность. Остальное тоже работает, но видеокарты просит больше:
- Изображения. Стандарт 2026 года — ComfyUI (есть десктоп-установщик). Модели: FLUX.2 [klein] 4B под Apache 2.0 идёт на 8–12 ГБ VRAM за 4 шага, версия 9B и полный FLUX.2 [dev] 32B — только для некоммерческого использования. Stable Diffusion 3.5 (Medium 2.5B / Large 8B) по-прежнему актуальна, преемника Stability не выпустила. Qwen-Image 20B открыт, но Qwen-Image 2.0 — только в облаке. Для художников есть плагин Krita AI, он поднимает ComfyUI сам.
- Видео. Открытые веса Wan остановились на версии 2.2 (вариант 5B идёт на 8 ГБ); 2.5 и новее — только через API, локально их нет. LTX-2.5 от Lightricks — 22B с генерацией звука, есть квантизации под 12–16 ГБ. Считай минуты на ролик, а не секунды.
- Речь. Распознавание — whisper.cpp, русский держит хорошо. Озвучка — Piper с русскими голосами; Kokoro и Fish Audio S2 открыты, но русского в официальных голосах нет.
Что сломается в первый вечер
- Модель загрузилась, но отвечает по слову в секунду. Не влезла в VRAM, часть слоёв уехала в ОЗУ. Смотри
ollama ps: в столбце процессора должно быть 100% GPU. Лечится квантизацией ниже или моделью меньше. - Длинный документ обрезался. Дефолтный контекст 4K у Ollama на картах до 24 ГБ. Подними
OLLAMA_CONTEXT_LENGTH, и заново проверь, что модель ещё влезает. - SmartScreen и Defender. Установщик Ollama иногда останавливается предупреждением SmartScreen: «Подробнее → Выполнить в любом случае». Windows Defender регулярно помечает DLL llama.cpp и архивы KoboldCpp как троян — это ложные срабатывания, задокументированные в issue llama.cpp. Качай только с официальных сайтов и GitHub-релизов, тогда исключение в антивирусе безопасно.
- Hugging Face не качает. Из России загрузка больших файлов с Hugging Face нестабильна: часть запросов проходит, часть срывается. Библиотека Ollama и загрузчик LM Studio работают без VPN; для весов с Hugging Face есть зеркало ModelScope, где лежат все Qwen.
- Кончился диск. Три модели по 20 ГБ и кеш — уже 70 ГБ. Переменная
OLLAMA_MODELSпереносит библиотеку на другой диск. - Intel-Mac. Ollama — только процессор, LM Studio не ставится. Реальный вариант — модели до 4B.
Где локальная модель заканчивается

Локальная модель выигрывает, когда важны три вещи: данные не покидают компьютер, интернет не нужен, а лимитов и счёта за токены нет вообще. Для чата с документами, черновиков писем, автодополнения кода и экспериментов с API на карте 24 ГБ этого достаточно.
Проигрывает она там, где нужен уровень флагмана. Самое сильное, что влезает в домашнюю видеокарту, — 27–32B; модели 400B–2T (Qwen3.8 Max, DeepSeek V4, Claude Opus 5, GPT-5.5) локально не существуют ни в каком квантовании. И при редком использовании облако дешевле: за токены платишь копейки, а видеокарта на 24 ГБ окупается годами. Те же открытые модели в GPTunneL, цена за миллион токенов:
| Модель | Вход | Выход |
|---|---|---|
| gpt-oss 20B | 10 ₽ | 40 ₽ |
| Gemma 4 31B | 25 ₽ | 75 ₽ |
| Qwen 3.8 Flash | 30 ₽ | 95 ₽ |
| DeepSeek V4 Flash | 75 ₽ | 225 ₽ |
| Qwen 3.8 Max | 400 ₽ | 1 200 ₽ |
| GPT-5.5 | 500 ₽ | 3 000 ₽ |
Цены ориентировочные, актуальные — на странице цен и в личном кабинете. При обычной работе через чат миллиона токенов хватает на недели.
Рабочая схема, к которой приходят почти все: локальная Qwen или Gemma для рутины и приватного, а сложные задачи — в облако с флагманом. Обе половины совместимы по API, так что один и тот же скрипт переключается между localhost:11434 и GPTunneL заменой адреса и ключа.
Частые вопросы
Локальная нейросеть работает без интернета? Да. Интернет нужен один раз — скачать раннер и веса. Дальше всё считается на твоём железе, можно отключить сеть.
Это бесплатно? Раннеры и веса из таблиц выше — бесплатны и для личного, и для коммерческого использования (лицензии Apache 2.0 и MIT). Платишь только за железо и электричество.
Какая модель лучше всего говорит по-русски? Из универсальных — Qwen3.5 и Qwen3.8, Gemma 4. Из специализированных — T-Pro 2.0 и YandexGPT 5 Lite. Модели до 4B на русском заметно беднее, чем на английском.
Можно ли поставить нейросеть на телефон? На Android и iPhone есть приложения с моделями 1–4B, качество ниже, чем на ПК, батарею ест быстро. Практичнее держать модель на домашнем компьютере и подключаться с телефона: у LM Studio для этого есть LM Link и приложение Locally.
Как полностью удалить Ollama? Сначала модели: ollama rm по списку из ollama list. Потом программу: на Windows — через «Приложения», на macOS — удалить Ollama.app, /usr/local/bin/ollama и папку ~/.ollama, на Linux — по инструкции в документации.
Есть ли локальный ChatGPT или Claude? Нет. OpenAI открыла только gpt-oss (20B и 120B), Anthropic закрытых весов не публикует. Всё, что называется «ChatGPT скачать на ПК», — либо клиент к облаку, либо чужая модель под чужим именем.
Скачай Ollama, поставь qwen3.5:9b и посмотри, хватает ли тебе такой модели. Когда упрёшься в потолок — те же открытые модели и флагманы OpenAI, Anthropic и Google собраны в GPTunneL: один баланс, оплата в рублях за токены, без VPN и подписок.



