Как скачать нейросеть на компьютер и запустить локально в 2026 году

Как скачать нейросеть на компьютер и запустить локально в 2026 году

Запрос «скачать нейросеть» в 2026 году означает две вещи. Первая: приложение DeepSeek, ChatGPT или Алисы из магазина, которое само ничего не считает, а ходит в облако. Вторая: локальная модель — файл с весами, который лежит на диске и работает на твоём процессоре или видеокарте без интернета. Эта статья про второе.

Если ты это читаешь, скорее всего, у тебя уже стоит что-то серьёзное: RTX 4070 или 4090, свежая 50-я серия, а может, MacBook Pro на M4 Max с 64 ГБ памяти. Такое железо простаивает: в играх видеокарта работает пару часов в день, а 24 ГБ видеопамяти держат модель уровня Qwen3.8 27B, которая пишет код, разбирает документы и отвечает на русском не хуже облачных сервисов годичной давности; в 16 ГБ влезают gpt-oss 20B и Gemma 4 12B. Даже RTX 3060 на 12 ГБ или Mac на M2 с 16 ГБ — уже рабочая машина для локальной нейросети, просто модель будет меньше.

Ниже: что именно скачивать, сколько памяти требует модель каждого размера, какие открытые модели говорят по-русски, как установить Ollama и LM Studio по шагам и что сломается в первый вечер. В конце — честная граница: где локальная модель выигрывает у облака, а где проигрывает.

Что именно ты скачиваешь

Локальная нейросеть — это два файла:

  1. Раннер — программа, которая загружает модель в память и даёт к ней доступ через чат или API. Почти все домашние раннеры внутри используют движок llama.cpp.
  2. Веса модели в формате GGUF. Один файл на модель, обычно в квантизации Q4_K_M: веса сжаты до 4 бит, файл в 3–4 раза меньше оригинала, потеря качества на типовых задачах — единицы процентов. Ориентир размера: около 0,6 ГБ на каждый миллиард параметров, плюс 1–2 ГБ на контекст.

Раннеры, которые имеет смысл ставить в 2026 году:

ПрограммаДля когоОСРусский интерфейс
Ollama 0.34стандарт по умолчанию: команда в терминале, приложение с чатом и API. MITWindows 10 22H2+, macOS 14+, Linuxнет
LM Studio 0.4всё мышкой: поиск моделей, чат, локальный сервер. Бесплатна и для работыWindows x64/ARM, macOS только Apple Silicon, Linuxда, локализация сообщества
Jan 0.8аналог LM Studio с открытым кодомWindows, macOS, Linuxнет данных
llama.cppминимум зависимостей, свой сервер и веб-интерфейс llama-server. MITвсё, включая сборки CUDA, Vulkan, ROCm, SYCLнет
KoboldCpp 1.120один exe-файл без установки, чат в браузере. AGPLWindows, macOS, Linuxнет

GPT4All в таблицы не попал: последний релиз 3.10 вышел в феврале 2025 года, новые модели он не поддерживает.

Сколько памяти нужно

Модель целиком должна поместиться в память видеокарты (VRAM) или, на Mac с Apple Silicon, в общую память. Если не помещается — раннер сгружает часть слоёв в обычную ОЗУ, и скорость падает в несколько раз. Поэтому выбор модели начинается не с бенчмарков, а с цифры на коробке видеокарты.

Парень в салоне ВАЗ-2107 держит видеокарту и картонную табличку «Поменяю свою 2107 на 5090»

Размер моделиФайл Q4_K_MНужно памятиПодходит
2–4B1,5–3,4 ГБ4–6 ГБлюбая видеокарта на 6–8 ГБ, встроенная графика, процессор
7–9B4,5–6,6 ГБ8 ГБRTX 4060 / 5060, Mac 16 ГБ
12–14B7,6–9 ГБ12 ГБRTX 3060 12 ГБ / 5070, Mac 16–24 ГБ
27–32B17–20 ГБ24 ГБRTX 3090 / 4090 / 5090, Mac 32 ГБ+
30B MoE (3B активных)21–24 ГБ24 ГБ VRAM или 32 ГБ ОЗУсносно идёт на процессоре
70Bоколо 40 ГБ48 ГБдве карты по 24 ГБ, Mac 64 ГБ+
gpt-oss 120B65 ГБ80 ГБMac Studio 96–128 ГБ

Цифры в столбце «нужно памяти» — с контекстом 8–32 тысячи токенов. Контекст в 64–128 тысяч удваивает расход, поэтому «модель влезла, но с длинным документом упала» — самая частая ошибка.

Что по железу:

  • NVIDIA. Работает всё от GTX 750 Ti и новее, драйвер 551.61+. Ориентиры из открытых замеров: RTX 5090 на модели 8B в Q4 — около 140 токенов в секунду, на 32B — 50–60; карта на 16 ГБ на модели 14B — 20–50.
  • Apple Silicon. Единая память считается за VRAM, а Ollama и LM Studio используют движок MLX. По таблице замеров llama.cpp на модели 7B в Q4: M4 — 24 токена в секунду, M4 Max — 83, M5 Max — 120. Intel-Mac: Ollama только на процессоре, LM Studio не запускается вовсе.
  • AMD и Intel Arc. AMD — через ROCm 7 или Vulkan, Intel Arc — через Vulkan в Ollama и SYCL-сборки llama.cpp. Работает, но медленнее NVIDIA того же класса и с оговорками по драйверам.
  • Только процессор. Модель 8B в Q4 на десктопе с DDR5 — примерно 8–15 токенов в секунду, читать в реальном времени можно. Узкое место — пропускная способность памяти, а не ядра. MoE-модели с 3B активных параметров (Qwen3.5 35B-A3B, GLM-4.7-Flash) на процессоре заметно быстрее плотных того же веса.

Если у тебя ноутбук с 8 ГБ ОЗУ без видеокарты — реально работают только модели 2–4B, и разговор с ними быстро упирается в потолок.

Вариант 1: Ollama — три команды

Ollama ставится как обычная программа и добавляет команду ollama в терминал. С 2025 года у неё есть и приложение с окном чата, так что терминал нужен только для установки.

Приложение Ollama на macOS: пустой чат, поле ввода и выбор модели gemma3:27b в правом нижнем углу

Windows — установщик OllamaSetup.exe без прав администратора, либо:

code
winget install Ollama.Ollama

macOS — DMG с сайта или Homebrew:

bash
brew install --cask ollama-app

Linux:

bash
curl -fsSL https://ollama.com/install.sh | sh

Дальше первая модель. Команда скачает 6,6 ГБ и откроет чат в терминале:

bash
ollama run qwen3.5:9b

Чат с моделью gpt-oss в терминале после команды ollama run: блок рассуждений Thinking и ответ модели

Полезные команды на первую неделю:

КомандаЧто делает
ollama pull gemma4:e4bскачать модель без запуска чата
ollama listчто уже скачано и сколько занимает
ollama psчто сейчас загружено в память и куда — GPU или CPU
ollama rm qwen3.5:9bудалить модель с диска
ollama serveподнять API на localhost:11434

Две настройки, которые придётся менять почти сразу:

  • Контекст. По умолчанию Ollama выбирает окно по объёму VRAM: до 24 ГБ — всего 4 тысячи токенов, и длинный документ просто обрежется. Ползунок есть в приложении, для сервера — переменная OLLAMA_CONTEXT_LENGTH=32000. Помни про таблицу выше: длиннее контекст — больше памяти.
  • Где лежат модели. Windows — %HOMEPATH%\.ollama, macOS — ~/.ollama/models, Linux — /usr/share/ollama. Переезд на другой диск — переменная окружения OLLAMA_MODELS, после неё перезапуск.

API совместим с OpenAI: любой клиент, который умеет ходить в api.openai.com, перенастраивается на http://localhost:11434/v1 с любым ключом. Это же делает Ollama бэкендом для Claude Code, opencode и Cline — команда ollama launch подключает их сама.

Вариант 2: LM Studio — для тех, кто не хочет терминал

LM Studio — приложение с тремя экранами: поиск моделей, чат и локальный сервер. С июля 2025 года бесплатна и для рабочего использования, интерфейс переведён на русский силами сообщества.

Требования: 16 ГБ ОЗУ рекомендовано, видеокарта от 4 ГБ на Windows, процессор с AVX2. На Mac — только Apple Silicon, macOS 14+. Есть сборка для Windows на ARM (Snapdragon X).

Порядок:

  1. Скачать установщик с lmstudio.ai или winget install ElementLabs.LMStudio / brew install --cask lm-studio.
  2. Открыть вкладку поиска, ввести qwen3.5 или gemma-4. Программа сама показывает, какая квантизация влезет в твою память, и подсвечивает те, что не влезут.
  3. Скачать, перейти в чат, загрузить модель. Параметры контекста и распределения по GPU — в правой панели.

Окно LM Studio: слева список чатов, сверху выбранная модель Phi-3.1-mini в формате GGUF, внизу строка с расходом памяти и процессора

Отдельно стоит вкладка «Сервер»: LM Studio поднимает OpenAI-совместимый API на localhost:1234, поддерживает MCP-инструменты и headless-режим через CLI lms. В версии 0.4.16 добавили LM Link и приложение Locally для iPhone — модель на домашнем ПК, чат с телефона.

Что выбрать между ними: Ollama — если планируешь подключать модель к другим программам и скриптам, LM Studio — если основной сценарий «открыл и спросил». Обе умеют жить на одном компьютере одновременно.

Какую модель скачать в 2026 году

Открытых моделей стало много, и большинство из них умеют русский без дообучения. Таблица — то, что реально имеет смысл ставить дома, с тегами Ollama:

МодельТег OllamaФайлОсобенности
Qwen3.5 4B / 9B / 27Bqwen3.5:4b / :9b / :27b3,4 / 6,6 / 17 ГБтекст + картинки, 256K контекст, 201 язык. Apache 2.0
Qwen3.5 35B-A3Bqwen3.5:35b24 ГБMoE, быстрая на процессоре. Apache 2.0
Qwen3.8 27Bqwen3.8:27b18 ГБсамая сильная плотная модель для 24 ГБ, картинки и видео. Apache 2.0
Gemma 4 E4B / 12B / 26B / 31Bgemma4:e4b / :12b / :26b / :31b9,6 / 7,6 / 19 / 20 ГБкартинки, у E4B ещё и аудио, 140+ языков. Apache 2.0
gpt-oss 20Bgpt-oss:20b14 ГБрассуждения, 128K, от OpenAI. Apache 2.0
GLM-4.7-Flash 30B-A3Bglm-4.7-flash24 ГБ памятиMoE, 200K, агентные задачи. MIT
Ministral 3 (3B / 8B / 14B)по имени в LM Studio2–9 ГБ256K, картинки, компактная. Apache 2.0
DeepSeek-R1 Distill 8B / 14Bdeepseek-r1:8b / :14b5–9 ГБцепочки рассуждений, дистилляты 2025 года. MIT

Все лицензии из таблицы разрешают коммерческое использование без роялти.

Модели, обученные на русском специально: T-Pro 2.0 от Т-Банка (32B на базе Qwen3, Apache 2.0, GGUF на Hugging Face), YandexGPT 5 Lite 8B (GGUF, 32K контекст) и GigaChat3-10B-A1.8B от Сбера (MIT, есть GGUF). Они дообучены под русский, а в остальном не сильнее исходных моделей: T-Pro — это тот же Qwen3-32B. Разумная схема — Qwen или Gemma как основная модель и одна русская рядом для писем и документов.

Практический выбор по памяти:

  • 8 ГБ VRAM или Mac 16 ГБqwen3.5:9b либо gemma4:e4b.
  • 12–16 ГБgemma4:12b, gpt-oss:20b, deepseek-r1:14b.
  • 24 ГБqwen3.8:27b для общих задач, glm-4.7-flash или qwen3.5:35b для агентов и скорости.
  • Только процессор, 32 ГБ ОЗУqwen3.5:35b: активных параметров 3B, поэтому идёт быстрее, чем 9B плотная.

«Скачать DeepSeek на ПК» — что на самом деле возможно

DeepSeek ищут для скачивания чаще любой другой модели, поэтому про него отдельно. Флагман DeepSeek V4 — это 1,6 триллиона параметров, V4 Flash — 284 миллиарда. Веса V4 Flash открыты под MIT, но файл в квантизации Q4 занимает около 155 ГБ, а для работы нужно порядка 180 ГБ памяти. Домой это не ставится, и в библиотеке Ollama V4 доступен только с тегом :cloud, то есть через облако Ollama.

Локально с именем DeepSeek можно запустить только дистилляты R1 2025 года (deepseek-r1:8b, :14b, :32b). Это Qwen и Llama, дообученные на ответах R1: рассуждать умеют, но до V4 им далеко. Если нужен именно V4 — он есть в GPTunneL: контекст 1 миллион токенов, оплата за токены, без VPN.

Картинки, видео и речь локально

Текст — самая лёгкая модальность. Остальное тоже работает, но видеокарты просит больше:

  • Изображения. Стандарт 2026 года — ComfyUI (есть десктоп-установщик). Модели: FLUX.2 [klein] 4B под Apache 2.0 идёт на 8–12 ГБ VRAM за 4 шага, версия 9B и полный FLUX.2 [dev] 32B — только для некоммерческого использования. Stable Diffusion 3.5 (Medium 2.5B / Large 8B) по-прежнему актуальна, преемника Stability не выпустила. Qwen-Image 20B открыт, но Qwen-Image 2.0 — только в облаке. Для художников есть плагин Krita AI, он поднимает ComfyUI сам.
  • Видео. Открытые веса Wan остановились на версии 2.2 (вариант 5B идёт на 8 ГБ); 2.5 и новее — только через API, локально их нет. LTX-2.5 от Lightricks — 22B с генерацией звука, есть квантизации под 12–16 ГБ. Считай минуты на ролик, а не секунды.
  • Речь. Распознавание — whisper.cpp, русский держит хорошо. Озвучка — Piper с русскими голосами; Kokoro и Fish Audio S2 открыты, но русского в официальных голосах нет.

Что сломается в первый вечер

  • Модель загрузилась, но отвечает по слову в секунду. Не влезла в VRAM, часть слоёв уехала в ОЗУ. Смотри ollama ps: в столбце процессора должно быть 100% GPU. Лечится квантизацией ниже или моделью меньше.
  • Длинный документ обрезался. Дефолтный контекст 4K у Ollama на картах до 24 ГБ. Подними OLLAMA_CONTEXT_LENGTH, и заново проверь, что модель ещё влезает.
  • SmartScreen и Defender. Установщик Ollama иногда останавливается предупреждением SmartScreen: «Подробнее → Выполнить в любом случае». Windows Defender регулярно помечает DLL llama.cpp и архивы KoboldCpp как троян — это ложные срабатывания, задокументированные в issue llama.cpp. Качай только с официальных сайтов и GitHub-релизов, тогда исключение в антивирусе безопасно.
  • Hugging Face не качает. Из России загрузка больших файлов с Hugging Face нестабильна: часть запросов проходит, часть срывается. Библиотека Ollama и загрузчик LM Studio работают без VPN; для весов с Hugging Face есть зеркало ModelScope, где лежат все Qwen.
  • Кончился диск. Три модели по 20 ГБ и кеш — уже 70 ГБ. Переменная OLLAMA_MODELS переносит библиотеку на другой диск.
  • Intel-Mac. Ollama — только процессор, LM Studio не ставится. Реальный вариант — модели до 4B.

Где локальная модель заканчивается

Стеклянный ноутбук с одной маленькой светящейся моделью внутри соединён тонкой нитью с большим облаком, в котором десятки моделей разного размера

Локальная модель выигрывает, когда важны три вещи: данные не покидают компьютер, интернет не нужен, а лимитов и счёта за токены нет вообще. Для чата с документами, черновиков писем, автодополнения кода и экспериментов с API на карте 24 ГБ этого достаточно.

Проигрывает она там, где нужен уровень флагмана. Самое сильное, что влезает в домашнюю видеокарту, — 27–32B; модели 400B–2T (Qwen3.8 Max, DeepSeek V4, Claude Opus 5, GPT-5.5) локально не существуют ни в каком квантовании. И при редком использовании облако дешевле: за токены платишь копейки, а видеокарта на 24 ГБ окупается годами. Те же открытые модели в GPTunneL, цена за миллион токенов:

МодельВходВыход
gpt-oss 20B10 ₽40 ₽
Gemma 4 31B25 ₽75 ₽
Qwen 3.8 Flash30 ₽95 ₽
DeepSeek V4 Flash75 ₽225 ₽
Qwen 3.8 Max400 ₽1 200 ₽
GPT-5.5500 ₽3 000 ₽

Цены ориентировочные, актуальные — на странице цен и в личном кабинете. При обычной работе через чат миллиона токенов хватает на недели.

Рабочая схема, к которой приходят почти все: локальная Qwen или Gemma для рутины и приватного, а сложные задачи — в облако с флагманом. Обе половины совместимы по API, так что один и тот же скрипт переключается между localhost:11434 и GPTunneL заменой адреса и ключа.

Частые вопросы

Локальная нейросеть работает без интернета? Да. Интернет нужен один раз — скачать раннер и веса. Дальше всё считается на твоём железе, можно отключить сеть.

Это бесплатно? Раннеры и веса из таблиц выше — бесплатны и для личного, и для коммерческого использования (лицензии Apache 2.0 и MIT). Платишь только за железо и электричество.

Какая модель лучше всего говорит по-русски? Из универсальных — Qwen3.5 и Qwen3.8, Gemma 4. Из специализированных — T-Pro 2.0 и YandexGPT 5 Lite. Модели до 4B на русском заметно беднее, чем на английском.

Можно ли поставить нейросеть на телефон? На Android и iPhone есть приложения с моделями 1–4B, качество ниже, чем на ПК, батарею ест быстро. Практичнее держать модель на домашнем компьютере и подключаться с телефона: у LM Studio для этого есть LM Link и приложение Locally.

Как полностью удалить Ollama? Сначала модели: ollama rm по списку из ollama list. Потом программу: на Windows — через «Приложения», на macOS — удалить Ollama.app, /usr/local/bin/ollama и папку ~/.ollama, на Linux — по инструкции в документации.

Есть ли локальный ChatGPT или Claude? Нет. OpenAI открыла только gpt-oss (20B и 120B), Anthropic закрытых весов не публикует. Всё, что называется «ChatGPT скачать на ПК», — либо клиент к облаку, либо чужая модель под чужим именем.

Скачай Ollama, поставь qwen3.5:9b и посмотри, хватает ли тебе такой модели. Когда упрёшься в потолок — те же открытые модели и флагманы OpenAI, Anthropic и Google собраны в GPTunneL: один баланс, оплата в рублях за токены, без VPN и подписок.