2026 жылы нейрожеліні компьютерге қалай жүктеп, локалды іске қосуға болады

2026 жылы нейрожеліні компьютерге қалай жүктеп, локалды іске қосуға болады

2026 жылы «нейрожеліні жүктеу» сұранысы екі нәрсені білдіреді. Біріншісі: дүкеннен алынған DeepSeek немесе ChatGPT қолданбасы — ол өзі ештеңе есептемейді, бұлтқа барады. Екіншісі: локалды модель — дискіде жатқан салмақ файлы, ол интернетсіз сенің процессорыңда немесе бейнекартаңда жұмыс істейді. Бұл мақала екіншісі туралы.

Мұны оқып отырсаң, сенде байыпты бір нәрсе тұрған шығар: RTX 4070 немесе 4090, жаңа 50-серия, әлде 64 ГБ жады бар M4 Max MacBook Pro. Мұндай темір бос тұрады: ойындарда бейнекарта күніне екі-үш сағат жұмыс істейді, ал 24 ГБ бейнежад Qwen3.8 27B деңгейіндегі модельді ұстайды — ол код жазады, құжаттарды талдайды және көп тілде жауап береді, бір жыл бұрынғы бұлт сервистерінен кем емес; 16 ГБ-қа gpt-oss 20B мен Gemma 4 12B сыяды. Тіпті 12 ГБ RTX 3060 немесе 16 ГБ M2 Mac — локалды нейрожелі үшін жұмыс машинасы, тек модель кішірек болады.

Төменде: нақты нені жүктеу керек, әр өлшемдегі модель қанша жад талап етеді, қай ашық модельдер көп тілді біледі, Ollama мен LM Studio-ны қадам-қадаммен қалай орнату керек және бірінші кеште не бұзылады. Соңында — шынайы шекара: локалды модель бұлттан қай жерде ұтады, қай жерде ұтылады.

Нақты нені жүктейсің

Локалды нейрожелі — бұл екі файл:

  1. Раннер — модельді жадқа жүктеп, оған чат немесе API арқылы қолжетімділік беретін бағдарлама. Үй раннерлерінің дерлік бәрі ішінде llama.cpp қозғалтқышын қолданады.
  2. Модель салмақтары GGUF форматында. Бір модельге бір файл, әдетте Q4_K_M кванттауында: салмақтар 4 битке дейін сығылған, файл түпнұсқадан 3–4 есе кіші, типтік тапсырмалардағы сапа шығыны — бірнеше пайыз. Өлшем бағдары: әр миллиард параметрге шамамен 0,6 ГБ, оған қоса контекстке 1–2 ГБ.

2026 жылы орнатуға тұрарлық раннерлер:

БағдарламаКімгеОЖИнтерфейс тілдері
Ollama 0.34әдепкі стандарт: терминалдағы команда, чаты мен API-і бар қолданба. MITWindows 10 22H2+, macOS 14+, Linuxтек ағылшын
LM Studio 0.4бәрі тінтуірмен: модель іздеу, чат, локалды сервер. Жұмыс үшін де тегінWindows x64/ARM, macOS тек Apple Silicon, Linuxқауымдастық аудармалары бар
Jan 0.8ашық кодты LM Studio баламасыWindows, macOS, Linuxдерек жоқ
llama.cppтәуелділіктер минимум, өз сервері мен llama-server веб-интерфейсі. MITбәрі, CUDA, Vulkan, ROCm, SYCL жинақтарын қосатек ағылшын
KoboldCpp 1.120орнатусыз бір exe-файл, браузердегі чат. AGPLWindows, macOS, Linuxтек ағылшын

GPT4All кестеге кірмеді: соңғы 3.10 релизі 2025 жылдың ақпанында шықты, жаңа модельдерді ол қолдамайды.

Қанша жад керек

Модель толығымен бейнекарта жадына (VRAM) немесе, Apple Silicon Mac-та, ортақ жадқа сыюы керек. Сыймаса — раннер қабаттардың бір бөлігін қарапайым ЖЖҚ-ға түсіреді, жылдамдық бірнеше есе төмендейді. Сондықтан модель таңдау бенчмарктардан емес, бейнекарта қорабындағы саннан басталады.

ВАЗ-2107 салонындағы жігіт бейнекарта мен «2107-мді 5090-ға айырбастаймын» деген картон тақтайшаны ұстап тұр

Модель өлшеміQ4_K_M файлыКерек жадСәйкес келеді
2–4B1,5–3,4 ГБ4–6 ГБ6–8 ГБ кез келген бейнекарта, кірістірілген графика, процессор
7–9B4,5–6,6 ГБ8 ГБRTX 4060 / 5060, Mac 16 ГБ
12–14B7,6–9 ГБ12 ГБRTX 3060 12 ГБ / 5070, Mac 16–24 ГБ
27–32B17–20 ГБ24 ГБRTX 3090 / 4090 / 5090, Mac 32 ГБ+
30B MoE (3B белсенді)21–24 ГБ24 ГБ VRAM немесе 32 ГБ ЖЖҚпроцессорда шыдарлық жүреді
70Bшамамен 40 ГБ48 ГБ24 ГБ-тан екі карта, Mac 64 ГБ+
gpt-oss 120B65 ГБ80 ГБMac Studio 96–128 ГБ

«Керек жад» бағанындағы сандар — 8–32 мың токен контекстпен. 64–128 мың контекст шығынды екі есе арттырады, сондықтан «модель сыйды, бірақ ұзын құжатпен құлады» — ең жиі қате.

Темір бойынша:

  • NVIDIA. GTX 750 Ti және одан жаңасының бәрі жұмыс істейді, драйвер 551.61+. Ашық өлшемдерден бағдарлар: RTX 5090 Q4-тегі 8B модельде — секундына шамамен 140 токен, 32B-де — 50–60; 16 ГБ карта 14B модельде — 20–50.
  • Apple Silicon. Біртұтас жад VRAM ретінде саналады, ал Ollama мен LM Studio MLX қозғалтқышын қолданады. llama.cpp өлшемдер кестесі бойынша Q4-тегі 7B модельде: M4 — секундына 24 токен, M4 Max — 83, M5 Max — 120. Intel-Mac: Ollama тек процессорда, LM Studio мүлдем іске қосылмайды.
  • AMD және Intel Arc. AMD — ROCm 7 немесе Vulkan арқылы, Intel Arc — Ollama-дағы Vulkan және llama.cpp-тің SYCL жинақтары арқылы. Жұмыс істейді, бірақ сол кластағы NVIDIA-дан баяу және драйверлер бойынша ескертулермен.
  • Тек процессор. DDR5 десктопта Q4-тегі 8B модель — секундына шамамен 8–15 токен, нақты уақытта оқуға болады. Тар жер — ядролар емес, жад өткізу қабілеті. 3B белсенді параметрі бар MoE-модельдер (Qwen3.5 35B-A3B, GLM-4.7-Flash) процессорда сол салмақтағы тығыз модельдерден айтарлықтай жылдам.

Сенде бейнекартасыз 8 ГБ ЖЖҚ ноутбук болса — нақты тек 2–4B модельдер жұмыс істейді, олармен әңгіме төбеге тез тіреледі.

1-нұсқа: Ollama — үш команда

Ollama қарапайым бағдарлама сияқты орнатылады және терминалға ollama командасын қосады. 2025 жылдан бері оның чат терезесі бар қолданбасы да бар, сондықтан терминал тек орнатуға керек.

macOS-тағы Ollama қолданбасы: бос чат, енгізу өрісі және төменгі оң бұрышта gemma3:27b моделін таңдау

Windows — әкімші құқығынсыз OllamaSetup.exe орнатқышы, немесе:

code
winget install Ollama.Ollama

macOS — сайттан DMG немесе Homebrew:

bash
brew install --cask ollama-app

Linux:

bash
curl -fsSL https://ollama.com/install.sh | sh

Әрі қарай бірінші модель. Команда 6,6 ГБ жүктеп, терминалда чат ашады:

bash
ollama run qwen3.5:9b

ollama run командасынан кейінгі терминалдағы gpt-oss моделімен чат: Thinking ойлау блогы және модель жауабы

Бірінші аптаға пайдалы командалар:

КомандаНе істейді
ollama pull gemma4:e4bчатты іске қоспай модельді жүктеу
ollama listне жүктелген және қанша орын алады
ollama psқазір жадқа не жүктелген және қайда — GPU немесе CPU
ollama rm qwen3.5:9bмодельді дискіден өшіру
ollama servelocalhost:11434-те API көтеру

Дерлік бірден өзгертуге тура келетін екі баптау:

  • Контекст. Әдепкі бойынша Ollama терезені VRAM көлеміне қарай таңдайды: 24 ГБ-қа дейін — бар болғаны 4 мың токен, ұзын құжат жай қиылып қалады. Қолданбада жүгірткі бар, сервер үшін — OLLAMA_CONTEXT_LENGTH=32000 айнымалысы. Жоғарыдағы кестені ұмытпа: контекст ұзарған сайын жад көбірек керек.
  • Модельдер қайда жатыр. Windows — %HOMEPATH%\.ollama, macOS — ~/.ollama/models, Linux — /usr/share/ollama. Басқа дискіге көшу — OLLAMA_MODELS орта айнымалысы, одан кейін қайта іске қосу.

API OpenAI-мен үйлесімді: api.openai.com-ға бара алатын кез келген клиент кез келген кілтпен http://localhost:11434/v1-ге қайта бапталады. Осының арқасында Ollama Claude Code, opencode және Cline үшін бэкенд болады — ollama launch командасы оларды өзі қосады.

2-нұсқа: LM Studio — терминалды қаламайтындарға

LM Studio — үш экранды қолданба: модель іздеу, чат және локалды сервер. 2025 жылдың шілдесінен бері жұмыс мақсатында да тегін, интерфейстің қауымдастық жасаған аудармалары бар.

Талаптар: 16 ГБ ЖЖҚ ұсынылады, Windows-та 4 ГБ-тан бейнекарта, AVX2 қолдайтын процессор. Mac-та — тек Apple Silicon, macOS 14+. ARM-дағы Windows үшін жинақ бар (Snapdragon X).

Реті:

  1. lmstudio.ai сайтынан орнатқышты жүктеу немесе winget install ElementLabs.LMStudio / brew install --cask lm-studio.
  2. Іздеу қойындысын ашып, qwen3.5 немесе gemma-4 енгізу. Бағдарлама қай кванттау сенің жадыңа сыятынын өзі көрсетеді, сыймайтындарын бөлектейді.
  3. Жүктеп, чатқа өтіп, модельді жүктеу. Контекст пен GPU бойынша тарату параметрлері — оң панельде.

LM Studio терезесі: сол жақта чаттар тізімі, жоғарыда GGUF форматындағы таңдалған Phi-3.1-mini моделі, төменде жад пен процессор шығыны жолы

«Сервер» қойындысы бөлек тұр: LM Studio localhost:1234-те OpenAI-үйлесімді API көтереді, MCP-құралдарды және lms CLI арқылы headless-режимді қолдайды. 0.4.16 нұсқасында LM Link және iPhone үшін Locally қолданбасы қосылды — модель үйдегі компьютерде, чат телефоннан.

Екеуінің қайсысын таңдау: Ollama — модельді басқа бағдарламалар мен скриптерге қосуды жоспарласаң, LM Studio — негізгі сценарий «аштым да сұрадым» болса. Екеуі бір компьютерде қатар тұра алады.

2026 жылы қай модельді жүктеу керек

Ашық модельдер көбейді, олардың көбі қосымша оқытусыз көп тілді біледі. Кесте — үйде орнатуға шынымен тұрарлықтары, Ollama тегтерімен:

МодельOllama тегіФайлЕрекшеліктері
Qwen3.5 4B / 9B / 27Bqwen3.5:4b / :9b / :27b3,4 / 6,6 / 17 ГБмәтін + суреттер, 256K контекст, 201 тіл. Apache 2.0
Qwen3.5 35B-A3Bqwen3.5:35b24 ГБMoE, процессорда жылдам. Apache 2.0
Qwen3.8 27Bqwen3.8:27b18 ГБ24 ГБ үшін ең күшті тығыз модель, суреттер мен видео. Apache 2.0
Gemma 4 E4B / 12B / 26B / 31Bgemma4:e4b / :12b / :26b / :31b9,6 / 7,6 / 19 / 20 ГБсуреттер, E4B-де аудио да бар, 140+ тіл. Apache 2.0
gpt-oss 20Bgpt-oss:20b14 ГБойлау, 128K, OpenAI-дан. Apache 2.0
GLM-4.7-Flash 30B-A3Bglm-4.7-flash24 ГБ жадMoE, 200K, агенттік тапсырмалар. MIT
Ministral 3 (3B / 8B / 14B)LM Studio-да аты бойынша2–9 ГБ256K, суреттер, ықшам. Apache 2.0
DeepSeek-R1 Distill 8B / 14Bdeepseek-r1:8b / :14b5–9 ГБойлау тізбектері, 2025 жылғы дистилляттар. MIT

Кестедегі барлық лицензиялар роялтисіз коммерциялық қолдануға рұқсат береді.

Qwen3.5/3.8 пен Gemma 4 — көптілді модельдер, қазақ тілі де қолдау көрсетілетін тілдер қатарында: Qwen — 201 тіл, Gemma 4 — 140+.

Жад бойынша практикалық таңдау:

  • 8 ГБ VRAM немесе Mac 16 ГБqwen3.5:9b немесе gemma4:e4b.
  • 12–16 ГБgemma4:12b, gpt-oss:20b, deepseek-r1:14b.
  • 24 ГБ — жалпы тапсырмаларға qwen3.8:27b, агенттер мен жылдамдыққа glm-4.7-flash немесе qwen3.5:35b.
  • Тек процессор, 32 ГБ ЖЖҚqwen3.5:35b: белсенді параметрлері 3B, сондықтан 9B тығыз модельден жылдам жүреді.

«DeepSeek-ті компьютерге жүктеу» — шын мәнінде не мүмкін

DeepSeek-ті жүктеу үшін кез келген басқа модельден жиі іздейді, сондықтан ол туралы бөлек. Флагман DeepSeek V4 — 1,6 триллион параметр, V4 Flash — 284 миллиард. V4 Flash салмақтары MIT лицензиясымен ашық, бірақ Q4 кванттауындағы файл шамамен 155 ГБ, жұмыс үшін 180 ГБ шамасында жад керек. Мұны үйге қоймайсың, ал Ollama кітапханасында V4 тек :cloud тегімен, яғни Ollama бұлты арқылы қолжетімді.

Локалды DeepSeek атымен тек 2025 жылғы R1 дистилляттарын іске қосуға болады (deepseek-r1:8b, :14b, :32b). Бұл R1 жауаптарында қосымша оқытылған Qwen мен Llama: ойлай алады, бірақ V4-ке дейін алыс. Дәл V4 керек болса — ол GPTunneL-де бар: контекст 1 миллион токен, токен үшін төлем, жазылымсыз.

Суреттер, видео және сөйлеу локалды

Мәтін — ең жеңіл модальділік. Қалғаны да жұмыс істейді, бірақ бейнекартаны көбірек сұрайды:

  • Суреттер. 2026 жылғы стандарт — ComfyUI (десктоп орнатқышы бар). Модельдер: Apache 2.0 лицензиясындағы FLUX.2 [klein] 4B 8–12 ГБ VRAM-да 4 қадамда жүреді, 9B нұсқасы мен толық FLUX.2 [dev] 32B — тек коммерциялық емес қолдануға. Stable Diffusion 3.5 (Medium 2.5B / Large 8B) әлі өзекті, Stability мұрагерін шығарған жоқ. Qwen-Image 20B ашық, бірақ Qwen-Image 2.0 — тек бұлтта. Суретшілерге Krita AI плагині бар, ол ComfyUI-ды өзі көтереді.
  • Видео. Wan-ның ашық салмақтары 2.2 нұсқасында тоқтады (5B нұсқасы 8 ГБ-та жүреді); 2.5 және одан жаңасы — тек API арқылы, локалды жоқ. Lightricks-тің LTX-2.5 — дыбыс генерациясы бар 22B, 12–16 ГБ-қа арналған кванттаулары бар. Роликке секундтарды емес, минуттарды есепте.
  • Сөйлеу. Тану — whisper.cpp, қазақ тілін қолдайды, бірақ ағылшыншадан әлсіз. Дыбыстау — Piper, қазақша дауыстары бар; Kokoro мен Fish Audio S2 ашық, бірақ ресми дауыстарында қазақ тілі жоқ.

Бірінші кеште не бұзылады

  • Модель жүктелді, бірақ секундына бір сөзден жауап береді. VRAM-ға сыймады, қабаттардың бір бөлігі ЖЖҚ-ға кетті. ollama ps қара: процессор бағанында 100% GPU болуы керек. Емі — төменірек кванттау немесе кішірек модель.
  • Ұзын құжат қиылып қалды. Ollama-ның 24 ГБ-қа дейінгі карталардағы әдепкі контексті 4K. OLLAMA_CONTEXT_LENGTH көтер де, модель әлі сыятынын қайта тексер.
  • SmartScreen және Defender. Ollama орнатқышы кейде SmartScreen ескертуімен тоқтайды: «Толығырақ → Бәрібір іске қосу». Windows Defender llama.cpp DLL-дерін және KoboldCpp архивтерін үнемі троян деп белгілейді — бұл llama.cpp issue-інде құжатталған жалған іске қосылулар. Тек ресми сайттар мен GitHub-релиздерден жүкте, сонда антивирустағы ерекшелік қауіпсіз.
  • Hugging Face жүктемейді. Hugging Face сенің аймағыңда тұрақсыз жүктесе, Ollama кітапханасы мен LM Studio жүктеушісі тікелей жұмыс істейді, ал Qwen салмақтары ModelScope айнасында бар.
  • Диск бітті. 20 ГБ-тан үш модель және кеш — қазірдің өзінде 70 ГБ. OLLAMA_MODELS айнымалысы кітапхананы басқа дискіге көшіреді.
  • Intel-Mac. Ollama — тек процессор, LM Studio орнатылмайды. Нақты нұсқа — 4B-қа дейінгі модельдер.

Локалды модель қай жерде бітеді

Ішінде бір кішкентай жарқыраған моделі бар шыны ноутбук жіңішке жіппен ондаған әртүрлі өлшемдегі модельдер бар үлкен бұлтпен байланысқан

Локалды модель үш нәрсе маңызды болғанда ұтады: деректер компьютерден шықпайды, интернет керек емес, лимиттер мен токен шоты мүлдем жоқ. Құжаттармен чатқа, хат черновиктеріне, кодты автотолтыруға және API-мен эксперименттерге 24 ГБ картада осы жеткілікті.

Флагман деңгейі керек жерде ол ұтылады. Үй бейнекартасына сыятын ең күштісі — 27–32B; 400B–2T модельдер (Qwen3.8 Max, DeepSeek V4, Claude Opus 5, GPT-5.5) локалды ешқандай кванттауда жоқ. Сирек қолданғанда бұлт арзанырақ: токендерге тиын төлейсің, ал 24 ГБ бейнекарта жылдар бойы өтеледі. GPTunneL-дегі сол ашық модельдер, миллион токен бағасы:

МодельКірісШығыс
gpt-oss 20B50 ₸200 ₸
Gemma 4 31B125 ₸375 ₸
Qwen 3.8 Flash150 ₸475 ₸
DeepSeek V4 Flash375 ₸1 125 ₸
Qwen 3.8 Max2 000 ₸6 000 ₸
GPT-5.52 500 ₸15 000 ₸

Бағалар бағдарлы, өзектілері — бағалар бетінде және жеке кабинетте. Чат арқылы қарапайым жұмыста миллион токен апталарға жетеді.

Дерлік бәрі келетін жұмыс схемасы: күнделікті және жеке істерге локалды Qwen немесе Gemma, ал күрделі тапсырмалар — флагманы бар бұлтқа. Екі жартысы API бойынша үйлесімді, сондықтан бір скрипт мекенжай мен кілтті ауыстырумен localhost:11434 мен GPTunneL арасында ауысады.

Жиі қойылатын сұрақтар

Локалды нейрожелі интернетсіз жұмыс істей ме? Иә. Интернет бір рет керек — раннер мен салмақтарды жүктеуге. Әрі қарай бәрі сенің теміріңде есептеледі, желіні өшіруге болады.

Бұл тегін бе? Жоғарыдағы кестелердегі раннерлер мен салмақтар — жеке де, коммерциялық қолдану үшін де тегін (Apache 2.0 және MIT лицензиялары). Тек темір мен электр үшін төлейсің.

Қай модель қазақ тілін жақсы біледі? Әмбебаптардан — Qwen3.5 пен Qwen3.8, Gemma 4: қазақ тілі олардың ресми қолдау тізімінде. 4B-қа дейінгі кішкентай модельдер қазақша ағылшыншадан айтарлықтай әлсіз.

Нейрожеліні телефонға қоюға бола ма? Android мен iPhone-да 1–4B модельдері бар қолданбалар бар, сапасы компьютердегіден төмен, батареяны тез жейді. Модельді үй компьютерінде ұстап, телефоннан қосылған ыңғайлырақ: LM Studio-да бұған LM Link және Locally қолданбасы бар.

Ollama-ны толығымен қалай өшіруге болады? Алдымен модельдер: ollama list тізімі бойынша ollama rm. Содан кейін бағдарлама: Windows-та — «Қолданбалар» арқылы, macOS-та — Ollama.app, /usr/local/bin/ollama және ~/.ollama қалтасын өшіру, Linux-та — құжаттамадағы нұсқаулық бойынша.

Локалды ChatGPT немесе Claude бар ма? Жоқ. OpenAI тек gpt-oss (20B және 120B) ашты, Anthropic жабық салмақтарын жарияламайды. «ChatGPT-ті компьютерге жүктеу» деп аталатынның бәрі — не бұлтқа клиент, не бөтен атпен бөтен модель.

Ollama-ны жүктеп, qwen3.5:9b орнат та, мұндай модель саған жете ме, қара. Төбеге тірелгенде — сол ашық модельдер мен OpenAI, Anthropic және Google флагмандары GPTunneL-де жиналған: бір баланс, токен үшін төлем, жазылымсыз.