2026 жылы «нейрожеліні жүктеу» сұранысы екі нәрсені білдіреді. Біріншісі: дүкеннен алынған DeepSeek немесе ChatGPT қолданбасы — ол өзі ештеңе есептемейді, бұлтқа барады. Екіншісі: локалды модель — дискіде жатқан салмақ файлы, ол интернетсіз сенің процессорыңда немесе бейнекартаңда жұмыс істейді. Бұл мақала екіншісі туралы.
Мұны оқып отырсаң, сенде байыпты бір нәрсе тұрған шығар: RTX 4070 немесе 4090, жаңа 50-серия, әлде 64 ГБ жады бар M4 Max MacBook Pro. Мұндай темір бос тұрады: ойындарда бейнекарта күніне екі-үш сағат жұмыс істейді, ал 24 ГБ бейнежад Qwen3.8 27B деңгейіндегі модельді ұстайды — ол код жазады, құжаттарды талдайды және көп тілде жауап береді, бір жыл бұрынғы бұлт сервистерінен кем емес; 16 ГБ-қа gpt-oss 20B мен Gemma 4 12B сыяды. Тіпті 12 ГБ RTX 3060 немесе 16 ГБ M2 Mac — локалды нейрожелі үшін жұмыс машинасы, тек модель кішірек болады.
Төменде: нақты нені жүктеу керек, әр өлшемдегі модель қанша жад талап етеді, қай ашық модельдер көп тілді біледі, Ollama мен LM Studio-ны қадам-қадаммен қалай орнату керек және бірінші кеште не бұзылады. Соңында — шынайы шекара: локалды модель бұлттан қай жерде ұтады, қай жерде ұтылады.
Нақты нені жүктейсің
Локалды нейрожелі — бұл екі файл:
- Раннер — модельді жадқа жүктеп, оған чат немесе API арқылы қолжетімділік беретін бағдарлама. Үй раннерлерінің дерлік бәрі ішінде llama.cpp қозғалтқышын қолданады.
- Модель салмақтары GGUF форматында. Бір модельге бір файл, әдетте
Q4_K_Mкванттауында: салмақтар 4 битке дейін сығылған, файл түпнұсқадан 3–4 есе кіші, типтік тапсырмалардағы сапа шығыны — бірнеше пайыз. Өлшем бағдары: әр миллиард параметрге шамамен 0,6 ГБ, оған қоса контекстке 1–2 ГБ.
2026 жылы орнатуға тұрарлық раннерлер:
| Бағдарлама | Кімге | ОЖ | Интерфейс тілдері |
|---|---|---|---|
| Ollama 0.34 | әдепкі стандарт: терминалдағы команда, чаты мен API-і бар қолданба. MIT | Windows 10 22H2+, macOS 14+, Linux | тек ағылшын |
| LM Studio 0.4 | бәрі тінтуірмен: модель іздеу, чат, локалды сервер. Жұмыс үшін де тегін | Windows x64/ARM, macOS тек Apple Silicon, Linux | қауымдастық аудармалары бар |
| Jan 0.8 | ашық кодты LM Studio баламасы | Windows, macOS, Linux | дерек жоқ |
| llama.cpp | тәуелділіктер минимум, өз сервері мен llama-server веб-интерфейсі. MIT | бәрі, CUDA, Vulkan, ROCm, SYCL жинақтарын қоса | тек ағылшын |
| KoboldCpp 1.120 | орнатусыз бір exe-файл, браузердегі чат. AGPL | Windows, macOS, Linux | тек ағылшын |
GPT4All кестеге кірмеді: соңғы 3.10 релизі 2025 жылдың ақпанында шықты, жаңа модельдерді ол қолдамайды.
Қанша жад керек
Модель толығымен бейнекарта жадына (VRAM) немесе, Apple Silicon Mac-та, ортақ жадқа сыюы керек. Сыймаса — раннер қабаттардың бір бөлігін қарапайым ЖЖҚ-ға түсіреді, жылдамдық бірнеше есе төмендейді. Сондықтан модель таңдау бенчмарктардан емес, бейнекарта қорабындағы саннан басталады.

| Модель өлшемі | Q4_K_M файлы | Керек жад | Сәйкес келеді |
|---|---|---|---|
| 2–4B | 1,5–3,4 ГБ | 4–6 ГБ | 6–8 ГБ кез келген бейнекарта, кірістірілген графика, процессор |
| 7–9B | 4,5–6,6 ГБ | 8 ГБ | RTX 4060 / 5060, Mac 16 ГБ |
| 12–14B | 7,6–9 ГБ | 12 ГБ | RTX 3060 12 ГБ / 5070, Mac 16–24 ГБ |
| 27–32B | 17–20 ГБ | 24 ГБ | RTX 3090 / 4090 / 5090, Mac 32 ГБ+ |
| 30B MoE (3B белсенді) | 21–24 ГБ | 24 ГБ VRAM немесе 32 ГБ ЖЖҚ | процессорда шыдарлық жүреді |
| 70B | шамамен 40 ГБ | 48 ГБ | 24 ГБ-тан екі карта, Mac 64 ГБ+ |
| gpt-oss 120B | 65 ГБ | 80 ГБ | Mac Studio 96–128 ГБ |
«Керек жад» бағанындағы сандар — 8–32 мың токен контекстпен. 64–128 мың контекст шығынды екі есе арттырады, сондықтан «модель сыйды, бірақ ұзын құжатпен құлады» — ең жиі қате.
Темір бойынша:
- NVIDIA. GTX 750 Ti және одан жаңасының бәрі жұмыс істейді, драйвер 551.61+. Ашық өлшемдерден бағдарлар: RTX 5090 Q4-тегі 8B модельде — секундына шамамен 140 токен, 32B-де — 50–60; 16 ГБ карта 14B модельде — 20–50.
- Apple Silicon. Біртұтас жад VRAM ретінде саналады, ал Ollama мен LM Studio MLX қозғалтқышын қолданады. llama.cpp өлшемдер кестесі бойынша Q4-тегі 7B модельде: M4 — секундына 24 токен, M4 Max — 83, M5 Max — 120. Intel-Mac: Ollama тек процессорда, LM Studio мүлдем іске қосылмайды.
- AMD және Intel Arc. AMD — ROCm 7 немесе Vulkan арқылы, Intel Arc — Ollama-дағы Vulkan және llama.cpp-тің SYCL жинақтары арқылы. Жұмыс істейді, бірақ сол кластағы NVIDIA-дан баяу және драйверлер бойынша ескертулермен.
- Тек процессор. DDR5 десктопта Q4-тегі 8B модель — секундына шамамен 8–15 токен, нақты уақытта оқуға болады. Тар жер — ядролар емес, жад өткізу қабілеті. 3B белсенді параметрі бар MoE-модельдер (Qwen3.5 35B-A3B, GLM-4.7-Flash) процессорда сол салмақтағы тығыз модельдерден айтарлықтай жылдам.
Сенде бейнекартасыз 8 ГБ ЖЖҚ ноутбук болса — нақты тек 2–4B модельдер жұмыс істейді, олармен әңгіме төбеге тез тіреледі.
1-нұсқа: Ollama — үш команда
Ollama қарапайым бағдарлама сияқты орнатылады және терминалға ollama командасын қосады. 2025 жылдан бері оның чат терезесі бар қолданбасы да бар, сондықтан терминал тек орнатуға керек.

Windows — әкімші құқығынсыз OllamaSetup.exe орнатқышы, немесе:
winget install Ollama.OllamamacOS — сайттан DMG немесе Homebrew:
brew install --cask ollama-appLinux:
curl -fsSL https://ollama.com/install.sh | shӘрі қарай бірінші модель. Команда 6,6 ГБ жүктеп, терминалда чат ашады:
ollama run qwen3.5:9b
Бірінші аптаға пайдалы командалар:
| Команда | Не істейді |
|---|---|
ollama pull gemma4:e4b | чатты іске қоспай модельді жүктеу |
ollama list | не жүктелген және қанша орын алады |
ollama ps | қазір жадқа не жүктелген және қайда — GPU немесе CPU |
ollama rm qwen3.5:9b | модельді дискіден өшіру |
ollama serve | localhost:11434-те API көтеру |
Дерлік бірден өзгертуге тура келетін екі баптау:
- Контекст. Әдепкі бойынша Ollama терезені VRAM көлеміне қарай таңдайды: 24 ГБ-қа дейін — бар болғаны 4 мың токен, ұзын құжат жай қиылып қалады. Қолданбада жүгірткі бар, сервер үшін —
OLLAMA_CONTEXT_LENGTH=32000айнымалысы. Жоғарыдағы кестені ұмытпа: контекст ұзарған сайын жад көбірек керек. - Модельдер қайда жатыр. Windows —
%HOMEPATH%\.ollama, macOS —~/.ollama/models, Linux —/usr/share/ollama. Басқа дискіге көшу —OLLAMA_MODELSорта айнымалысы, одан кейін қайта іске қосу.
API OpenAI-мен үйлесімді: api.openai.com-ға бара алатын кез келген клиент кез келген кілтпен http://localhost:11434/v1-ге қайта бапталады. Осының арқасында Ollama Claude Code, opencode және Cline үшін бэкенд болады — ollama launch командасы оларды өзі қосады.
2-нұсқа: LM Studio — терминалды қаламайтындарға
LM Studio — үш экранды қолданба: модель іздеу, чат және локалды сервер. 2025 жылдың шілдесінен бері жұмыс мақсатында да тегін, интерфейстің қауымдастық жасаған аудармалары бар.
Талаптар: 16 ГБ ЖЖҚ ұсынылады, Windows-та 4 ГБ-тан бейнекарта, AVX2 қолдайтын процессор. Mac-та — тек Apple Silicon, macOS 14+. ARM-дағы Windows үшін жинақ бар (Snapdragon X).
Реті:
- lmstudio.ai сайтынан орнатқышты жүктеу немесе
winget install ElementLabs.LMStudio/brew install --cask lm-studio. - Іздеу қойындысын ашып,
qwen3.5немесеgemma-4енгізу. Бағдарлама қай кванттау сенің жадыңа сыятынын өзі көрсетеді, сыймайтындарын бөлектейді. - Жүктеп, чатқа өтіп, модельді жүктеу. Контекст пен GPU бойынша тарату параметрлері — оң панельде.

«Сервер» қойындысы бөлек тұр: LM Studio localhost:1234-те OpenAI-үйлесімді API көтереді, MCP-құралдарды және lms CLI арқылы headless-режимді қолдайды. 0.4.16 нұсқасында LM Link және iPhone үшін Locally қолданбасы қосылды — модель үйдегі компьютерде, чат телефоннан.
Екеуінің қайсысын таңдау: Ollama — модельді басқа бағдарламалар мен скриптерге қосуды жоспарласаң, LM Studio — негізгі сценарий «аштым да сұрадым» болса. Екеуі бір компьютерде қатар тұра алады.
2026 жылы қай модельді жүктеу керек
Ашық модельдер көбейді, олардың көбі қосымша оқытусыз көп тілді біледі. Кесте — үйде орнатуға шынымен тұрарлықтары, Ollama тегтерімен:
| Модель | Ollama тегі | Файл | Ерекшеліктері |
|---|---|---|---|
| Qwen3.5 4B / 9B / 27B | qwen3.5:4b / :9b / :27b | 3,4 / 6,6 / 17 ГБ | мәтін + суреттер, 256K контекст, 201 тіл. Apache 2.0 |
| Qwen3.5 35B-A3B | qwen3.5:35b | 24 ГБ | MoE, процессорда жылдам. Apache 2.0 |
| Qwen3.8 27B | qwen3.8:27b | 18 ГБ | 24 ГБ үшін ең күшті тығыз модель, суреттер мен видео. Apache 2.0 |
| Gemma 4 E4B / 12B / 26B / 31B | gemma4:e4b / :12b / :26b / :31b | 9,6 / 7,6 / 19 / 20 ГБ | суреттер, E4B-де аудио да бар, 140+ тіл. Apache 2.0 |
| gpt-oss 20B | gpt-oss:20b | 14 ГБ | ойлау, 128K, OpenAI-дан. Apache 2.0 |
| GLM-4.7-Flash 30B-A3B | glm-4.7-flash | 24 ГБ жад | MoE, 200K, агенттік тапсырмалар. MIT |
| Ministral 3 (3B / 8B / 14B) | LM Studio-да аты бойынша | 2–9 ГБ | 256K, суреттер, ықшам. Apache 2.0 |
| DeepSeek-R1 Distill 8B / 14B | deepseek-r1:8b / :14b | 5–9 ГБ | ойлау тізбектері, 2025 жылғы дистилляттар. MIT |
Кестедегі барлық лицензиялар роялтисіз коммерциялық қолдануға рұқсат береді.
Qwen3.5/3.8 пен Gemma 4 — көптілді модельдер, қазақ тілі де қолдау көрсетілетін тілдер қатарында: Qwen — 201 тіл, Gemma 4 — 140+.
Жад бойынша практикалық таңдау:
- 8 ГБ VRAM немесе Mac 16 ГБ —
qwen3.5:9bнемесеgemma4:e4b. - 12–16 ГБ —
gemma4:12b,gpt-oss:20b,deepseek-r1:14b. - 24 ГБ — жалпы тапсырмаларға
qwen3.8:27b, агенттер мен жылдамдыққаglm-4.7-flashнемесеqwen3.5:35b. - Тек процессор, 32 ГБ ЖЖҚ —
qwen3.5:35b: белсенді параметрлері 3B, сондықтан 9B тығыз модельден жылдам жүреді.
«DeepSeek-ті компьютерге жүктеу» — шын мәнінде не мүмкін
DeepSeek-ті жүктеу үшін кез келген басқа модельден жиі іздейді, сондықтан ол туралы бөлек. Флагман DeepSeek V4 — 1,6 триллион параметр, V4 Flash — 284 миллиард. V4 Flash салмақтары MIT лицензиясымен ашық, бірақ Q4 кванттауындағы файл шамамен 155 ГБ, жұмыс үшін 180 ГБ шамасында жад керек. Мұны үйге қоймайсың, ал Ollama кітапханасында V4 тек :cloud тегімен, яғни Ollama бұлты арқылы қолжетімді.
Локалды DeepSeek атымен тек 2025 жылғы R1 дистилляттарын іске қосуға болады (deepseek-r1:8b, :14b, :32b). Бұл R1 жауаптарында қосымша оқытылған Qwen мен Llama: ойлай алады, бірақ V4-ке дейін алыс. Дәл V4 керек болса — ол GPTunneL-де бар: контекст 1 миллион токен, токен үшін төлем, жазылымсыз.
Суреттер, видео және сөйлеу локалды
Мәтін — ең жеңіл модальділік. Қалғаны да жұмыс істейді, бірақ бейнекартаны көбірек сұрайды:
- Суреттер. 2026 жылғы стандарт — ComfyUI (десктоп орнатқышы бар). Модельдер: Apache 2.0 лицензиясындағы FLUX.2 [klein] 4B 8–12 ГБ VRAM-да 4 қадамда жүреді, 9B нұсқасы мен толық FLUX.2 [dev] 32B — тек коммерциялық емес қолдануға. Stable Diffusion 3.5 (Medium 2.5B / Large 8B) әлі өзекті, Stability мұрагерін шығарған жоқ. Qwen-Image 20B ашық, бірақ Qwen-Image 2.0 — тек бұлтта. Суретшілерге Krita AI плагині бар, ол ComfyUI-ды өзі көтереді.
- Видео. Wan-ның ашық салмақтары 2.2 нұсқасында тоқтады (5B нұсқасы 8 ГБ-та жүреді); 2.5 және одан жаңасы — тек API арқылы, локалды жоқ. Lightricks-тің LTX-2.5 — дыбыс генерациясы бар 22B, 12–16 ГБ-қа арналған кванттаулары бар. Роликке секундтарды емес, минуттарды есепте.
- Сөйлеу. Тану — whisper.cpp, қазақ тілін қолдайды, бірақ ағылшыншадан әлсіз. Дыбыстау — Piper, қазақша дауыстары бар; Kokoro мен Fish Audio S2 ашық, бірақ ресми дауыстарында қазақ тілі жоқ.
Бірінші кеште не бұзылады
- Модель жүктелді, бірақ секундына бір сөзден жауап береді. VRAM-ға сыймады, қабаттардың бір бөлігі ЖЖҚ-ға кетті.
ollama psқара: процессор бағанында 100% GPU болуы керек. Емі — төменірек кванттау немесе кішірек модель. - Ұзын құжат қиылып қалды. Ollama-ның 24 ГБ-қа дейінгі карталардағы әдепкі контексті 4K.
OLLAMA_CONTEXT_LENGTHкөтер де, модель әлі сыятынын қайта тексер. - SmartScreen және Defender. Ollama орнатқышы кейде SmartScreen ескертуімен тоқтайды: «Толығырақ → Бәрібір іске қосу». Windows Defender llama.cpp DLL-дерін және KoboldCpp архивтерін үнемі троян деп белгілейді — бұл llama.cpp issue-інде құжатталған жалған іске қосылулар. Тек ресми сайттар мен GitHub-релиздерден жүкте, сонда антивирустағы ерекшелік қауіпсіз.
- Hugging Face жүктемейді. Hugging Face сенің аймағыңда тұрақсыз жүктесе, Ollama кітапханасы мен LM Studio жүктеушісі тікелей жұмыс істейді, ал Qwen салмақтары ModelScope айнасында бар.
- Диск бітті. 20 ГБ-тан үш модель және кеш — қазірдің өзінде 70 ГБ.
OLLAMA_MODELSайнымалысы кітапхананы басқа дискіге көшіреді. - Intel-Mac. Ollama — тек процессор, LM Studio орнатылмайды. Нақты нұсқа — 4B-қа дейінгі модельдер.
Локалды модель қай жерде бітеді

Локалды модель үш нәрсе маңызды болғанда ұтады: деректер компьютерден шықпайды, интернет керек емес, лимиттер мен токен шоты мүлдем жоқ. Құжаттармен чатқа, хат черновиктеріне, кодты автотолтыруға және API-мен эксперименттерге 24 ГБ картада осы жеткілікті.
Флагман деңгейі керек жерде ол ұтылады. Үй бейнекартасына сыятын ең күштісі — 27–32B; 400B–2T модельдер (Qwen3.8 Max, DeepSeek V4, Claude Opus 5, GPT-5.5) локалды ешқандай кванттауда жоқ. Сирек қолданғанда бұлт арзанырақ: токендерге тиын төлейсің, ал 24 ГБ бейнекарта жылдар бойы өтеледі. GPTunneL-дегі сол ашық модельдер, миллион токен бағасы:
| Модель | Кіріс | Шығыс |
|---|---|---|
| gpt-oss 20B | 50 ₸ | 200 ₸ |
| Gemma 4 31B | 125 ₸ | 375 ₸ |
| Qwen 3.8 Flash | 150 ₸ | 475 ₸ |
| DeepSeek V4 Flash | 375 ₸ | 1 125 ₸ |
| Qwen 3.8 Max | 2 000 ₸ | 6 000 ₸ |
| GPT-5.5 | 2 500 ₸ | 15 000 ₸ |
Бағалар бағдарлы, өзектілері — бағалар бетінде және жеке кабинетте. Чат арқылы қарапайым жұмыста миллион токен апталарға жетеді.
Дерлік бәрі келетін жұмыс схемасы: күнделікті және жеке істерге локалды Qwen немесе Gemma, ал күрделі тапсырмалар — флагманы бар бұлтқа. Екі жартысы API бойынша үйлесімді, сондықтан бір скрипт мекенжай мен кілтті ауыстырумен localhost:11434 мен GPTunneL арасында ауысады.
Жиі қойылатын сұрақтар
Локалды нейрожелі интернетсіз жұмыс істей ме? Иә. Интернет бір рет керек — раннер мен салмақтарды жүктеуге. Әрі қарай бәрі сенің теміріңде есептеледі, желіні өшіруге болады.
Бұл тегін бе? Жоғарыдағы кестелердегі раннерлер мен салмақтар — жеке де, коммерциялық қолдану үшін де тегін (Apache 2.0 және MIT лицензиялары). Тек темір мен электр үшін төлейсің.
Қай модель қазақ тілін жақсы біледі? Әмбебаптардан — Qwen3.5 пен Qwen3.8, Gemma 4: қазақ тілі олардың ресми қолдау тізімінде. 4B-қа дейінгі кішкентай модельдер қазақша ағылшыншадан айтарлықтай әлсіз.
Нейрожеліні телефонға қоюға бола ма? Android мен iPhone-да 1–4B модельдері бар қолданбалар бар, сапасы компьютердегіден төмен, батареяны тез жейді. Модельді үй компьютерінде ұстап, телефоннан қосылған ыңғайлырақ: LM Studio-да бұған LM Link және Locally қолданбасы бар.
Ollama-ны толығымен қалай өшіруге болады? Алдымен модельдер: ollama list тізімі бойынша ollama rm. Содан кейін бағдарлама: Windows-та — «Қолданбалар» арқылы, macOS-та — Ollama.app, /usr/local/bin/ollama және ~/.ollama қалтасын өшіру, Linux-та — құжаттамадағы нұсқаулық бойынша.
Локалды ChatGPT немесе Claude бар ма? Жоқ. OpenAI тек gpt-oss (20B және 120B) ашты, Anthropic жабық салмақтарын жарияламайды. «ChatGPT-ті компьютерге жүктеу» деп аталатынның бәрі — не бұлтқа клиент, не бөтен атпен бөтен модель.
Ollama-ны жүктеп, qwen3.5:9b орнат та, мұндай модель саған жете ме, қара. Төбеге тірелгенде — сол ашық модельдер мен OpenAI, Anthropic және Google флагмандары GPTunneL-де жиналған: бір баланс, токен үшін төлем, жазылымсыз.



