Кажется, что нейросети живут только в облаке: заходишь на сайт, платишь за подписку и надеешься, что твои переписки никто не читает. На самом деле языковую модель можно запустить прямо на своём компьютере — и для этого не нужны серверная стойка и диплом по машинному обучению. Понадобится программа Ollama и полчаса времени. В статье разберёмся, что это за платформа, какое железо ей нужно, поставим её на Windows, macOS и Linux, скачаем первую модель и подключим к ней графический интерфейс и другие программы. Если у вас есть компьютер с 8 гигабайтами оперативки — у вас уже всё есть.
ВАМ ПРИШЛО ПРИГЛАШЕНИЕ 💌
Приходите к нам в соцсети поделиться своим мнением и почитать, что пишут другие. А ещё там выходит дополнительный контент, которого нет на сайте — шпаргалки, опросы и разная дурка. В общем, вот тележка, вот ВК — велком!
Ollama — что это такое
Ollama — это опенсорсная платформа с лицензией MIT, которая скачивает большие языковые модели и запускает их на вашем компьютере. Все вычисления происходят локально: запросы и ответы не покидают машину, платить за токены не нужно, а после того как модель скачана, Ollama работает даже без интернета.
Частая путаница: Ollama нейросетью называют сплошь и рядом, но сама по себе она ничего не генерирует. Это среда запуска, что-то вроде плеера для моделей. Плеер один, а треки в него можно загружать разные: Llama от Meta, Qwen от Alibaba, DeepSeek, Gemma от Google и ещё сотни моделей из открытой библиотеки. Ollama берёт на себя всю грязную работу — скачивание, распаковку, загрузку в память, общение с видеокартой, а вам оставляет простой интерфейс: написал запрос, получил ответ.
Зачем запускать нейросеть локально
Первый и главный мотив — конфиденциальность. Всё, что вы отправляете облачной нейросети, физически уезжает на чужие серверы. Для бытовых вопросов это терпимо, а вот для кода под NDA, внутренних документов компании или персональных данных, которые в России защищает 152-ФЗ, — уже проблема. С локальной моделью промпты и файлы не выходят за пределы вашего компьютера, и вопрос «а куда попадёт этот документ» закрывается сам собой. Подробнее о том, чем рискует разработчик, отправляя код в облачные нейросети, мы писали в статье про безопасность ИИ-кода.
Второй мотив — деньги. Облачные API берут плату за каждый токен, и при больших объёмах — например, если нейросеть обрабатывает тысячи документов или крутится внутри вашего сервиса — счёт растёт быстро. Локальная модель после установки не стоит ничего, кроме электричества.
Третий — офлайн. Модель, скачанная один раз, работает в поезде, в самолёте и в деревне без связи.
Теперь оговорка, без которой картина будет неполной. Локальные модели, которые влезают в обычный компьютер, слабее облачных флагманов — это нормальная цена за приватность и бесплатность. Модель на 8 миллиардов параметров не напишет вам диссертацию уровня GPT, но переводит, суммаризирует, отвечает на вопросы и помогает с кодом вполне достойно. Для большинства повседневных задач этого хватает.
Какое железо нужно
Главный ресурс для языковой модели — память. Модель целиком загружается в оперативку или в память видеокарты, поэтому требования считаются просто: смотрим на размер модели и прикидываем, влезет ли она.
Ориентиры такие. Модели на 3–4 миллиарда параметров (в названиях это 3b и 4b) работают на компьютере с 8 ГБ оперативной памяти. Модели на 7–8 миллиардов — комфортный минимум для большинства задач: занимают около 5 ГБ на диске и хотят 16 ГБ оперативки, чтобы рядом с ними жили браузер и остальная система. Модели от 14 миллиардов параметров уже просят выделенную видеокарту с большим объёмом видеопамяти — на процессоре они запустятся, но скорость ответа будет напоминать печатную машинку.
| Размер модели | Место на диске | Оперативная память | Видеокарта |
| 1–4B | 1–3 ГБ | 8 ГБ | Необязательна |
| 7–8B | ~5 ГБ | 16 ГБ | Желательна, но работает и на CPU |
| 14B | ~9 ГБ | 32 ГБ | Нужна, от 12 ГБ VRAM |
| 30B+ | 20+ ГБ | 64 ГБ | Обязательна, от 24 ГБ VRAM |
Цифры сходятся благодаря квантизации. Исходная модель хранит каждый параметр в 16-битном формате, а квантизация ужимает их до 4–8 бит — модель становится меньше в 2–4 раза и почти не теряет в качестве. Примерно как пережать WAV в MP3: разница есть, но услышит её не каждый.
Модели в библиотеке Ollama по умолчанию уже квантизованы в формат Q4_K_M — это разумный баланс размера и качества, и в большинстве случаев менять его не нужно.
Установка Ollama на Windows, macOS и Linux
Установщик берём только с официального сайта ollama.com — тот самый «официальный сайт ollama» из поисковых запросов. Раньше проект жил на домене ollama.ai, но актуальный адрес именно .com. Сторонние сборки с файлопомоек брать не стоит: у Ollama выходят релизы почти каждую неделю, и старый установщик с чужого сайта в лучшем случае не запустит свежие модели, а в худшем принесёт с собой что-нибудь лишнее.
Windows. Нужна Windows 10 или новее. Скачиваете OllamaSetup.exe с ollama.com, запускаете, жмёте Install — всё. Приятная деталь: права администратора не нужны, Ollama ставится в профиль пользователя. После установки в трее появится иконка ламы, а в системе — команда ollama.
macOS. Нужна macOS 14 или новее. Скачиваете dmg-файл, перетаскиваете Ollama в папку «Программы», запускаете. Дальше всё то же самое, что и на Windows: иконка в строке меню и команда ollama в терминале.
Linux. Здесь установка одной командой в терминале:
curl -fsSL https://ollama.com/install.sh | sh
Скрипт сам определит дистрибутив, поставит Ollama и зарегистрирует её как системный сервис — она будет подниматься при загрузке компьютера.
Проверить, что всё встало, можно на любой системе одной командой:
ollama --version
Если в ответ пришёл номер версии — можно запускать первую модель.
Первый запуск: скачиваем модель и пишем первый запрос
Разбираемся, как запустить Ollama и как ей пользоваться. Весь путь новичка укладывается в одну команду в терминале:
# скачиваем модель gemma3 и запускаем диалог с ней
ollama run gemma3
Ollama проверит, есть ли модель на диске, не найдёт её и начнёт скачивать — в терминале побежит прогресс загрузки. Модель весит несколько гигабайт, так что при небыстром интернете успеете заварить чай. Когда загрузка закончится, появится приглашение >>> — это и есть диалог с нейросетью. Пишете вопрос, жмёте Enter, модель отвечает прямо в терминале.
Внутри диалога работают служебные команды — они начинаются со слэша и обращаются к самой Ollama, а не к модели:
# показать информацию о модели: архитектуру, размер, квантизацию
/show info
# поменять параметр генерации, например температуру (креативность ответов)
/set parameter temperature 0.3
# выйти из диалога
/bye
Температура — параметр от 0 до 1: чем ниже, тем предсказуемее и суше ответы, чем выше — тем больше модель фантазирует. Для фактических вопросов и кода ставьте пониже, для сочинения поздравлений тёще — повыше.
Отдельный вопрос, который всплывает у многих: куда Ollama скачивает модели? На Windows они лежат в папке C:\Users\имя_пользователя\.ollama\models, на macOS — в ~/.ollama/models, на Linux — в /usr/share/ollama/.ollama/models. Если системный диск маленький, хранилище переносится переменной окружения OLLAMA_MODELS: указываете в ней путь к папке на другом диске, перезапускаете Ollama — и новые модели качаются туда.
Какую модель выбрать первой
Библиотека Ollama насчитывает сотни моделей, и у новичка глаза разбегаются. Вот рабочие ориентиры на середину 2026 года — с поправкой на то, что библиотека обновляется еженедельно и конкретные версии со временем поменяются.
Для старта подойдёт лёгкий универсал — gemma3 от Google или llama3.1:8b от Meta:
# универсальная модель для первого знакомства (лёгкий вариант на 4 млрд параметров)
ollama run gemma3:4b
Если основной язык общения — русский или нужна помощь с кодом, смотрите на семейство Qwen: у него традиционно сильная поддержка русского языка.
# модель с хорошим русским языком и навыками программирования
ollama run qwen3
Для задач с рассуждениями — математика, логика, разбор сложных вопросов — есть DeepSeek-R1: эта модель «думает вслух» перед ответом и показывает цепочку рассуждений.
# рассуждающая модель, версия на 8 миллиардов параметров
ollama run deepseek-r1:8b
Двоеточие в имени задаёт вариант модели: тег 8b — это версия на 8 миллиардов параметров, без тега скачается вариант по умолчанию. Все модели в библиотеке распространяются в формате GGUF — это стандарт упаковки квантизованных моделей, в нём же публикуются модели на Hugging Face.
Списки устаревают быстрее, чем выходят статьи, поэтому запомните приём, который работает всегда: зайдите в библиотеку на ollama.com/library и отсортируйте модели по популярности. Что скачивают чаще всего — то, как правило, и стоит пробовать первым.
Ollama App и Open WebUI: работа без терминала
Терминал нравится далеко не всем, и это нормально: для работы с Ollama он давно не обязателен.
Первый путь — встроенный графический интерфейс Ollama App. Он появился в версии 0.10 и с тех пор стал штатной частью Ollama: ставится вместе с ней и открывается по клику на иконку в трее. Внутри — привычное окно чата: слева история диалогов, сверху выпадающий список моделей, поле ввода снизу. Модели можно скачивать прямо из интерфейса, к сообщению — прикладывать файлы. Для одного человека за одним компьютером этого хватает с запасом.
Второй путь — Open WebUI. Это отдельный опенсорсный проект: браузерный интерфейс в духе ChatGPT, который подключается к Ollama. Ставится через Docker одной командой:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main
После запуска интерфейс открывается в браузере по адресу localhost:3000. Если вы ставили Open WebUI не через Docker, а напрямую (например, через pip install open-webui и open-webui serve), адрес будет другим — localhost:8080, порт по умолчанию у такой установки. Умеет Open WebUI заметно больше встроенного приложения: мультипользовательский режим с разграничением прав, загрузка документов, по которым модель отвечает на вопросы (это называется RAG — генерация с опорой на ваши файлы), библиотека промптов, доступ с других устройств в локальной сети.
Критерий выбора простой: работаете в одиночку и нужен просто чат — хватит Ollama App; нужен доступ для команды, работа с документами или вход с планшета — ставьте Open WebUI.
Ollama API: подключаем модель к своим приложениям
Пока вы переписываетесь с моделью в чате, под капотом происходит одно и то же: Ollama держит на компьютере REST API по адресу localhost:11434, и все интерфейсы ходят через него. Этот же API доступен вашим программам и скриптам — вот запрос к модели через curl:
# отправляем запрос к локальному API Ollama: модель, сообщение и отключённый стриминг
curl http://localhost:11434/api/chat -d '{
"model": "gemma3",
"messages": [
{ "role": "user", "content": "Почему небо голубое? Ответь одним абзацем." }
],
"stream": false
}'
В ответ придёт JSON с текстом от модели. На этом строится всё что угодно: телеграм-бот, обработчик документов, автопереводчик — любой код, который умеет делать HTTP-запросы, умеет разговаривать с вашей локальной нейросетью.
Есть у Ollama и второй эндпоинт — /v1, совместимый с API OpenAI. Это важнее, чем звучит: формат OpenAI стал отраслевым стандартом, и через /v1 к Ollama подключается почти любой инструмент, который в принципе умеет работать с языковыми моделями, — — редактор Cursor, расширения для VS Code вроде Continue и Cline, десятки других программ. Указываете в настройках инструмента адрес http://localhost:11434/v1 — и он работает с вашей локальной моделью вместо облачной. Как программируют в связке с такими ИИ-редакторами, мы разбирали в статье про вайб-кодинг для джунов: как создавать проекты с помощью ИИ.
С января 2026 года настройку кодинг-агентов Ollama берёт на себя: команда ollama launch сама скачивает выбранный инструмент — Claude Code, Codex, OpenCode — и прописывает ему конфигурацию для работы с вашими моделями. Без ручной правки конфигов и переменных окружения:
# автоматически настраиваем и запускаем кодинг-агент с локальной моделью
ollama launch
Команда откроет меню, где стрелками выбираете агент и модель, — дальше всё произойдёт само.
Полезный блок со скидкой
Локальная модель по API — это готовый кубик, но чтобы из него что-то собрать, нужен код: обработать ответ, разобрать JSON, не уронить всё при таймауте. Обычно на этом месте и заканчивается первое знакомство с Ollama.
Если хочется довести до рабочего сервиса, в Практикуме есть «Python-разработчик» — с нуля до бэкенда, и «ИИ-агенты и автоматизация» — про то, как обвязать модель инструментами и памятью.
Промокод: KOD (можно просто нажать) даст скидку при покупке любого курса. Бесплатная вводная часть открыта, карту привязывать не нужно.
Частые проблемы и что с ними делать
Модель не скачивается. Сначала проверьте имя: Ollama ищет модель в библиотеке по точному названию, и ollama run gema3 ответит, что такой модели нет — потому что она называется gemma3. Вторая типичная причина — кончилось место на диске: модели весят гигабайты, а загрузка обрывается без внятного объяснения. Освободите место или перенесите хранилище моделей на другой диск через переменную OLLAMA_MODELS.
Не хватает памяти. Если при запуске Ollama пишет об ошибке выделения памяти или модель отвечает со скоростью слово-в-минуту, значит, модель не помещается в оперативку или видеопамять. Лекарство одно: взять модель поменьше — вместо 8b скачать 4b — или тот же размер в более жёсткой квантизации, например Q3 вместо Q4. Немного качества потеряете, зато модель будет работать, а не бороться за выживание.
Windows не находит команду ollama. Установка прошла, а PowerShell на команду ollama отвечает, что такой не знает. Дело в том, что открытые до установки окна терминала не видят обновлённую переменную PATH. Закройте PowerShell, откройте заново — команда найдётся.
Когда Ollama не подходит
У Ollama есть граница применимости, и упереться в неё можно быстрее, чем кажется. Если вы строите продакшен-сервис, где к модели одновременно ходят сотни пользователей, смотрите в сторону vLLM — это движок, заточенный под высокую пропускную способность на серверных видеокартах, тогда как Ollama оптимизирована под сценарий «один человек — один компьютер».
Если хочется графических экспериментов с моделями вообще без терминала и API, есть LM Studio — настольное приложение с упором на интерфейс. А когда своего железа не хватает на тяжёлую модель, у самой Ollama с 2025 года есть обходной путь: облачные модели с суффиксом :cloud запускаются той же командой ollama run, но считаются на серверах Ollama — бесплатный тариф даёт попробовать, платные планы Pro и Max расширяют лимиты. Получается компромисс: интерфейс локальный, вычисления облачные — и это уже осознанный обмен приватности на мощность, а не выбор по умолчанию.
Советуем дополнительно почитать
Что под капотом у ChatGPT и других чатов с большими языковыми моделями — как модель предсказывает следующее слово и почему из этого получается связный текст.
Пишем свою нейросеть с нуля: пошаговый гайд по созданию ИИ-фильтра — от датасета до обученной модели на своём компьютере, с кодом и разбором каждого шага.
Эмбеддинги в поиске: векторы, косинусное сходство и RAG — как текст превращается в числа и почему поиск по смыслу находит нужное без совпадения слов.
Видеокарты: чем различаются Nvidia и AMD и что там нового — на что смотреть при покупке карты и почему в одном ценовом сегменте объём памяти отличается вдвое.
MCP-сервер: что это и как настроить в Cursor и Claude — как дать модели доступ к файлам, базе и документации, чтобы она перестала работать вслепую.
Бонус для читателей
Если вам интересно погрузиться в мир ИИ и при этом немного сэкономить, держите наш промокод на курсы Практикума. Вы получите скидку при оплате, промокод поможет с льготной ипотекой и даст безлимит на маркетплейсах. Ладно, окей, это просто скидка, без остального, но хорошая.
