Как запустить локальный DeepSeek через Ollama за 15 минут: пошаговый разбор
Инструкция пригодится, если нужен ИИ-помощник по Python, Pandas и SQL, но отправлять код, схемы таблиц и выгрузки во внешние сервисы нельзя. По этому сценарию модель ставится на обычный ПК или ноутбук с Windows и отвечает локально: запросы уходят на адрес 127.0.0.1, а не в чужое облако. Разбор рассчитан на предпринимателя или системного администратора без опыта в машинном обучении. Все действия выполняются в PowerShell и укладываются в один вечер, из которого собственно запуск - около 15 минут. Способ сработает и для помощника по маркетингу и текстам, а не только по коду и данным. Сначала - блок про типичные ошибки: там про то, где локальная модель объективно слабее облачной.
Ниже - последовательность от проверки железа до встроенного в рабочий процесс помощника. Порядок важен: каждый шаг заканчивается проверкой результата. Если проверка не прошла, идти дальше нет смысла.
- Посчитайте бюджет памяти и диска. В «Диспетчере задач» → «Производительность» посмотрите объём оперативной памяти и свободное место. На 8 ГБ работает квантованная модель класса 7-8B, на 16 ГБ - она же с большим контекстом или модель 14B, на 32 ГБ - варианты крупнее. Так вы не скачаете версию, которая встанет колом.
- Уведите модели с системного диска. Создайте папку, например D:\ai\ollama-models, и задайте переменную окружения командой setx OLLAMA_MODELS "D:\ai\ollama-models", после чего перезапустите терминал. Файлы моделей не забьют диск C, из-за которого Windows начинает тормозить.
- Установите Ollama. Скачайте установщик для Windows с официального сайта ollama.com и запустите его: значок появится в системном трее, служба стартует автоматически. Проверка: в новом окне PowerShell команда ollama --version должна вернуть номер версии.
- Убедитесь, что локальный сервис слушает только ваш компьютер. По умолчанию API поднимается на 127.0.0.1 и порту 11434. Откройте в браузере http://localhost:11434: должно прийти служебное сообщение о том, что Ollama работает. Сервис жив и не выставлен наружу.
- Выберите версию DeepSeek под свою задачу. Для помощи с Python и SQL в большинстве случаев хватает младшей версии: крупная точнее, но требует больше памяти и отвечает заметно дольше. Скачивание запускается командой ollama pull с названием модели, прогресс виден в терминале.
- Проверьте, что модель встала корректно. Команда ollama list покажет модель в списке, ollama show - её размер, параметры и размер контекста. Вы видите, что скачалось, а не догадываетесь.
- Проведите первый диалог на реальной задаче. Запустите чат командой ollama run с названием модели и задайте не абстрактный, а свой рабочий вопрос: например, попросите объяснить, почему объединение двух таблиц в Pandas размножает строки, приложив фрагмент кода. Выход из чата - команда /bye. Ответ получен, ни один байт которого не ушёл с машины.
- Настройте размер контекста под свои файлы. Внутри чата выполните /set parameter num_ctx 8192, чтобы подложить в запрос кусок кода или схемы таблиц целиком. Учтите: чем больше контекст, тем больше памяти он съедает, и на слабой машине ответ начнёт «задумываться».
- Соберите собственный вариант модели с системным промптом. Создайте текстовый файл: базой указываете скачанную модель, задаёте температуру около 0.2 для технических ответов и системную инструкцию - кто модель, в каком формате отвечает, чего делать нельзя (например, не выдумывать имена функций и не менять данные без предупреждения). Командой ollama create дайте сборке своё имя. В списке появится настроенный вариант, который не нужно каждый раз задавать заново.
- Проверьте API - это то, ради чего всё затевалось. Отправьте POST-запрос на адрес локального сервиса с именем модели и текстом вопроса; в ответ придёт JSON с готовым текстом. Помощника можно вызывать не только в чате, но и из скриптов, планировщика и внутренних сервисов.
- Встройте модель в рабочее место. Самый быстрый путь - небольшой скрипт на Python, который берёт выделенный текст, отправляет его на локальный адрес и вставляет ответ обратно. Альтернативы: плагин автодополнения в редакторе кода или обращение из SQL-клиента, когда нужно расшифровать чужой запрос. Помощник стоит там, где вы работаете.
- Закройте доступ снаружи и проверьте брандмауэр. При первом запуске Windows спросит, разрешать ли приложению сетевой доступ: выбирайте частные сети и не открывайте общий доступ, если не собираетесь отдавать модель коллегам по локальной сети. Если общий доступ нужен, ограничьте круг адресов, а не открывайте порт всему интернету.
- Зафиксируйте рабочую конфигурацию и порядок обновления. Запишите в заметку версию модели, размер контекста и текст системного промпта. Модели не обновляются сами, новую версию скачивают отдельной командой. Проверьте, что после перезагрузки компьютера чат снова отвечает. Рабочий помощник воспроизводится за минуты, а не собирается заново с нуля.
Куда это встроить в бизнес-процесс. Быстрее всего помощник окупается на трёх операциях: разбор чужих SQL-запросов и медленных отчётов, объяснение ошибок в скриптах обработки выгрузок и генерация черновиков регулярной отчётности по известной схеме данных. Прежде чем ставить его отделу, замерьте, сколько минут в день сотрудник тратит на эти операции, и повторите замер через две недели. Если разница меньше получаса в день на человека, масштабировать не стоит: модель останется личным инструментом одного сотрудника. Есть и предел: модель отвечает по своим весам, а не по вашей документации, поэтому структуру ваших таблиц и правила нужно явно вкладывать в промпт, иначе она начнёт придумывать названия колонок.
Обсудить внедрение ИИ-агентов в вашем бизнесе
Расскажите о задаче — посчитаем, сколько часов и денег сэкономит агент.
Обсудить внедрение →