Ollama на своём VPS: локальные LLM без ChatGPT — иллюстрация к статье Storm Cloud Blog, категория Разработка
Ollama на своём VPS: локальные LLM без ChatGPT — иллюстрация к статье Storm Cloud Blog, категория Разработка
Разработка·3 мин··

Ollama на своём VPS: локальные LLM без ChatGPT

Как поднять Ollama на VPS и запускать Llama, Mistral и другие модели локально. Установка, выбор железа, API и интеграция без зависимости от облачных сервисов.

Зависимость от ChatGPT и Claude удобна, пока не встаёт вопрос конфиденциальности, стоимости или доступности API в вашем регионе. Ollama решает это просто: один бинарник на Linux, pull модели одной командой, REST API из коробки. Развернуть всё на своём VPS — значит получить полный контроль над данными и предсказуемый бюджет.

Для pet-проекта, внутреннего чат-бота или экспериментов с RAG облачный VPS за 15–30 €/мес часто достаточен. Главное — правильно подобрать конфигурацию и не пытаться запустить 70B-модель на двух ядрах.


Что такое Ollama и зачем VPS

Ollama — runtime для open-source LLM. Он скачивает квантизированные веса (GGUF), управляет памятью и отдаёт OpenAI-совместимый API на порту 11434. На VPS вы получаете:

  • постоянный endpoint для приложений и скриптов;
  • изоляцию: промпты не уходят третьим сторонам;
  • возможность держать несколько моделей и переключаться через ollama run.

Облачные GPU-сервисы (RunPod, Vast.ai) подойдут для тяжёлых моделей, но для 7B–13B достаточно обычного VPS с 16–32 GB RAM.


Выбор VPS и моделей

Ориентиры по железу:

  • 7B (Q4): 8 GB RAM, 4 vCPU — минимум для комфортной работы;
  • 13B: 16 GB RAM;
  • 34B+: 32 GB RAM или GPU-инстанс.

Популярные модели для старта:

  • Llama 3.2 / 3.1 8B — баланс скорости и качества;
  • Mistral 7B — хорош для кода и кратких ответов;
  • Qwen 2.5 — сильная мультиязычность, включая русский;
  • DeepSeek Coder — если нужен локальный ассистент для разработки.

На CPU inference медленный (5–15 токенов/сек), но для фоновых задач — генерация описаний, классификация, черновики — этого хватает.


Установка на Ubuntu VPS

Подключитесь по SSH и выполните:

curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable ollama
sudo systemctl start ollama
ollama pull llama3.2
ollama run llama3.2

Для Docker (удобно на продакшен-VPS):

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
docker exec -it ollama ollama pull mistral

Безопасность: не открывайте 11434 в интернет без reverse proxy и авторизации. Используйте Nginx + basic auth или VPN (WireGuard). Ollama слушает localhost — проброс через SSH-туннель тоже рабочий вариант для личного доступа.


API и интеграция в проекты

Ollama принимает запросы на /api/generate и /api/chat. Пример из Python:

import requests

r = requests.post("http://localhost:11434/api/chat", json={
    "model": "llama3.2",
    "messages": [{"role": "user", "content": "Объясни, что такое VPS"}],
    "stream": False
})
print(r.json()["message"]["content"])

Многие фреймворки (LangChain, LlamaIndex) поддерживают Ollama как backend. Для Open WebUI или LibreChat на том же VPS получите готовый веб-интерface без подписки.

Полезные команды:

  • ollama list — установленные модели;
  • ollama ps — активные сессии;
  • ollama rm model — удалить модель и освободить диск.

Оптимизация и типичные проблемы

  • Мало RAM — OOM-killer убивает процесс; берите меньшую квантизацию (Q4_K_M вместо Q8).
  • Медленный диск — модели 4–8 GB; NVMe на VPS заметно ускоряет первый запуск.
  • Swap — добавьте 8 GB swap как подстраховку, но не рассчитывайте на него постоянно.
  • Мониторингhtop, логи journalctl -u ollama; алерты по RAM через Prometheus/node_exporter.

Если нагрузка растёт, масштабируйте вертикально (больше RAM) или вынесите inference на отдельный GPU-VPS, а API-шлюз оставьте на дешёвом инстансе.


Итог

Ollama на своём VPS — практичный способ получить локальные LLM без ChatGPT: данные остаются у вас, API простой, модели меняются одной командой. Начните с 8B-модели на VPS с 16 GB RAM, закройте порт от публики и подключите приложение через HTTP. Дальше — тонкая настройка промптов, RAG по вашим документам и при необходимости переход на GPU-облако для больших моделей.

Частые вопросы

Сколько RAM нужно для Ollama на VPS?

7B модели — от 8 ГБ RAM. 13B — от 16 ГБ. Для CPU-only inference закладывайте запас.

Нужна ли GPU для Ollama?

Не обязательно, но GPU сильно ускоряет ответы. На CPU модели работают медленнее, но стабильно.