Ollama на своём VPS: локальные LLM без ChatGPT
Как поднять Ollama на VPS и запускать Llama, Mistral и другие модели локально. Установка, выбор железа, API и интеграция без зависимости от облачных сервисов.
Зависимость от ChatGPT и Claude удобна, пока не встаёт вопрос конфиденциальности, стоимости или доступности API в вашем регионе. Ollama решает это просто: один бинарник на Linux, pull модели одной командой, REST API из коробки. Развернуть всё на своём VPS — значит получить полный контроль над данными и предсказуемый бюджет.
Для pet-проекта, внутреннего чат-бота или экспериментов с RAG облачный VPS за 15–30 €/мес часто достаточен. Главное — правильно подобрать конфигурацию и не пытаться запустить 70B-модель на двух ядрах.
Что такое Ollama и зачем VPS
Ollama — runtime для open-source LLM. Он скачивает квантизированные веса (GGUF), управляет памятью и отдаёт OpenAI-совместимый API на порту 11434. На VPS вы получаете:
- постоянный endpoint для приложений и скриптов;
- изоляцию: промпты не уходят третьим сторонам;
- возможность держать несколько моделей и переключаться через
ollama run.
Облачные GPU-сервисы (RunPod, Vast.ai) подойдут для тяжёлых моделей, но для 7B–13B достаточно обычного VPS с 16–32 GB RAM.
Выбор VPS и моделей
Ориентиры по железу:
- 7B (Q4): 8 GB RAM, 4 vCPU — минимум для комфортной работы;
- 13B: 16 GB RAM;
- 34B+: 32 GB RAM или GPU-инстанс.
Популярные модели для старта:
- Llama 3.2 / 3.1 8B — баланс скорости и качества;
- Mistral 7B — хорош для кода и кратких ответов;
- Qwen 2.5 — сильная мультиязычность, включая русский;
- DeepSeek Coder — если нужен локальный ассистент для разработки.
На CPU inference медленный (5–15 токенов/сек), но для фоновых задач — генерация описаний, классификация, черновики — этого хватает.
Установка на Ubuntu VPS
Подключитесь по SSH и выполните:
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl enable ollama
sudo systemctl start ollama
ollama pull llama3.2
ollama run llama3.2
Для Docker (удобно на продакшен-VPS):
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
docker exec -it ollama ollama pull mistral
Безопасность: не открывайте 11434 в интернет без reverse proxy и авторизации. Используйте Nginx + basic auth или VPN (WireGuard). Ollama слушает localhost — проброс через SSH-туннель тоже рабочий вариант для личного доступа.
API и интеграция в проекты
Ollama принимает запросы на /api/generate и /api/chat. Пример из Python:
import requests
r = requests.post("http://localhost:11434/api/chat", json={
"model": "llama3.2",
"messages": [{"role": "user", "content": "Объясни, что такое VPS"}],
"stream": False
})
print(r.json()["message"]["content"])
Многие фреймворки (LangChain, LlamaIndex) поддерживают Ollama как backend. Для Open WebUI или LibreChat на том же VPS получите готовый веб-интерface без подписки.
Полезные команды:
ollama list— установленные модели;ollama ps— активные сессии;ollama rm model— удалить модель и освободить диск.
Оптимизация и типичные проблемы
- Мало RAM — OOM-killer убивает процесс; берите меньшую квантизацию (Q4_K_M вместо Q8).
- Медленный диск — модели 4–8 GB; NVMe на VPS заметно ускоряет первый запуск.
- Swap — добавьте 8 GB swap как подстраховку, но не рассчитывайте на него постоянно.
- Мониторинг —
htop, логиjournalctl -u ollama; алерты по RAM через Prometheus/node_exporter.
Если нагрузка растёт, масштабируйте вертикально (больше RAM) или вынесите inference на отдельный GPU-VPS, а API-шлюз оставьте на дешёвом инстансе.
Итог
Ollama на своём VPS — практичный способ получить локальные LLM без ChatGPT: данные остаются у вас, API простой, модели меняются одной командой. Начните с 8B-модели на VPS с 16 GB RAM, закройте порт от публики и подключите приложение через HTTP. Дальше — тонкая настройка промптов, RAG по вашим документам и при необходимости переход на GPU-облако для больших моделей.
Рекомендуем прочитать
- Как программисты используют ИИ каждый день: 15 реальных сценариев
- Cursor, Claude Code или ChatGPT: что выбрать программисту в 2026 году
- MCP для разработчиков: что это и зачем подключать к Cursor
- Как уменьшить расходы на VPS и облако: 12 рабочих способов
- VPS в Европе или России: что выбрать для проекта
- Как превратить идею в работающий сервис за один вечер
Частые вопросы
Сколько RAM нужно для Ollama на VPS?
7B модели — от 8 ГБ RAM. 13B — от 16 ГБ. Для CPU-only inference закладывайте запас.
Нужна ли GPU для Ollama?
Не обязательно, но GPU сильно ускоряет ответы. На CPU модели работают медленнее, но стабильно.






