Собрал все рабочие команды, которые мы проверяли на сервере. Здесь — как запустить Ollama, скачать модели, настроить контекст и подключить Open WebUI.
curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl start ollama
sudo systemctl enable ollama
sudo systemctl status ollama
OLLAMA_HOST=0.0.0.0 OLLAMA_KEEP_ALIVE=86400 ollama serve &
ollama pull qwen3-vl:30b-a3b-instruct
ollama pull qwen3:30b-a3b
ollama pull qwen3:8b
ollama pull снова.
Ollama продолжит с того же места.
curl -s http://localhost:11434/api/generate -d '{
"model": "qwen3-vl:30b-a3b-instruct",
"prompt": "test",
"keep_alive": 86400,
"options": {"num_ctx": 16384},
"stream": false
}' > /dev/null &
curl -s http://localhost:11434/api/generate -d '{
"model": "qwen3:30b-a3b",
"prompt": "test",
"keep_alive": 86400,
"options": {"num_ctx": 8192},
"stream": false
}' > /dev/null &
curl -s http://localhost:11434/api/generate -d '{
"model": "qwen3:8b",
"prompt": "test",
"keep_alive": 86400,
"options": {"num_ctx": 4096},
"stream": false
}' > /dev/null &
ollama runollama run qwen3-vl:30b-a3b-instruct &
ollama list
ollama ps
free -h
curl -s http://localhost:11434/api/generate -d '{
"model": "qwen3-vl:30b-a3b-instruct",
"prompt": "unload",
"keep_alive": 0,
"stream": false
}' > /dev/null
sudo systemctl stop ollama
pkill ollama
sudo docker run -d \
-p 3000:8080 \
-e OLLAMA_BASE_URL=http://10.10.33.170:11434 \
-e WEBUI_SECRET_KEY=my-secret-key-123 \
-v open-webui:/app/backend/data \
--name open-webui \
ghcr.io/open-webui/open-webui:main
sudo docker ps
sudo docker logs open-webui --tail 30
sudo docker stop open-webui
sudo docker rm open-webui
sudo docker volume rm open-webui
# Запустить заново
http://IP-сервера:3000http://10.10.33.170:11434ollama list появятся в выпадающем списке чата.
┌─────────────────────────────────┬───────────┬────────────┬──────────┐
│ Модель │ Размер │ Контекст │ Для чего │
├─────────────────────────────────┼───────────┼────────────┼──────────┤
│ qwen3-vl:30b-a3b-instruct │ 19 ГБ │ 16384 │ Картинки │
│ qwen3:30b-a3b │ 18 ГБ │ 8192 │ Текст │
│ qwen3:8b │ 5.2 ГБ │ 4096 │ Быстро │
└─────────────────────────────────┴───────────┴────────────┴──────────┘
# Запустить Ollama с контекстом 16384
OLLAMA_NUM_CTX=16384 ollama serve &
# Скачать VL-модель
ollama pull qwen3-vl:30b-a3b-instruct
# Загрузить VL в память с контекстом
curl -s http://localhost:11434/api/generate -d '{
"model": "qwen3-vl:30b-a3b-instruct",
"prompt": "test",
"keep_alive": 86400,
"options": {"num_ctx": 16384},
"stream": false
}' > /dev/null &
# Проверить, что в памяти
ollama ps
# Выгрузить модель
curl -s http://localhost:11434/api/generate -d '{
"model": "qwen3-vl:30b-a3b-instruct",
"prompt": "unload",
"keep_alive": 0,
"stream": false
}' > /dev/null
Комментарии
Пока нет комментариев. Будьте первым!