主题
OpenUI + Ollama Qwen 27B (128K) 部署指南
模型: Ollama qwen3.6:27b-128k (27.8B 参数, Q4_K_M 量化, 17GB, 128K 上下文) GPU: AMD Radeon RX 7900 XTX (24GB VRAM, Vulkan) 节点: szb122009 (192.168.122.9 / 10.20.24.225) 公网: ai-ear.cn:9011 (FRP 隧道 → 8.153.84.140) 最后更新: 2026-08-23
架构概览
用户浏览器
│
▼ http://ai-ear.cn:9011 (DNS → 8.153.84.140)
│ https://ai-ear.cn:9011 (需 Traefik ep9011)
┌──────────────────────────────────────────────┐
│ 公网服务器 (8.153.84.140) │
│ frps (:7000) → 直接转发 :9011 │
│ Traefik (:443) → ep9011 → svc-19011 │
│ → http://127.0.0.1:9011 │
└──────────────────┬───────────────────────────┘
│ frp tunnel (remotePort 9011)
▼
┌──────────────────────────────────────────────┐
│ szb122009 (192.168.122.9) │
│ frpc-openui → remotePort 9011 │
│ │
│ ┌──────────────────┐ ┌──────────────────┐ │
│ │ Docker: OpenUI │ │ Ollama (systemd) │ │
│ │ ghcr.io/wandb/ │ │ 0.0.0.0:11434 │ │
│ │ openui:latest │◄───│ │ │
│ │ :7878 │ │ qwen3.6:27b-128k │ │
│ └──────────────────┘ │ (17GB, 128K ctx) │ │
│ │ qwen3.6:27b │ │
│ │ qwen3.6:35b │ │
│ └──────────────────┘ │
│ AMD RX 7900 XTX 24GB │
└──────────────────────────────────────────────┘访问地址
| 方式 | URL | 状态 |
|---|---|---|
| 本地直连 | http://localhost:7878 | ✅ 可用 |
| 公网 HTTP | http://ai-ear.cn:9011 | ✅ 可用 |
| 公网 HTTPS | https://ai-ear.cn:9011 | ⚠️ 需配置 Traefik |
快速操作
bash
# 一键启动所有服务
bash deploy-openui.sh start
# 查看状态
bash deploy-openui.sh status
# 查看日志
bash deploy-openui.sh logs
# 停止服务
bash deploy-openui.sh stop
# 更新 OpenUI 到最新版本
bash deploy-openui.sh update文件清单
| 文件 | 用途 |
|---|---|
docker-compose.yml | OpenUI Docker 容器配置 |
deploy-openui.sh | 本地部署/运维脚本 |
Modelfile.qwen3.6-27b-128k | 优化模型配置 (128K 上下文) |
setup-public-server.sh | 公网服务器 Traefik 配置脚本 |
traefik-openui-patch.yaml | Traefik 配置补丁说明 |
配置文件位置
| 配置 | 路径 |
|---|---|
| FRP 客户端 | /home/xxx/config/frp/frpc-openui.toml |
| FRP systemd | ~/.config/systemd/user/frpc-openui.service |
| Ollama systemd | ~/.config/systemd/user/ollama.service |
| Traefik (公网) | /etc/traefik/traefik.yaml (8.153.84.140) |
| Traefik 动态 | /etc/traefik/dynamic.yaml (8.153.84.140) |
手动操作步骤
1. 启动/停止 OpenUI 容器
bash
cd /home/xxx/docs/docs/ai-ear-website/worker/apps/k8s-gpu/uat2-gpu/openui-deploy
# 启动
docker compose up -d
# 停止
docker compose down
# 查看日志
docker compose logs -f
# 重启
docker compose restart2. 管理 FRP 隧道
bash
# 启动
systemctl --user start frpc-openui
# 停止
systemctl --user stop frpc-openui
# 查看状态
systemctl --user status frpc-openui
# 查看日志
journalctl --user -u frpc-openui -f3. 管理 Ollama
bash
# 查看模型
ollama list
# 拉取新模型
ollama pull <model_name>
# 查看运行中的模型
ollama ps
# 测试模型
ollama run qwen3.6:35b "你好"公网服务器 HTTPS 配置 (可选)
如需启用 https://ai-ear.cn:9011,需要在公网服务器上执行:
bash
# SSH 到公网服务器
ssh root@8.153.84.140
# 1. 在 /etc/traefik/traefik.yaml 中添加:
# ep9011:
# address: ":9011"
# 2. 在 /etc/traefik/dynamic.yaml 的 http.routers 中添加:
# svc-9011:
# entryPoints: [ep9011]
# rule: "Host(`ai-ear.cn`)"
# service: svc-19011
# tls: {}
# 3. 在 /etc/traefik/dynamic.yaml 的 http.services 中添加:
# svc-19011:
# loadBalancer:
# servers:
# - url: "http://127.0.0.1:9011"
# 4. 重启 Traefik
systemctl restart traefik或运行自动脚本:
bash
bash setup-public-server.sh在 OpenUI 中选择 Qwen 27B 模型
- 打开 http://ai-ear.cn:9011
- 点击左下角齿轮图标 (Settings)
- 在 Model 下拉框中选择 Ollama 分类
- 选择
qwen3.6:27b-128k - 开始使用!
注意: 首次使用 qwen3.6:27b-128k 时,Ollama 需要加载模型到显存 (~22.6GB), 可能需要等待 30-60 秒。后续请求会更快。
故障排查
OpenUI 无法连接 Ollama
bash
# 检查 Ollama 是否运行
systemctl --user status ollama
# 检查 Ollama 端口
ss -tlnp | grep 11434
# 从容器内测试连接
docker exec openui python3 -c "
import urllib.request
r = urllib.request.urlopen('http://172.17.0.1:11434/api/tags')
print(r.read().decode()[:200])
"FRP 隧道断开
bash
# 检查 FRP 状态
systemctl --user status frpc-openui
# 查看日志
journalctl --user -u frpc-openui --since "1 hour ago"
# 重启
systemctl --user restart frpc-openui公网无法访问
bash
# 测试 FRP 隧道
curl -v http://8.153.84.140:9011
# 检查本地端口
ss -tlnp | grep 7878
# 检查 FRP Dashboard
# http://8.153.84.140:7500 (admin / xxx)模型加载慢/OOM
bash
# 查看 GPU 使用情况
rocm-smi
# 查看 Ollama 日志
journalctl --user -u ollama -f
# 如果 OOM,考虑使用更小的模型:
# ollama pull qwen3.5:9b-q4_K_M (6.6GB)
# ollama pull qwen2.5:7b (4.7GB)性能参考
| 模型 | 大小 | VRAM 占用 | 上下文 | 生成速度 (估算) |
|---|---|---|---|---|
| qwen3.6:27b-128k | 17GB | ~22.6GB | 128K | ~8-15 tok/s |
| qwen3.6:27b | 17GB | ~22.6GB | 默认 | ~8-15 tok/s |
| qwen3.6:35b | 23GB | ~23GB | 默认 | ~5-10 tok/s |
| qwen3:30b-instruct | 18GB | ~18GB | 默认 | ~8-15 tok/s |
| qwen3.5:9b-q4_K_M | 6.6GB | ~7GB | 默认 | ~20-30 tok/s |
| qwen2.5:7b | 4.7GB | ~5GB | 默认 | ~25-40 tok/s |
实际速度取决于 GPU 利用率和上下文长度。qwen3.6:27b-128k 得益于 MoE 架构 (仅 3B 激活参数) 和混合注意力 (仅 1/4 层使用传统 KV Cache),在 128K 上下文下仍有良好的生成速度。