Qwen3.8-27B-Heretic + MTP 部署总结
日期:2026-08-25 | 目标:MTP 提升 tg 速度
一、硬件与模型
| 项目 | 配置 |
|---|---|
| GPU | 2×V100 16GB NVLink(32GB) |
| 引擎 | llama.cpp(llama-server) |
| 主模型 | Qwen3.8-27B-heretic-ara-Q4_K_M-MTP.gguf |
| 上下文 | 202144(~200K) |
二、MTP 配置(最终版)
spec-type = draft-mtpspec-draft-n-max = 2 (✅ 最优值)
其他参数:ctx-size=202144, parallel=3, flash-attn=on, reasoning=on, reasoning-budget=1024
三、测试结果对比
| max | 接受率 | tg 速度 | draft 长度 | 显存 |
|---|---|---|---|---|
| 10 | — | — | — | ❌ OOM |
| 5 | 48-59% | 43-50 t/s | 3.4-3.96 | ✅ |
| 3 | 58-68% | 47-50 t/s | 2.76-3.03 | ✅ |
| 2 | 72-73% | 47-53 t/s | 2.45-2.46 | ✅ |
| 无推测 | — | 15-35 t/s | — | ✅ |
四、关键发现
- max 越小 → 接受率越高 → 速度越快(max=2 接受率 73%,max=5 仅 48%)
- MTP 需要带 MTP 层的模型(普通 GGUF 报错:model doesn't contain MTP layers)
- DFlash 与当前 llama.cpp 不兼容(tensor 数量 mismatch:expected 81, got 58)
- Abliterated + MTP 兼容性良好(接受率 72-73%,接近理论值)
五、性能总结
| 方案 | tg 速度 | 加速比 | 状态 |
|---|---|---|---|
| 无推测 | 15-35 t/s | 1x | 基线 |
| MTP max=2 | 47-53 t/s | 1.5-2x | ✅ 最终配置 |
| DFlash(理论) | 50-120 t/s | ~3.7x | ⚠️ 待兼容 |
六、启动命令
pkill -f llama-servernohup llama-server --models-preset ~/gguf/0410.ini --host 0.0.0.0 --port 8080 --api-key-file ~/gguf/apikey.txt > ~/gguf/llama_server.log 2>&1 &
七、待办
- 解决 DFlash tensor 兼容性(更新 llama.cpp 或重新转换 GGUF)
- 长期目标:DFlash 3.7x > MTP 1.5-2x
- 监控显存,确认 max=2 长期稳定