Files
qwen38-flash-next-dgx-spark/docs/troubleshooting.md

38 lines
2.1 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 故障排查与上游依据
## 原 Qwen3.6 升级后启动失败
旧部署使用主模型 marlin、MTP triton,但 V2 runner 曾未正确应用 draft MoE backend。
对应修复:[vLLM #54788](https://github.com/vllm-project/vllm/pull/54788)
[GB10 复现评论](https://github.com/vllm-project/vllm/pull/54788#issuecomment-5554777896)。
不能把所有 NVFP4/MTP 错误都归为同一问题;本项目 NVIDIA Flash Next 的 MTP 是 block FP8。
对应加载支持修复:[vLLM #55513](https://github.com/vllm-project/vllm/pull/55513)。
固定 nightly 已包含这些代码;本项目没有把主、草稿模型强制绑定同一 MoE backend。
## 模型下载超时
先确认 `.env` 中 MODEL_HTTP_PROXY / MODEL_HTTPS_PROXY 是否沿用了可用代理。
下载容器单独使用这些变量,HF 缓存写入主机;服务以 HF_HUB_OFFLINE=1 读取固定 revision。
不要为网络故障修改推理参数。已有权重需要位于正确的 HF snapshot 目录并具备完整 blob 链接。
## 权重加载慢
本模型约 123.57 GiB,首次主模型加载约 9 分钟,MTP 再约 1 分钟。
healthcheck 的 start_period 为 30 分钟。用 `docker compose logs -f vllm` 确认分片进度。
如果出现异常退出,先读堆栈;不要只依赖自动重启或盲目提高内存比例。
## 内存不足或变慢
先看主机 `free -h``vmstat 1`,再看服务日志的 KV 分配和 PLE gather 时间。
不要只看 Docker stats,也不要把 available 当作完全空闲。
确认没有旧模型或其他 GPU 容器并行运行。默认 0.80 留给页缓存的空间有实际用途。
必要时使用 `scripts/start.sh baseline` 回退,再逐项增加配置。
## 更新 nightly
不要只改镜像 tag。先核对 ngram_embedding 接口和两处 FLA 源码结构,重跑 adapter GPU 测试、
启动测试和实际问答。Dockerfile 对被替换的内容使用断言,接口变化应让构建失败以便审查。
社区适配来源:[blazux/qwen3.8-Flash-DGX](https://github.com/blazux/qwen3.8-Flash-DGX)。
本项目只使用其 mmap helper 和两项 FLA 修改,没有搬用所有社区优化。