Files
qwen38-flash-next-dgx-spark/docs/troubleshooting.md

2.1 KiB
Raw Permalink Blame History

故障排查与上游依据

原 Qwen3.6 升级后启动失败

旧部署使用主模型 marlin、MTP triton,但 V2 runner 曾未正确应用 draft MoE backend。 对应修复:vLLM #54788 GB10 复现评论。 不能把所有 NVFP4/MTP 错误都归为同一问题;本项目 NVIDIA Flash Next 的 MTP 是 block FP8。 对应加载支持修复:vLLM #55513。 固定 nightly 已包含这些代码;本项目没有把主、草稿模型强制绑定同一 MoE backend。

模型下载超时

先确认 .env 中 MODEL_HTTP_PROXY / MODEL_HTTPS_PROXY 是否沿用了可用代理。 下载容器单独使用这些变量,HF 缓存写入主机;服务以 HF_HUB_OFFLINE=1 读取固定 revision。 不要为网络故障修改推理参数。已有权重需要位于正确的 HF snapshot 目录并具备完整 blob 链接。

权重加载慢

本模型约 123.57 GiB,首次主模型加载约 9 分钟,MTP 再约 1 分钟。 healthcheck 的 start_period 为 30 分钟。用 docker compose logs -f vllm 确认分片进度。 如果出现异常退出,先读堆栈;不要只依赖自动重启或盲目提高内存比例。

内存不足或变慢

先看主机 free -hvmstat 1,再看服务日志的 KV 分配和 PLE gather 时间。 不要只看 Docker stats,也不要把 available 当作完全空闲。 确认没有旧模型或其他 GPU 容器并行运行。默认 0.80 留给页缓存的空间有实际用途。 必要时使用 scripts/start.sh baseline 回退,再逐项增加配置。

更新 nightly

不要只改镜像 tag。先核对 ngram_embedding 接口和两处 FLA 源码结构,重跑 adapter GPU 测试、 启动测试和实际问答。Dockerfile 对被替换的内容使用断言,接口变化应让构建失败以便审查。

社区适配来源:blazux/qwen3.8-Flash-DGX。 本项目只使用其 mmap helper 和两项 FLA 修改,没有搬用所有社区优化。