Qualify and enable MTP 2 with paired workload evidence and fallback

This commit is contained in:
2026-09-18 22:37:54 +08:00
parent 06bcbcfd4e
commit 918b78a3b8
31 changed files with 3376 additions and 7 deletions
+9 -4
View File
@@ -1,6 +1,6 @@
# Qwen3.8 Flash-Next on RTX 6000D
2026-09-18 已完成部署和验收。保留文字、图片、视频能力;采用 NVIDIA NVFP4 权重、原生 FP8 PLE 主机内存卸载、FP8 KV、128K 上下文及 FULL CUDA Graph。单个活动请求,MTP 暂不启用
2026-09-18 已完成部署和验收。保留文字、图片、视频能力;采用 NVIDIA NVFP4 权重、原生 FP8 PLE 主机内存卸载、FP8 KV、128K 上下文及 FULL CUDA Graph。单个活动请求,**MTP 2 已通过扩展配对验证并启用**,GPU 预算为 0.985
社区代码经过审计后仅作为参考,没有执行社区启动脚本或使用社区镜像。审计范围和取舍见 [源码审计](audit/source-review.md),实测数据见 [验收结果](audit/results.md)。
@@ -8,7 +8,8 @@
- `compose.yaml``Dockerfile`:已验收部署配置与固定镜像。
- `patches/`:最小补丁、精确源码保护及许可证。
- [MTP 实测](docs/mtp-test.md):约 1.93 倍短输出吞吐,需要更高显存预算,暂不设为默认
- [MTP 完整验证](docs/mtp-qualification.md):长解码提升约 58%–67%,98 个负载请求及两组各 7 个质量任务通过;包含缓存延迟取舍
- [MTP 初测记录](docs/mtp-test.md):历史短测试和当时的暂缓决定,已由完整验证更新。
- [部署心得](docs/lessons.md):取舍、踩坑、优化方向及升级方法。
- `scripts/`:功能、上下文、速度和资源验证工具。
- `audit/runtime/`2026-09-18 历史原始回执,不代表实时状态。
@@ -30,7 +31,7 @@ cd /data/flash-next/project
python3 - <<'PY'
import json, urllib.request
from pathlib import Path
body = {'model': 'qwen3.8-flash-next', 'messages': [{'role': 'user', 'content': '你好,请介绍一下自己。'}], 'max_tokens': 1024, 'reasoning_effort': 'low'}
body = {'model': 'qwen3.8-flash-next', 'messages': [{'role': 'user', 'content': '你好,请介绍一下自己。'}], 'max_tokens': 1024, 'reasoning_effort': 'medium'}
req = urllib.request.Request('http://127.0.0.1:8000/v1/chat/completions', data=json.dumps(body).encode(), headers={'Content-Type': 'application/json', 'Authorization': 'Bearer '+Path('secrets/api-key').read_text().strip()})
print(json.load(urllib.request.urlopen(req, timeout=180)))
PY
@@ -73,4 +74,8 @@ python3 scripts/long_context.py --tokens 128000 --output /data/flash-next/audit/
python3 scripts/benchmark.py --output /data/flash-next/audit/benchmark-new.jsonl
```
脚本拒绝覆盖同名结果。长上下文验证为固定位置检索及前缀复用;多模态验证为合成图片和短视频;不代表综合质量评测或长期压力测试。当前基线优先单请求和多模态能力,额外并发、MTP、更长视频应另行测试。
脚本拒绝覆盖同名结果。长上下文验证为固定位置检索及前缀复用;多模态验证为合成图片和短视频;不代表综合质量评测或长期压力测试。当前基线优先单请求和多模态能力,额外并发、更大或更长视频应另行测试。
## 默认配置与回退
当前 `compose.yaml` 为 MTP 2,实际运行器使用 FULL_DECODE_ONLY Graph。`compose.baseline.yaml` 保留无 MTP 的 0.96 GPU 预算配置。长生成优先使用 MTP;大上下文反复短问答可能更适合无 MTP,因为可复用 KV 容量更大。切换方法和完整证据见 [MTP 完整验证](docs/mtp-qualification.md)。