Files
qwen38-flash-next-dgx-spark/docs/validation.md
T

37 lines
1.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 验证记录
日期:2026-09-17。硬件为单台 DGX Spark / GB10ARM64121 GiB 可见内存。
系统 DGX OS 7.6,内核 7.0.0-1019-nvidia,驱动 580.173.02,驱动支持 CUDA 13.0。
版本见 provenance.md;这不是可泛化到所有 nightly 或所有 GPU 的结果。
## 原部署的实测结果
| 配置/测试 | 结果 |
|---|---|
| 32K / 不启用 MTP / eager | 成功启动 |
| 32K17 × 19 | 3233.66 秒,56 completion tokens |
| 32K:中文解释天空颜色 | 正常,5.19 秒,81 completion tokens |
| 262K 上限 / MTP 2 / eager | 成功启动,健康检查通过 |
| MTP17 × 19 | 3232.40 秒,56 completion tokens |
| MTP:中文解释天空颜色 | 正常,5.46 秒,150 completion tokens |
| 自动工具调用 | get_weathercity=上海,约 2.25 秒 |
| 局域网健康检查 | HTTP 200 |
| 适配层 CUDA 测试 | PASS,逐字节 FP8 查表及缩放一致 |
| 适配层 torch.compile 测试 | COMPILE_PASS |
completion tokens 包括思考 token。以上是小样本验证,不是性能基准;不同回答长度不能直接比较速度。
测试工具调用只检查模型产生的结构化调用,不访问真实天气服务。
262K 配置日志:模型权重 76.36 GiBKV 缓存 14.52 GiB,报告 524288 总 token 容量;
后者不是“两个满长度请求已压测”的承诺。实际可用空间随运行环境变化。
主模型选择 FLASHINFER_CUTLASSFP8 MTP 选择 DEEPGEMM,实测推理成功。
## 未验证
- 完整 262144-token 请求及长时间高并发压力。
- 多模态输入、完整模型 CUDA Graph 和 prefix caching。
- 其他 GPU、其他模型 revision、其他 nightly、ETP > 1。
- 重启机器后的恢复耗时(已设置 unless-stopped,但未为测试重启机器)。
仓库整理后的构建/配置验证另记录于 packaging-validation.md。