Files
qwen38-flash-next-dgx-spark/docs/validation.md
T

2.0 KiB
Raw Blame History

验证记录

历史实验记录:保留当时的配置和恢复状态。当前部署已改为 128K eager 基线,见 当前状态

日期:2026-09-17。硬件为单台 DGX Spark / GB10ARM64121 GiB 可见内存。 系统 DGX OS 7.6,内核 7.0.0-1019-nvidia,驱动 580.173.02,驱动支持 CUDA 13.0。 版本见 provenance.md;这不是可泛化到所有 nightly 或所有 GPU 的结果。

原部署的实测结果

配置/测试 结果
32K / 不启用 MTP / eager 成功启动
32K17 × 19 3233.66 秒,56 completion tokens
32K:中文解释天空颜色 正常,5.19 秒,81 completion tokens
262K 上限 / MTP 2 / eager 成功启动,健康检查通过
MTP17 × 19 3232.40 秒,56 completion tokens
MTP:中文解释天空颜色 正常,5.46 秒,150 completion tokens
自动工具调用 get_weathercity=上海,约 2.25 秒
局域网健康检查 HTTP 200
适配层 CUDA 测试 PASS,逐字节 FP8 查表及缩放一致
适配层 torch.compile 测试 COMPILE_PASS

completion tokens 包括思考 token。以上是小样本验证,不是性能基准;不同回答长度不能直接比较速度。 测试工具调用只检查模型产生的结构化调用,不访问真实天气服务。

262K 配置日志:模型权重 76.36 GiBKV 缓存 14.52 GiB,报告 524288 总 token 容量; 后者不是“两个满长度请求已压测”的承诺。实际可用空间随运行环境变化。 主模型选择 FLASHINFER_CUTLASSFP8 MTP 选择 DEEPGEMM,实测推理成功。

当时未验证(后续进展见文档索引)

  • 完整 262144-token 请求及长时间高并发压力。
  • 多模态输入、完整模型 CUDA Graph 和 prefix caching。
  • 其他 GPU、其他模型 revision、其他 nightly、ETP > 1。
  • 重启机器后的恢复耗时(已设置 unless-stopped,但未为测试重启机器)。

仓库整理后的构建/配置验证另记录于 packaging-validation.md。