# 验证记录 日期:2026-09-17。硬件为单台 DGX Spark / GB10,ARM64,121 GiB 可见内存。 系统 DGX OS 7.6,内核 7.0.0-1019-nvidia,驱动 580.173.02,驱动支持 CUDA 13.0。 版本见 provenance.md;这不是可泛化到所有 nightly 或所有 GPU 的结果。 ## 原部署的实测结果 | 配置/测试 | 结果 | |---|---| | 32K / 不启用 MTP / eager | 成功启动 | | 32K:17 × 19 | 323,3.66 秒,56 completion tokens | | 32K:中文解释天空颜色 | 正常,5.19 秒,81 completion tokens | | 262K 上限 / MTP 2 / eager | 成功启动,健康检查通过 | | MTP:17 × 19 | 323,2.40 秒,56 completion tokens | | MTP:中文解释天空颜色 | 正常,5.46 秒,150 completion tokens | | 自动工具调用 | get_weather,city=上海,约 2.25 秒 | | 局域网健康检查 | HTTP 200 | | 适配层 CUDA 测试 | PASS,逐字节 FP8 查表及缩放一致 | | 适配层 torch.compile 测试 | COMPILE_PASS | completion tokens 包括思考 token。以上是小样本验证,不是性能基准;不同回答长度不能直接比较速度。 测试工具调用只检查模型产生的结构化调用,不访问真实天气服务。 262K 配置日志:模型权重 76.36 GiB,KV 缓存 14.52 GiB,报告 524288 总 token 容量; 后者不是“两个满长度请求已压测”的承诺。实际可用空间随运行环境变化。 主模型选择 FLASHINFER_CUTLASS;FP8 MTP 选择 DEEPGEMM,实测推理成功。 ## 未验证 - 完整 262144-token 请求及长时间高并发压力。 - 多模态输入、完整模型 CUDA Graph 和 prefix caching。 - 其他 GPU、其他模型 revision、其他 nightly、ETP > 1。 - 重启机器后的恢复耗时(已设置 unless-stopped,但未为测试重启机器)。 仓库整理后的构建/配置验证另记录于 packaging-validation.md。