37 lines
1.8 KiB
Markdown
37 lines
1.8 KiB
Markdown
# 验证记录
|
||
|
||
日期:2026-09-17。硬件为单台 DGX Spark / GB10,ARM64,121 GiB 可见内存。
|
||
系统 DGX OS 7.6,内核 7.0.0-1019-nvidia,驱动 580.173.02,驱动支持 CUDA 13.0。
|
||
版本见 provenance.md;这不是可泛化到所有 nightly 或所有 GPU 的结果。
|
||
|
||
## 原部署的实测结果
|
||
|
||
| 配置/测试 | 结果 |
|
||
|---|---|
|
||
| 32K / 不启用 MTP / eager | 成功启动 |
|
||
| 32K:17 × 19 | 323,3.66 秒,56 completion tokens |
|
||
| 32K:中文解释天空颜色 | 正常,5.19 秒,81 completion tokens |
|
||
| 262K 上限 / MTP 2 / eager | 成功启动,健康检查通过 |
|
||
| MTP:17 × 19 | 323,2.40 秒,56 completion tokens |
|
||
| MTP:中文解释天空颜色 | 正常,5.46 秒,150 completion tokens |
|
||
| 自动工具调用 | get_weather,city=上海,约 2.25 秒 |
|
||
| 局域网健康检查 | HTTP 200 |
|
||
| 适配层 CUDA 测试 | PASS,逐字节 FP8 查表及缩放一致 |
|
||
| 适配层 torch.compile 测试 | COMPILE_PASS |
|
||
|
||
completion tokens 包括思考 token。以上是小样本验证,不是性能基准;不同回答长度不能直接比较速度。
|
||
测试工具调用只检查模型产生的结构化调用,不访问真实天气服务。
|
||
|
||
262K 配置日志:模型权重 76.36 GiB,KV 缓存 14.52 GiB,报告 524288 总 token 容量;
|
||
后者不是“两个满长度请求已压测”的承诺。实际可用空间随运行环境变化。
|
||
主模型选择 FLASHINFER_CUTLASS;FP8 MTP 选择 DEEPGEMM,实测推理成功。
|
||
|
||
## 未验证
|
||
|
||
- 完整 262144-token 请求及长时间高并发压力。
|
||
- 多模态输入、完整模型 CUDA Graph 和 prefix caching。
|
||
- 其他 GPU、其他模型 revision、其他 nightly、ETP > 1。
|
||
- 重启机器后的恢复耗时(已设置 unless-stopped,但未为测试重启机器)。
|
||
|
||
仓库整理后的构建/配置验证另记录于 packaging-validation.md。
|