Set 128K eager baseline and organize deployment documentation

This commit is contained in:
2026-09-18 01:33:57 +08:00
parent d7e1e745c3
commit e290793f2b
15 changed files with 98 additions and 11 deletions
+3 -1
View File
@@ -1,5 +1,7 @@
# 验证记录
> 历史实验记录:保留当时的配置和恢复状态。当前部署已改为 128K eager 基线,见 [当前状态](README.md)。
日期:2026-09-17。硬件为单台 DGX Spark / GB10ARM64121 GiB 可见内存。
系统 DGX OS 7.6,内核 7.0.0-1019-nvidia,驱动 580.173.02,驱动支持 CUDA 13.0。
版本见 provenance.md;这不是可泛化到所有 nightly 或所有 GPU 的结果。
@@ -26,7 +28,7 @@ completion tokens 包括思考 token。以上是小样本验证,不是性能
后者不是“两个满长度请求已压测”的承诺。实际可用空间随运行环境变化。
主模型选择 FLASHINFER_CUTLASSFP8 MTP 选择 DEEPGEMM,实测推理成功。
## 未验证
## 当时未验证(后续进展见文档索引)
- 完整 262144-token 请求及长时间高并发压力。
- 多模态输入、完整模型 CUDA Graph 和 prefix caching。