Set 128K eager baseline and organize deployment documentation
This commit is contained in:
+3
-1
@@ -1,5 +1,7 @@
|
||||
# 验证记录
|
||||
|
||||
> 历史实验记录:保留当时的配置和恢复状态。当前部署已改为 128K eager 基线,见 [当前状态](README.md)。
|
||||
|
||||
日期:2026-09-17。硬件为单台 DGX Spark / GB10,ARM64,121 GiB 可见内存。
|
||||
系统 DGX OS 7.6,内核 7.0.0-1019-nvidia,驱动 580.173.02,驱动支持 CUDA 13.0。
|
||||
版本见 provenance.md;这不是可泛化到所有 nightly 或所有 GPU 的结果。
|
||||
@@ -26,7 +28,7 @@ completion tokens 包括思考 token。以上是小样本验证,不是性能
|
||||
后者不是“两个满长度请求已压测”的承诺。实际可用空间随运行环境变化。
|
||||
主模型选择 FLASHINFER_CUTLASS;FP8 MTP 选择 DEEPGEMM,实测推理成功。
|
||||
|
||||
## 未验证
|
||||
## 当时未验证(后续进展见文档索引)
|
||||
|
||||
- 完整 262144-token 请求及长时间高并发压力。
|
||||
- 多模态输入、完整模型 CUDA Graph 和 prefix caching。
|
||||
|
||||
Reference in New Issue
Block a user