Set 128K eager baseline and organize deployment documentation
This commit is contained in:
@@ -2,7 +2,8 @@
|
||||
|
||||
在单台 NVIDIA DGX Spark(GB10 / ARM64 / 128 GB 统一内存)上部署
|
||||
`nvidia/Qwen3.8-Flash-Next-NVFP4` 的可复现配置。
|
||||
来自 2026-09-17 的实际部署:262144 上下文上限、MTP 2 tokens、OpenAI 兼容 API。
|
||||
当前基线:131072 tokens 总上下文上限(输入 + 输出)、MTP 2 tokens、OpenAI 兼容 API。
|
||||
由 2026-09-17 至 18 日的实测选定;262K 已因主机 OOM 从默认配置撤下。
|
||||
优化版启用经验证的前缀缓存,保持 eager 执行;32K 重复前缀首个 token 约从 14.05 秒降至 1.34 秒。
|
||||
这里的首个 token 包括思考内容,完整回答不会因此保证快 10 倍。详见 [优化报告](docs/optimization-results.md)。
|
||||
PLE 查找表通过磁盘映射按需读取;原始模型权重未重新量化。
|
||||
@@ -39,7 +40,7 @@ API 地址:`http://<Spark-IP>:8000/v1`;模型名:`qwen3.8-flash-next`。
|
||||
|
||||
| 参数 | 设置 |
|
||||
|---|---|
|
||||
| 上下文上限 | 262144 tokens |
|
||||
| 上下文上限 | 131072 tokens,输入与输出合计 |
|
||||
| MTP | 2 speculative tokens |
|
||||
| 同时调度请求数 | 4 |
|
||||
| 批处理 token 上限 | 2048 |
|
||||
@@ -64,9 +65,9 @@ docker compose stop vllm
|
||||
./scripts/start.sh baseline
|
||||
./scripts/wait.sh
|
||||
./scripts/test.sh
|
||||
# 保持 262K + MTP,只关闭前缀缓存
|
||||
# 保持 128K + MTP,只关闭前缀缓存
|
||||
./scripts/start.sh no-prefix
|
||||
# 恢复默认 262K + MTP + 前缀缓存
|
||||
# 恢复默认 128K + MTP + 前缀缓存
|
||||
./scripts/start.sh
|
||||
```
|
||||
|
||||
@@ -80,7 +81,7 @@ docker compose stop vllm
|
||||
## 长上下文实测边界
|
||||
|
||||
64K、128K 的单请求合成检索在 eager 和 CUDA Graph 下均通过;接近 260K 时两组均发生主机 OOM,
|
||||
即使 eager 返回正确答案也不能视为稳定通过。当前 262144 配置上限不是容量保证。
|
||||
即使 eager 返回正确答案也不能视为稳定通过。默认已限制为 131072;这仍不是多路满长并发或长期稳定性的保证。
|
||||
详见 [长上下文测试报告](docs/context262k-results.md),其中包含资源证据、受影响服务和恢复记录。
|
||||
|
||||
## 文件说明
|
||||
@@ -114,3 +115,8 @@ python3 scripts/summarize-benchmark.py benchmark.jsonl
|
||||
|
||||
Nsight 已确认图重放生效,短回答约提升 4.5%;长输入预填充未被当前小尺寸图覆盖,
|
||||
GPU 活动本已接近连续。详见 [性能剖析报告](docs/cuda-graph-profile.md),包括 PLE 等待/查表区分及原始证据摘要。
|
||||
|
||||
## 运维与证据入口
|
||||
|
||||
[当前基线与文档索引](docs/README.md) · [Spark 目录、归档与更新流程](docs/operations.md)。
|
||||
历史报告保留测试当时的 262K 参数;它们不覆盖当前默认配置。
|
||||
|
||||
Reference in New Issue
Block a user