Enable validated prefix caching and record DGX Spark optimization benchmarks

This commit is contained in:
2026-09-17 22:09:58 +08:00
parent 5f3030260e
commit 1e2f48d1a4
28 changed files with 707 additions and 8 deletions
+19 -3
View File
@@ -3,6 +3,8 @@
在单台 NVIDIA DGX SparkGB10 / ARM64 / 128 GB 统一内存)上部署
`nvidia/Qwen3.8-Flash-Next-NVFP4` 的可复现配置。
来自 2026-09-17 的实际部署:262144 上下文上限、MTP 2 tokens、OpenAI 兼容 API。
优化版启用经验证的前缀缓存,保持 eager 执行;32K 重复前缀首个 token 约从 14.05 秒降至 1.34 秒。
这里的首个 token 包括思考内容,完整回答不会因此保证快 10 倍。详见 [优化报告](docs/optimization-results.md)。
PLE 查找表通过磁盘映射按需读取;原始模型权重未重新量化。
> 这是针对固定 nightly 的社区适配,非 NVIDIA/vLLM 官方支持方案。
@@ -44,7 +46,7 @@ API 地址:`http://<Spark-IP>:8000/v1`;模型名:`qwen3.8-flash-next`。
| GPU 内存比例 | 0.80 |
| KV 精度 | auto(本配置为 BF16 |
| 执行 | eager,未启用 CUDA Graph |
| Prefix caching | 关闭 |
| Prefix caching | 开启,含 Mamba 块对齐修正 |
| API | 8000,启用密钥、reasoning parser、工具调用 |
| 自动重启 | unless-stopped |
@@ -62,7 +64,9 @@ docker compose stop vllm
./scripts/start.sh baseline
./scripts/wait.sh
./scripts/test.sh
# 恢复默认 262K + MTP
# 保持 262K + MTP,只关闭前缀缓存
./scripts/start.sh no-prefix
# 恢复默认 262K + MTP + 前缀缓存
./scripts/start.sh
```
@@ -75,10 +79,12 @@ docker compose stop vllm
## 文件说明
- `Dockerfile`:固定基础镜像,安装 PLE 适配两项 GB10 FLA 修改。
- `Dockerfile`:固定基础镜像,安装 PLE 适配两项 GB10 FLA 修改及 Mamba 缓存块对齐修正
- `patches/`:针对当前 nightly 的适配层。
- `vendor/`:保持原样的社区 mmap 代码及许可证。
- `configs/baseline-32k.yaml`:基础配置的 Compose override。
- `docs/optimization-results.md`:基准比较、缓存正确性与未采用的图执行实验。
- `experiments/graph/`:未采用为默认的图执行实现与复现说明。
- `docs/validation.md`:实测结果和未验证边界。
- `docs/troubleshooting.md`:故障依据、上游修复与排查步骤。
- `docs/provenance.md`:模型/镜像/第三方源码的固定版本和校验值。
@@ -86,3 +92,13 @@ docker compose stop vllm
`.env`、密钥、权重、日志、运行缓存均不提交。仓库不包含模型权重;模型使用条件以
[NVIDIA 模型页](https://huggingface.co/nvidia/Qwen3.8-Flash-Next-NVFP4) 为准。
第三方代码按其原许可证使用,见 [第三方声明](THIRD_PARTY_NOTICES.md)。
## 复测优化
```bash
./scripts/benchmark.sh current > benchmark.jsonl
python3 scripts/summarize-benchmark.py benchmark.jsonl
./scripts/test-prefix.sh
```
测试只使用合成输入。方法、首字时间口径与小样本限制见 docs/benchmark-method.md。