Record successful 2048-token CUDA Graph retest and preserve failure samples
This commit is contained in:
@@ -8,7 +8,13 @@
|
||||
单流中位数 31.799 tokens/s,对比 eager 30.502,约 +4.3%。
|
||||
32K 重复请求用尽了最初设置的 256 输出 token(全部为 reasoning),未产生最终答案,
|
||||
导致该轮完整验收未通过并自动恢复 eager。不能据此断言模型算错或图执行有错误;
|
||||
图候选没有在提高输出预算后重跑。因此保留它作为实验,不宣传为已通过的优化。
|
||||
当时没有在提高输出预算后重跑,故该轮未通过验收。
|
||||
|
||||
后续将长输入预算提高为 2048,并让两组均启用前缀缓存后,图版本通过三轮基准及
|
||||
前缀复用、工具调用检查,短回答中位速度提升约 4.4%。详见
|
||||
[2048 复测报告](../../docs/cuda-graph-retest.md)。本目录仍不是默认部署。
|
||||
组合配置为 `compose.prefix.yaml`;`Dockerfile.prefix` 从当前 eager+前缀缓存镜像构建,
|
||||
需从仓库根目录指定 `-f experiments/graph/Dockerfile.prefix`。
|
||||
|
||||
原始结果:../../docs/results/graph2.jsonl。方法与限制:../../docs/benchmark-method.md。
|
||||
保持与主部署隔离,默认启动脚本不会启用此目录。
|
||||
|
||||
Reference in New Issue
Block a user