Set 128K eager baseline and organize deployment documentation
This commit is contained in:
@@ -1,5 +1,7 @@
|
||||
# CUDA Graph 2048 输出预算复测(2026-09-17)
|
||||
|
||||
> 历史实验记录:保留当时的配置和恢复状态。当前部署已改为 128K eager 基线,见 [当前状态](README.md)。
|
||||
|
||||
结论:CUDA Graph + 前缀缓存通过本轮三次完整基准及前缀正确性、工具调用检查。
|
||||
长输入未再发生输出预算截断,短回答生成速度中位数约提升 4.4%。
|
||||
本次按复测范围执行,默认部署仍保留 eager + 前缀缓存。
|
||||
|
||||
Reference in New Issue
Block a user