Files

18 lines
1.5 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# CUDA Graph 性能剖析方案(2026-09-18
目的:定位当前 CUDA Graph 约 4.4% 收益的限制,确认捕获范围与 PLE 图外路径的影响。
先采证据,再决定是否扩大图覆盖;不将推断写成瓶颈结论。
1. 小型 CUDA 程序验证主机 Nsight Systems 在当前镜像中可采集 CUDA 时间线。
2. 临时服务上下文上限 131072,串行输入不超过 128K;原镜像、模型、MTP=2、BF16 KV、内存比例 0.80 不变。
3. 对照 eager、小尺寸图 [1,2,4,8,12]。若证据支持,再试含 2048-token 预填充尺寸的图配置。
4. 固定合成短问答、8K/32K 首次/重复输入;记录延迟、输出/思考 tokens、PLE 分项计数、图重放和内存。
5. Nsight 使用 API 控制的短时间窗口,只采选定请求;计时基准在采样关闭时运行,trace 不作性能定量排名。
6. 用 CPU CUDA API、GPU 活动、同步、PLE 指标判断瓶颈;这些时间可能重叠,不简单相加当百分比。
7. 主机 OOM 计数增加、MemAvailable 单次低于 1 GiB 或持续低于 2 GiB 即停止。
保留并检查内核 OOM 日志;测试后恢复原服务和 smoke test。128K 仅在候选通过后做资源/正确性验证。
8. 原始大型 trace 留在 Spark,仓库保存方案、配置、脚本、摘要及证据索引,不提交凭据。
基础事实:当前图模式为 breakable PIECEWISEPLE 哈希+CPU mmap 查表在 eager break 中运行。
大于已捕获 token 数的 batch 无匹配图时回退无图执行。扩大图尺寸仍需实测兼容性与额外内存。