Enable validated prefix caching and record DGX Spark optimization benchmarks
This commit is contained in:
@@ -18,7 +18,8 @@ Linux 页缓存保留访问过的数据,未命中才访问 SSD。此方式不
|
||||
而不是追求 100% 内存占用。社区默认同样为 0.80,但社区性能数字不是此配置的测试结果。
|
||||
|
||||
完整 PLE 运算包含 GPU 同步,日志中的 op 总时长不能全部归因于磁盘;分析时应区分 gather 与 gpu-wait。
|
||||
当前使用 eager 执行,未开启 prefix caching,也没有采用社区可选的二次 FP8 量化或词表裁剪。
|
||||
当前使用 eager 执行,优化版开启经过 Mamba 块对齐修正的 prefix caching;没有采用二次 FP8 量化或词表裁剪。
|
||||
原基线的内存数字见上文;优化版本次启动 KV 约 15.11 GiB,可用主机内存约 18 GiB,随页缓存状态变化。
|
||||
|
||||
来源:[社区方案](https://github.com/blazux/qwen3.8-Flash-DGX)、
|
||||
[Linux 内存指标](https://docs.kernel.org/filesystems/proc.html)。
|
||||
|
||||
Reference in New Issue
Block a user