26 lines
2.0 KiB
Markdown
26 lines
2.0 KiB
Markdown
# 接近 262K 上下文测试方案
|
|
|
|
执行顺序:当前 eager + prefix cache → CUDA Graph + prefix cache → 恢复当前 eager。
|
|
模型、nightly、MTP=2、BF16 KV、GPU memory=0.80、batch tokens=2048、max_num_seqs=4 不变。
|
|
仅串行单请求;不代表四路同时支持 262K。
|
|
|
|
- 输入档位(含聊天模板):约 65536、131072、260000 tokens。
|
|
- 每档两份固定种子合成档案,每份在约 5%、50%、95% 位置放置三个唯一项目预算。
|
|
- 顺序查询前、中、后,再原样重复前部问题;每组共 24 次主请求。
|
|
- 输出预算 2048(思考和正文合计),temperature=0、seed=42、reasoning_effort=low。
|
|
- 使用固定 revision tokenizer 构造,并通过服务端 /tokenize 预检;实际 usage 为最终计数依据。
|
|
- 相同文档/问题在两种执行模式间必须有相同哈希与 token 预算。
|
|
- 每份新文档有独立前缀;记录每次真实 prefix hit 增量,不清 OS 页缓存。
|
|
- 记录答案精确匹配、结束原因、思考 token、TTFT(含思考)、正文首 token、总耗时、token usage。
|
|
- 每 5 秒记录主机 MemAvailable、swap 存量及 pswpin/pswpout 累计量、内存压力、容器状态。
|
|
- 服务崩溃/OOM、单请求超过 20 分钟,或 MemAvailable 连续约 30 秒低于 4 GiB 且同期换页超过 512 MiB:停止更高档,恢复默认服务。
|
|
- 答错或长度截断只复核一次同一请求,首试结果仍保留;服务稳定时继续高档以观察能力边界。
|
|
- 结束做健康与算术/中文/工具调用 smoke 检查。结果和脚本提交已有 Gitea 优化分支。
|
|
|
|
这是有限合成检索和容量测试,不等同于真实业务质量、长期稳定性、多模态或全长并发验收。
|
|
|
|
## 执行后修订
|
|
|
|
原停止条件未覆盖先发生的主机进程 OOM,不能作为充分保护。后续保护改为同时检查主机 OOM 计数,
|
|
并在 MemAvailable 低于 2 GiB 持续约 5 秒时停止;完整发现见 [结果报告](context262k-results.md)。
|