Files

22 lines
1.2 KiB
Markdown

# 长上下文容量测试
先读 `../../docs/context262k-plan.md``../../docs/context262k-results.md`
历史 262K 配置在接近 260K 发生过主机 OOM;不要把完整测试当作无风险的日常健康检查。
当前默认服务已限制为 131072,因此不能直接运行整套历史测试,也不应为复现而随意放宽上限。
实际测试客户端为 `../../scripts/context-benchmark.py`,在已部署的容器内运行:
```bash
python3 context-benchmark.py prepare --data /tmp/context262k-data
python3 context-benchmark.py run --data /tmp/context262k-data --label eager
```
`prepare` 仅生成合成数据和计数,不进行长文推理;`run` 从 64K 逐级运行至约 260K。
本次正式数据已归档,通常应直接阅读结果,不重复运行。
`monitor-original.py` 是当时使用的资源监控。`monitor.py` 为事故后改进版本,
仅完成语法检查,加入主机 OOM 计数和更早的内存阈值。
监控脚本将停止名为 `qwen38-flash-vllm` 的测试容器,必须与备份、异常恢复流程配套,不能单独保证安全。
目录中的 `monitor.stop` 会停止采样,`GUARD_STOP` 表示触发保护;不要复用含旧状态文件的运行目录。