Document long-context limits and host OOM at near-262K input
This commit is contained in:
@@ -77,6 +77,12 @@ docker compose stop vllm
|
||||
可用 `scripts/test-adapter.sh` 单独执行,需要真实 CUDA GPU 和额外内存。
|
||||
该测试通过不代表完整模型的 CUDA Graph 已验证。
|
||||
|
||||
## 长上下文实测边界
|
||||
|
||||
64K、128K 的单请求合成检索在 eager 和 CUDA Graph 下均通过;接近 260K 时两组均发生主机 OOM,
|
||||
即使 eager 返回正确答案也不能视为稳定通过。当前 262144 配置上限不是容量保证。
|
||||
详见 [长上下文测试报告](docs/context262k-results.md),其中包含资源证据、受影响服务和恢复记录。
|
||||
|
||||
## 文件说明
|
||||
|
||||
- `Dockerfile`:固定基础镜像,安装 PLE 适配、两项 GB10 FLA 修改及 Mamba 缓存块对齐修正。
|
||||
|
||||
Reference in New Issue
Block a user