Files
qwen38-flash-next-dgx-spark/docs/main-baseline-migration.md
T

3.0 KiB
Raw Blame History

main 基线整理与 Spark 迁移(2026-09-18

将此前的前缀缓存优化、CUDA Graph 对照、长上下文容量边界和 Nsight 证据整理到同一条 main。 默认部署收敛为 131072 总 tokens、eager、MTP=2、BF16 KV、前缀缓存开启、GPU memory=0.80。 不把接近 260K 已触发主机 OOM 的配置继续作为默认基线。

配置与文档

  • 默认及 no-prefix 配置限制为 128Kbaseline 保留 32K / 无 MTP。
  • 可选图实验配置同样限制为 128K,仍不作为默认。
  • 固定容器名 qwen38-flash-vllm,与现有监控和部署兼容。
  • README、文档索引和运维说明描述当前状态;历史报告保留当时参数并显式标记。
  • Git 忽略本机 .env、archive、.local-state、原始 Nsight / SQLite 和 bundleDocker 构建白名单不包含它们。

Spark 整理

在原部署目录初始化 Git,保留原模型缓存、编译缓存、代理和 secret 挂载。 已验证新旧服务环境变量完全一致,内存限制一致;命令只改变上下文上限。 通过本地 git bundle 同步仓库,没有将工作站 Gitea token 安装到 Spark。

  • 23 个旧部署文件归档到 archive/<时间>/legacy/
  • 历史 optimization-results 移到 archive/<时间>/experiments/,含原始 trace 和失败样本。
  • 本任务 /tmp/qwen38* 临时打包/构建检查文件归档到 archive/<时间>/tmp/
  • archive、.local-state 权限 0700,本机 .env 权限 0600。
  • 两个已停止的下载容器在保存日志后删除。
  • 移除五个过时实验/打包验证镜像标签;共享层仍可能被保留,不将标签显示大小当作释放空间。
  • 保留正在使用的 eager 镜像、固定 base、32K 回退所需原镜像和 prefix2 图候选。
  • 原 MinerU 两个容器及 qwen36 继续保持停止状态,其镜像与数据保留。

验证

Python AST、Shell bash -n、git diff --check 通过。 Spark 默认、no-prefix、32K baseline、prefix graph 四套 Compose 解析通过。 仓库没有 CI workflow / runs,因此不声称存在 CI 通过记录。

2026-09-18 01:49Asia/Shanghai)运行验收通过:

  • 服务 healthyrestart policy 为 unless-stoppedAPI 上限确认 131072。
  • 算术、中文、自动工具调用 smoke 全部通过。
  • 前缀缓存专项通过,prefix hit 增量 24000 tokens。
  • 127987-token 合成输入(另预留 2048 输出)首次和重复检索均正确并正常 stop。 首 token 分别约 62.01 秒和 1.81 秒,重复请求 prefix hit 为 124800 tokens。
  • 部署与验收采样最低 MemAvailable 16.777 GiBoom_kill 从 25 到 25,无新增 OOM。
  • 系统及用户 failed units 均为 0。

验收运行的配置提交为 e290793;此后的整理只增加文档与证据,不改变部署配置。 结构化验证记录长输入请求记录 和同目录 smoke/prefix/资源日志均保留。 这是单请求有限验收,不代表多路满长并发、长期压力或全部真实任务已经验证。