Files
qwen38-flash-next-rtx6000d/audit/results.md
T

3.2 KiB
Raw Blame History

实机验收:2026-09-18

机器:172.16.104.92RTX 6000D 85651 MiB 显存、247 GiB 主机内存、16 vCPU、VMware。驱动 595.91.07。锁页内存 H2D 复制实测 57.81 GB/s,不能用虚拟 PCIe 链路显示值代替实测。

最终基线

128K131072 token)、FP8 KV、FULL CUDA Graph capture size 1、单活动请求、2048 prefill batch、GPU memory utilization 0.96;保留视觉编码器;不开 MTP。PLE 日志确认 weight_dtype=torch.float8_e4m3fn, weight_device=cpu, pinned=True

模型 GPU 加载约 73.77 GiB。Graph 配置 KV 预算约 3.27 GiB,日志容量 218453 token;这不改变服务设置的 131072 token 上限。CUDA Graph 捕获成功,实际捕获日志约 0.05 GiB。KV 容量和显存预算不能直接外推为多请求或更大视频安全容量。

正确性检查

  • 官方 PLE 组件测试:24 passed26 deselected(未运行 fused 子集)。
  • 官方 QSA sparse paged attention 数值测试:14 passed58 deselected。
  • 11 个模型 safetensors SHA256 全部匹配,合计约 123.568 GiB。
  • 文字:中文固定回复、17×19;工具调用:get_weather/Shanghai,均通过。
  • 图片:红色合成图识别通过。
  • 视频:3 秒、9 帧红→绿→蓝视频识别通过。
  • 32K BF16 eager、128K FP8 eager、128K FP8 Graph 三阶段验收通过。
  • 128K Graph 检索实际输入 127988 token:首次首 token 14.141 秒、总计 14.887 秒;相同前缀复用首 token 0.454 秒、总计 1.214 秒。首 token 包含思考输出。

CUDA Graph 对照

同一编程提示,temperature 0、seed 6000、reasoning_effort low,强制 256 个输出 token(含 212 个思考 token)。每组一次预热、三次测量,单请求,无 MTP。

模式 解码速度中位数 首 token 中位数
eager 22.002 token/s 0.111 秒
FULL Graph 77.115 token/s 0.070 秒

3.505 倍。解码口径为 (completion_tokens - 1) / (响应结束 - 首 token)。固定长度用于公平计时,输出被截断,不作为该编程题质量评价。128K 首次预填充时间两组约 14.14 秒,Graph 提升主要出现在本次解码测试,不能解释为所有工作负载都提速 3.5 倍。

六次计时的正文和思考文本完全一致。最终启动后再次通过中文、数学、工具调用测试,内网健康接口 200、无鉴权模型接口 401,容器 healthy、自动重启策略 unless-stopped。最终监测 788 个采样中主机可用内存最低 172.743 GiB,未触发内存保护,主机 OOM kill 计数 0。

原始回执保存在 runtime/;服务器完整测试记录位于 /data/flash-next/audit/data/flash-next/logs

运维结论与边界

已修复缺失的 nvidia-utils-595-server,加载当前内核 NVIDIA 模块;CUDA 运算通过,无需为此次部署立即重启宿主机。已删除旧 MinerU/27B 相关容器、镜像和指定模型目录。

本次验收覆盖基本多模态、长输入检索、前缀复用和短时性能对照;没有完成长时间压力、并发请求或真实业务综合质量评估。默认不开 MTP,保留多模态及上下文预算。后续升级镜像、改变并发或启用 MTP 均需重新验收。