# 实机验收:2026-09-18 机器:172.16.104.92,RTX 6000D 85651 MiB 显存、247 GiB 主机内存、16 vCPU、VMware。驱动 595.91.07。锁页内存 H2D 复制实测 57.81 GB/s,不能用虚拟 PCIe 链路显示值代替实测。 ## 最终基线 128K(131072 token)、FP8 KV、FULL CUDA Graph capture size 1、单活动请求、2048 prefill batch、GPU memory utilization 0.96;保留视觉编码器;不开 MTP。PLE 日志确认 `weight_dtype=torch.float8_e4m3fn, weight_device=cpu, pinned=True`。 模型 GPU 加载约 73.77 GiB。Graph 配置 KV 预算约 3.27 GiB,日志容量 218453 token;这不改变服务设置的 131072 token 上限。CUDA Graph 捕获成功,实际捕获日志约 0.05 GiB。KV 容量和显存预算不能直接外推为多请求或更大视频安全容量。 ## 正确性检查 - 官方 PLE 组件测试:24 passed,26 deselected(未运行 fused 子集)。 - 官方 QSA sparse paged attention 数值测试:14 passed,58 deselected。 - 11 个模型 safetensors SHA256 全部匹配,合计约 123.568 GiB。 - 文字:中文固定回复、17×19;工具调用:get_weather/Shanghai,均通过。 - 图片:红色合成图识别通过。 - 视频:3 秒、9 帧红→绿→蓝视频识别通过。 - 32K BF16 eager、128K FP8 eager、128K FP8 Graph 三阶段验收通过。 - 128K Graph 检索实际输入 127988 token:首次首 token 14.141 秒、总计 14.887 秒;相同前缀复用首 token 0.454 秒、总计 1.214 秒。首 token 包含思考输出。 ## CUDA Graph 对照 同一编程提示,temperature 0、seed 6000、reasoning_effort low,强制 256 个输出 token(含 212 个思考 token)。每组一次预热、三次测量,单请求,无 MTP。 | 模式 | 解码速度中位数 | 首 token 中位数 | |---|---:|---:| | eager | 22.002 token/s | 0.111 秒 | | FULL Graph | 77.115 token/s | 0.070 秒 | 约 **3.505 倍**。解码口径为 `(completion_tokens - 1) / (响应结束 - 首 token)`。固定长度用于公平计时,输出被截断,不作为该编程题质量评价。128K 首次预填充时间两组约 14.14 秒,Graph 提升主要出现在本次解码测试,不能解释为所有工作负载都提速 3.5 倍。 六次计时的正文和思考文本完全一致。最终启动后再次通过中文、数学、工具调用测试,内网健康接口 200、无鉴权模型接口 401,容器 healthy、自动重启策略 unless-stopped。最终监测 788 个采样中主机可用内存最低 172.743 GiB,未触发内存保护,主机 OOM kill 计数 0。 原始回执保存在 `runtime/`;服务器完整测试记录位于 `/data/flash-next/audit` 和 `/data/flash-next/logs`。 ## 运维结论与边界 已修复缺失的 `nvidia-utils-595-server`,加载当前内核 NVIDIA 模块;CUDA 运算通过,无需为此次部署立即重启宿主机。已删除旧 MinerU/27B 相关容器、镜像和指定模型目录。 本次验收覆盖基本多模态、长输入检索、前缀复用和短时性能对照;没有完成长时间压力、并发请求或真实业务综合质量评估。默认不开 MTP,保留多模态及上下文预算。后续升级镜像、改变并发或启用 MTP 均需重新验收。