Files
qwen38-flash-next-rtx6000d/audit/results.md
T

42 lines
3.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 实机验收:2026-09-18
机器:172.16.104.92RTX 6000D 85651 MiB 显存、247 GiB 主机内存、16 vCPU、VMware。驱动 595.91.07。锁页内存 H2D 复制实测 57.81 GB/s,不能用虚拟 PCIe 链路显示值代替实测。
## 最终基线
128K131072 token)、FP8 KV、FULL CUDA Graph capture size 1、单活动请求、2048 prefill batch、GPU memory utilization 0.96;保留视觉编码器;不开 MTP。PLE 日志确认 `weight_dtype=torch.float8_e4m3fn, weight_device=cpu, pinned=True`
模型 GPU 加载约 73.77 GiB。Graph 配置 KV 预算约 3.27 GiB,日志容量 218453 token;这不改变服务设置的 131072 token 上限。CUDA Graph 捕获成功,实际捕获日志约 0.05 GiB。KV 容量和显存预算不能直接外推为多请求或更大视频安全容量。
## 正确性检查
- 官方 PLE 组件测试:24 passed26 deselected(未运行 fused 子集)。
- 官方 QSA sparse paged attention 数值测试:14 passed58 deselected。
- 11 个模型 safetensors SHA256 全部匹配,合计约 123.568 GiB。
- 文字:中文固定回复、17×19;工具调用:get_weather/Shanghai,均通过。
- 图片:红色合成图识别通过。
- 视频:3 秒、9 帧红→绿→蓝视频识别通过。
- 32K BF16 eager、128K FP8 eager、128K FP8 Graph 三阶段验收通过。
- 128K Graph 检索实际输入 127988 token:首次首 token 14.141 秒、总计 14.887 秒;相同前缀复用首 token 0.454 秒、总计 1.214 秒。首 token 包含思考输出。
## CUDA Graph 对照
同一编程提示,temperature 0、seed 6000、reasoning_effort low,强制 256 个输出 token(含 212 个思考 token)。每组一次预热、三次测量,单请求,无 MTP。
| 模式 | 解码速度中位数 | 首 token 中位数 |
|---|---:|---:|
| eager | 22.002 token/s | 0.111 秒 |
| FULL Graph | 77.115 token/s | 0.070 秒 |
**3.505 倍**。解码口径为 `(completion_tokens - 1) / (响应结束 - 首 token)`。固定长度用于公平计时,输出被截断,不作为该编程题质量评价。128K 首次预填充时间两组约 14.14 秒,Graph 提升主要出现在本次解码测试,不能解释为所有工作负载都提速 3.5 倍。
六次计时的正文和思考文本完全一致。最终启动后再次通过中文、数学、工具调用测试,内网健康接口 200、无鉴权模型接口 401,容器 healthy、自动重启策略 unless-stopped。最终监测 788 个采样中主机可用内存最低 172.743 GiB,未触发内存保护,主机 OOM kill 计数 0。
原始回执保存在 `runtime/`;服务器完整测试记录位于 `/data/flash-next/audit``/data/flash-next/logs`
## 运维结论与边界
已修复缺失的 `nvidia-utils-595-server`,加载当前内核 NVIDIA 模块;CUDA 运算通过,无需为此次部署立即重启宿主机。已删除旧 MinerU/27B 相关容器、镜像和指定模型目录。
本次验收覆盖基本多模态、长输入检索、前缀复用和短时性能对照;没有完成长时间压力、并发请求或真实业务综合质量评估。默认不开 MTP,保留多模态及上下文预算。后续升级镜像、改变并发或启用 MTP 均需重新验收。