Files
qwen38-flash-next-rtx4070tis/docs/upstream-review.md
T

3.8 KiB
Raw Blame History

上游证据与审计边界

检索日期:2026-09-21。本轮完成公开资料和issue初筛,尚未完成候选引擎源码审计,未运行第三方脚本。参考项目main/master会变化,GitHub API读取提交号本轮失败;以下为按日期记录的页面证据,不冒充固定SHA审计。部署前必须锁定引擎、补丁、量化文件revision及SHA256。

证据表

来源 核实内容 对本项目的意义
NVIDIA checkpoint 页面文件总量约133GB 不能依靠1632GB全部驻留
vLLM Marlin NVFP4 提供非原生FP4硬件的W4A16线性核路径 Ada并非必然不能读取NVFP4,但全模型支持仍需核实
Flash-Next VRAM Benchmark 低显存档最初使用约91GiB主机RAM;另有24GB显存档56/64GB内存限额测试,讨论lazy加载和CPU专家 有分层实现线索,没有本项目16GB+32GB完整证据;文中GPU是大卡限额,不能继承其速度
flash-next-8gb 3.05bpw EXL3方案报告约47.8GiB cgroup内存;测试平台高端CPU及大内存 只看标题“8GB GPU”会漏掉主机内存要求;不是32GB方案
issue #1 用户报告5700X3D、64GB DDR4、4070 SUPER、Windows 11约3.5tok/s 非4070TiSUPER、非32GB,也不是严格对照;说明CPU与平台差异不可忽略
llama.cpp 支持CPU/GPU混合推理基础能力 不能据此推导Flash-Next全部特殊算子及多模态已通过

阅读了lna-lab issue列表及#1。另一参考项目issue列表本轮抓取失败,不声称没有问题。没有找到经过核实、精确匹配4070TiSUPER32GB+完整Flash-Next多模态的验收报告。

初筛决定

  • 保留上述两条低显存方案为审计候选,不复制Dockerfile、启动脚本或镜像。
  • 参考README中的lazy-mode和专家层参数是候选版本线索,不作为已核实的本仓库启动命令。
  • 社区README中的绝对表述需独立验证,例如“磁盘表不需要内存”不符合页缓存实际语义;网络文件系统是否可mmap也不能一概否定。
  • 当前官方NVFP4配置只作为精度/能力参考,不能直接缩小gpu_memory_utilization后宣称能跑。
  • GGUF/EXL3衍生版本来源和质量必须单独验收。用户要Flash-Next,不更换为27B或14B模型。

下一阶段源码审计清单

  1. 从维护者仓库固定SHA,记录许可证、依赖、补丁及镜像digest。
  2. 检查加载器是否mmap后又完整复制、解量化或锁页;记录worker与加载临时峰值。
  3. 检查PLE地址计算、FP8/量化scale、稀疏查询批量化、边界处理;禁止因省内存静默丢精度。
  4. 检查专家路由、CPU/GPU分层与张量生命周期,证实专家可分页且不会全量pinned。
  5. 审计Ada编译目标、MoE、QSA、循环状态和视觉算子,单核正确不等于端到端正确。
  6. 检查聊天模板、reasoning字段、工具调用、图片及视频预处理兼容;文本接口可用不能替代多模态验收。
  7. 查所有相关开放/关闭issues及修复PR的实际合入SHA,不靠版本名称判断。
  8. 自行编写最小启动配置;不运行curl管道安装、无版本依赖或来源不明二进制。

已有项目的适用范围

已有6000D项目Spark项目仅用于测试方法和模型能力参考。6000D的CPU驻留PLE依赖充足内存,Spark统一内存与独显PCIe体系不同。本轮未刷新两台服务的实时状态。