40 lines
3.8 KiB
Markdown
40 lines
3.8 KiB
Markdown
# 上游证据与审计边界
|
||
|
||
检索日期:2026-09-21。本轮完成公开资料和issue初筛,**尚未完成候选引擎源码审计**,未运行第三方脚本。参考项目main/master会变化,GitHub API读取提交号本轮失败;以下为按日期记录的页面证据,不冒充固定SHA审计。部署前必须锁定引擎、补丁、量化文件revision及SHA256。
|
||
|
||
## 证据表
|
||
|
||
| 来源 | 核实内容 | 对本项目的意义 |
|
||
|---|---|---|
|
||
| [NVIDIA checkpoint](https://huggingface.co/nvidia/Qwen3.8-Flash-Next-NVFP4/tree/main) | 页面文件总量约133GB | 不能依靠16+32GB全部驻留 |
|
||
| [vLLM Marlin NVFP4](https://docs.vllm.ai/en/stable/api/vllm/model_executor/kernels/linear/nvfp4/marlin/) | 提供非原生FP4硬件的W4A16线性核路径 | Ada并非必然不能读取NVFP4,但全模型支持仍需核实 |
|
||
| [Flash-Next VRAM Benchmark](https://github.com/lukaLLM/Qwen3.8-Flash-Next-VRAM-Benchmark) | 低显存档最初使用约91GiB主机RAM;另有24GB显存档56/64GB内存限额测试,讨论lazy加载和CPU专家 | 有分层实现线索,没有本项目16GB+32GB完整证据;文中GPU是大卡限额,不能继承其速度 |
|
||
| [flash-next-8gb](https://github.com/lna-lab/flash-next-8gb) | 3.05bpw EXL3方案报告约47.8GiB cgroup内存;测试平台高端CPU及大内存 | 只看标题“8GB GPU”会漏掉主机内存要求;不是32GB方案 |
|
||
| [issue #1](https://github.com/lna-lab/flash-next-8gb/issues/1) | 用户报告5700X3D、64GB DDR4、4070 SUPER、Windows 11约3.5tok/s | 非4070TiSUPER、非32GB,也不是严格对照;说明CPU与平台差异不可忽略 |
|
||
| [llama.cpp](https://github.com/ggml-org/llama.cpp) | 支持CPU/GPU混合推理基础能力 | 不能据此推导Flash-Next全部特殊算子及多模态已通过 |
|
||
|
||
阅读了lna-lab issue列表及#1。另一参考项目issue列表本轮抓取失败,不声称没有问题。没有找到经过核实、精确匹配4070TiSUPER+32GB+完整Flash-Next多模态的验收报告。
|
||
|
||
## 初筛决定
|
||
|
||
- 保留上述两条低显存方案为审计候选,不复制Dockerfile、启动脚本或镜像。
|
||
- 参考README中的lazy-mode和专家层参数是候选版本线索,不作为已核实的本仓库启动命令。
|
||
- 社区README中的绝对表述需独立验证,例如“磁盘表不需要内存”不符合页缓存实际语义;网络文件系统是否可mmap也不能一概否定。
|
||
- 当前官方NVFP4配置只作为精度/能力参考,不能直接缩小gpu_memory_utilization后宣称能跑。
|
||
- GGUF/EXL3衍生版本来源和质量必须单独验收。用户要Flash-Next,不更换为27B或14B模型。
|
||
|
||
## 下一阶段源码审计清单
|
||
|
||
1. 从维护者仓库固定SHA,记录许可证、依赖、补丁及镜像digest。
|
||
2. 检查加载器是否mmap后又完整复制、解量化或锁页;记录worker与加载临时峰值。
|
||
3. 检查PLE地址计算、FP8/量化scale、稀疏查询批量化、边界处理;禁止因省内存静默丢精度。
|
||
4. 检查专家路由、CPU/GPU分层与张量生命周期,证实专家可分页且不会全量pinned。
|
||
5. 审计Ada编译目标、MoE、QSA、循环状态和视觉算子,单核正确不等于端到端正确。
|
||
6. 检查聊天模板、reasoning字段、工具调用、图片及视频预处理兼容;文本接口可用不能替代多模态验收。
|
||
7. 查所有相关开放/关闭issues及修复PR的实际合入SHA,不靠版本名称判断。
|
||
8. 自行编写最小启动配置;不运行curl管道安装、无版本依赖或来源不明二进制。
|
||
|
||
## 已有项目的适用范围
|
||
|
||
已有[6000D项目](https://git.bunnyruihan.com:16666/ruihan/qwen38-flash-next-rtx6000d)和[Spark项目](https://git.bunnyruihan.com:16666/ruihan/qwen38-flash-next-dgx-spark)仅用于测试方法和模型能力参考。6000D的CPU驻留PLE依赖充足内存,Spark统一内存与独显PCIe体系不同。本轮未刷新两台服务的实时状态。
|