3.8 KiB
3.8 KiB
上游证据与审计边界
检索日期:2026-09-21。本轮完成公开资料和issue初筛,尚未完成候选引擎源码审计,未运行第三方脚本。参考项目main/master会变化,GitHub API读取提交号本轮失败;以下为按日期记录的页面证据,不冒充固定SHA审计。部署前必须锁定引擎、补丁、量化文件revision及SHA256。
证据表
| 来源 | 核实内容 | 对本项目的意义 |
|---|---|---|
| NVIDIA checkpoint | 页面文件总量约133GB | 不能依靠16+32GB全部驻留 |
| vLLM Marlin NVFP4 | 提供非原生FP4硬件的W4A16线性核路径 | Ada并非必然不能读取NVFP4,但全模型支持仍需核实 |
| Flash-Next VRAM Benchmark | 低显存档最初使用约91GiB主机RAM;另有24GB显存档56/64GB内存限额测试,讨论lazy加载和CPU专家 | 有分层实现线索,没有本项目16GB+32GB完整证据;文中GPU是大卡限额,不能继承其速度 |
| flash-next-8gb | 3.05bpw EXL3方案报告约47.8GiB cgroup内存;测试平台高端CPU及大内存 | 只看标题“8GB GPU”会漏掉主机内存要求;不是32GB方案 |
| issue #1 | 用户报告5700X3D、64GB DDR4、4070 SUPER、Windows 11约3.5tok/s | 非4070TiSUPER、非32GB,也不是严格对照;说明CPU与平台差异不可忽略 |
| llama.cpp | 支持CPU/GPU混合推理基础能力 | 不能据此推导Flash-Next全部特殊算子及多模态已通过 |
阅读了lna-lab issue列表及#1。另一参考项目issue列表本轮抓取失败,不声称没有问题。没有找到经过核实、精确匹配4070TiSUPER+32GB+完整Flash-Next多模态的验收报告。
初筛决定
- 保留上述两条低显存方案为审计候选,不复制Dockerfile、启动脚本或镜像。
- 参考README中的lazy-mode和专家层参数是候选版本线索,不作为已核实的本仓库启动命令。
- 社区README中的绝对表述需独立验证,例如“磁盘表不需要内存”不符合页缓存实际语义;网络文件系统是否可mmap也不能一概否定。
- 当前官方NVFP4配置只作为精度/能力参考,不能直接缩小gpu_memory_utilization后宣称能跑。
- GGUF/EXL3衍生版本来源和质量必须单独验收。用户要Flash-Next,不更换为27B或14B模型。
下一阶段源码审计清单
- 从维护者仓库固定SHA,记录许可证、依赖、补丁及镜像digest。
- 检查加载器是否mmap后又完整复制、解量化或锁页;记录worker与加载临时峰值。
- 检查PLE地址计算、FP8/量化scale、稀疏查询批量化、边界处理;禁止因省内存静默丢精度。
- 检查专家路由、CPU/GPU分层与张量生命周期,证实专家可分页且不会全量pinned。
- 审计Ada编译目标、MoE、QSA、循环状态和视觉算子,单核正确不等于端到端正确。
- 检查聊天模板、reasoning字段、工具调用、图片及视频预处理兼容;文本接口可用不能替代多模态验收。
- 查所有相关开放/关闭issues及修复PR的实际合入SHA,不靠版本名称判断。
- 自行编写最小启动配置;不运行curl管道安装、无版本依赖或来源不明二进制。
已有项目的适用范围
已有6000D项目和Spark项目仅用于测试方法和模型能力参考。6000D的CPU驻留PLE依赖充足内存,Spark统一内存与独显PCIe体系不同。本轮未刷新两台服务的实时状态。