Flash-Next · RTX 4070 Ti SUPER 16GB / 32GB RAM

状态:架构与实验规划,尚未在目标硬件部署或完成推理测试。 2026-09-21。

唯一目标是运行 Qwen3.8-Flash-Next,保留文字、图片和视频能力;不以更小模型替代。RTX 4070 Ti SUPER、32GB 内存、2TB PCIe NVMe SSD 是用户指定的假设硬件,CPU、内存通道/频率、SSD 型号和系统尚未指定。

这里的“模拟”指容量预算与未来限额实验,不是用 RTX 6000D 冒充 4070 Ti SUPER 的性能测试。本次未修改 Spark 或 6000D 服务。

方案结论

  1. 架构采用 GPU 常驻计算部分+CPU 专家计算/缓存+NVMe 文件后备。PLE 与专家权重都必须纳入磁盘和内存预算,仅卸载 PLE 不足以解决容量问题。
  2. 原始目标 nvidia/Qwen3.8-Flash-Next-NVFP4 保持独立实验路线。不能直接套用已有 6000D 的 vLLM 配置;该路线尚缺经过核实的低内存专家卸载和加载峰值方案。
  3. 同一 Flash-Next 的 GGUF / EXL3 量化衍生版本作为候选路线,必须单独记录来源、量化损失及多模态支持。更换量化不等于原 NVIDIA checkpoint 已跑通。
  4. 优先审计 GGUF 的 CPU 专家+惰性文件加载方案,EXL3 为第二候选;32GB 是否足够仍待实测。不会承诺社区 30–40 token/s 能在这台机器复现。
  5. 初始并发 1、上下文 4096、输出 512、关闭 MTP;加载和正确性通过以后再扩展。验收目标为短文本中位生成速度 ≥5 token/s、暖态首字 ≤10 秒,这些是项目门槛而非性能预测。

阅读顺序

本仓库不包含未经验证的“一键启动”Compose,不复制社区执行脚本。候选运行时通过源码审计、版本固定和目标硬件试验后,再添加可执行部署文件。

本地容量估算

python3 scripts/capacity.py
python3 scripts/capacity.py --checkpoint-gib 123.568

输出只计算预算和理论容量缺口,不推算实际 token/s,不证明可成功加载。结果中的目标显存/内存预算包含运行开销,不能全部用来存权重。

仓库不收录模型权重、密钥、代理地址或未脱敏请求。模型按原许可证获取。

S
Description
Flash-Next RTX 4070 Ti SUPER 16GB / 32GB RAM / 2TB NVMe architecture and qualification plan
Readme
36 KiB
Languages
Python 100%