docs: plan Flash-Next tiered inference for RTX 4070 Ti SUPER and 32GB RAM
This commit is contained in:
@@ -0,0 +1,13 @@
|
||||
# 待办与交付
|
||||
|
||||
- [x] 固定用户目标:Flash-Next、4070TiSUPER 16GB、32GB RAM、2TB NVMe。
|
||||
- [x] 建立三级存储架构、预算、证据与测试门槛。
|
||||
- [x] 阅读低显存参考方案及家用桌面issue,区分显存限额和真实硬件。
|
||||
- [ ] 补齐实际CPU、内存配置、SSD及操作系统。
|
||||
- [ ] 固定候选代码SHA,审计加载/专家/PLE/视觉实现;确认量化衍生版本可接受的质量。
|
||||
- [ ] 获得实际测试机器;若使用大卡限额模拟,结果单独标注。
|
||||
- [ ] 依次完成P0–P5,记录失败与回退。
|
||||
- [ ] 仅为通过版本编写Dockerfile/Compose与启动、健康检查、停服脚本。
|
||||
- [ ] 复测MTP和上下文扩展;形成“已测配置中的最佳”,不宣称全局最优。
|
||||
|
||||
交付分层:规划完成 → 固定源码审计完成 → 容量试验通过 → 真机性能通过 → 多模态质量通过 → 日常部署。仓库创建不代表后面阶段已完成。
|
||||
Reference in New Issue
Block a user