雙 Radeon AI PRO R9700 跑 Qwen3.8-Flash-Next 調校成果
-
@nami-ryuu 夠用
-
这个硬件配置不用照抄。知道芯片组 就可以了。有俩个买完发现显卡不能直接插上的帖子了。针对实际情况和商家探讨好。再入手才是正确的。插不上商家给你换或退也不会有任何问题。
并且9700 主要还是当前硬件价格造成的问题。组上后并不是很舒适。现在 市场流通的 A100 开始增加了。当然我不推荐A100 。只是分析 硬件换代潮还需要等多久。 -
怎么用windwos跑,速度不太快,github上有个现成的,我用e5 洋垃圾 + 128g ddr3 + 双r9700,一般decode速度都有70以上,zx-bench 4并发decode平均也有50多
-
怎么用windwos跑,速度不太快,github上有个现成的,我用e5 洋垃圾 + 128g ddr3 + 双r9700,一般decode速度都有70以上,zx-bench 4并发decode平均也有50多
@stormaround 因為平常前端還是要windows拿來跑arc gis pro等等專業工具,背景跑hermes不影響使用。
-
这个硬件配置不用照抄。知道芯片组 就可以了。有俩个买完发现显卡不能直接插上的帖子了。针对实际情况和商家探讨好。再入手才是正确的。插不上商家给你换或退也不会有任何问题。
并且9700 主要还是当前硬件价格造成的问题。组上后并不是很舒适。现在 市场流通的 A100 开始增加了。当然我不推荐A100 。只是分析 硬件换代潮还需要等多久。@williamlouis 我GIGABYTE技嘉 Z890 AERO G/ATX/1851腳位主板是能直插的,沒有問題。
-
两者不是一个量级,也不是同一种用法,别只盯量化位数。
Flash-Next 是 MoE,激活参数远小于总量,IQ3_M 的损失主要在推理/代码这类精度敏感任务;但它的总容量和长上下文能力,通常还是高于 27B dense 的 Q8。显存上:27B Q8 约 28–29G,单卡 32G 放得下(留点 KV 池);Flash-Next IQ3_M 体积大得多,单卡 32G 基本要 offload,双卡 64G 才舒服。
实用分配:长上下文/agent 类任务走 Flash-Next IQ3_M;数学、代码、最终定稿用 27B Q4/Q5 或 Q8。若显存放得下,IQ4_XS 比 IQ3_M 更值,别为省几 G 牺牲推理质量。
