-
这要多大的显存才能用?
-
按 125B 总参数量粗算权重体积(MoE 也一样按总参数量算):
- FP16/BF16:~250GB
- FP8:~125GB
- Q6_K:~94GB
- Q4_K_M:~70GB
- IQ3 / IQ2:~55GB / ~40GB
所以"全量进显存"的门槛:Q4 也要 ~70GB——双 R9700(64GB)差一点,得单张 96GB(PRO 6000 这类)或 3×32GB 才行。
但 A6B 真正的价值是 offload 友好:每 token 只激活 6B 参数,没激活的 expert 可以放内存按需加载。24GB 单卡 + 64GB 内存跑 Q4 完全能跑(比同体积 dense 125B 实用得多),代价是速度——激活 expert 的权重得不断从内存搬,t/s 会比较惨,但能用。想流畅还是得 ~70GB 显存全装。
等有人出 GGUF 实测再报具体数,先按这个量级规划显存没错。
-
按 125B 总参数量粗算权重体积(MoE 也一样按总参数量算):
- FP16/BF16:~250GB
- FP8:~125GB
- Q6_K:~94GB
- Q4_K_M:~70GB
- IQ3 / IQ2:~55GB / ~40GB
所以"全量进显存"的门槛:Q4 也要 ~70GB——双 R9700(64GB)差一点,得单张 96GB(PRO 6000 这类)或 3×32GB 才行。
但 A6B 真正的价值是 offload 友好:每 token 只激活 6B 参数,没激活的 expert 可以放内存按需加载。24GB 单卡 + 64GB 内存跑 Q4 完全能跑(比同体积 dense 125B 实用得多),代价是速度——激活 expert 的权重得不断从内存搬,t/s 会比较惨,但能用。想流畅还是得 ~70GB 显存全装。
等有人出 GGUF 实测再报具体数,先按这个量级规划显存没错。
-
,
T terry 将此主题从 随便聊聊 移至此处
-
这要多大的显存才能用?
-
@Tony-Wang 现在的主力是qwen3.8 27b-udq8xl,用了395+3090,等过几天llama.cpp支持新模型,我就试试双机和单机+3090两种方案
-
@Tony-Wang 现在的主力是qwen3.8 27b-udq8xl,用了395+3090,等过几天llama.cpp支持新模型,我就试试双机和单机+3090两种方案
-
@stxpnet 这两张卡连起来不是很正常吗?3090显卡坞,雷电4/5,Oculink都行,系统lInux,驱动Vulkan,很多框架可以直接认出两张卡,分层计算。
况且他的帖子,根本没说协同工作,或许它就是分开跑的.....
-
对啊,就看它优化得如何了。 我一直的设想是,这种MOE是文科生,回答问题速度快,多轮下来,直击一个问题的各个方面,然后最后进行一个大总结,速度快,角度全。应该和同等价值硬件能跑稠密模型有得一拼,然而事实却总是打脸。 我最后还是会选择稠密,宁愿久一点,都不要错一点。
-
@Bunsei max5 ultra 你值得拥有
-
下载中

