单台DGX 装qwen 3.8 next flash 500K token 长度,能用
-
https://github.com/blazux/qwen3.8-Flash-DGX
就这个质量还行把,接近Q8,一部分放显存里 一部分放硬盘上.token 长度500K。
我修正了一些参数 YARN=1 CTX=500000 GPU_MEM=0.80 MTP=3 SEQS=2
速度见下图,
-
再啰嗦一句云端服务ollama cloud 的MAX现在好像不让新用户买了,原则还是ollama cloud 最便宜,其次https://commandcode.ai 也能用就是贵点


-
重要的不是别人说如何,是你自己感觉如何,你觉得好就行。
在我的工作环境下,实测这个版本的qwen 3.8 next flash 要好于我的qwen3.8 27b q8,就是速度对于dgx spark来说还是提不上来。所以呢着急我就用线上的glm 5.3 flash 和qwen 3.8 flash ,不着急的晚上挂机的,就让这个本地跑。https://commandcode.ai 这个站有个好处中外的模型都有了,特别复杂的就花钱用贵的模型。我这个本地机器就是平时做挂机基础执行环节的。
-
@kk-hh 目前掛在我ai max395上切VRAM/RAM 64/64gb下用IQ4xs搭配dsh也非常舒服,@41k上下文深度下pp200多/tg 20-30token/s開192k上下文,目前已經利用goal然後入睡前讓它大型專案開發,隔天早上起來收割。是確定可以做出前沿模型那種質量。但速度響應上就不苛求了。目前pp可能還有提升的空間應該會更好。

@kk-hh 目前掛在我ai max395上切VRAM/RAM 64/64gb下用IQ4xs搭配dsh也非常舒服,@41k上下文深度下pp200多/tg 20-30token/s開192k上下文,目前已經利用goal然後入睡前讓它大型專案開發,隔天早上起來收割。是確定可以做出前沿模型那種質量。但速度響應上就不苛求了。目前pp可能還有提升的空間應該會更好。

我这个这个其实在300K TOKEN长度的时候 开MTP-3 其实生成速度也是 20-30token/s,TOKEN 最大长度在单台DGX SPARK可以设置成 1M 但是基于对这些FLASH 模型在云端使用的经验他们前500K还行,后500K 质量太差,所以我在本机就只开了500K的TOKEN长度。
-
说实话一个小机能跑成这样,你还要什么自行车啊。再买一台DGX SPARK 做双TP的QWEN 3.8 FLASH NEXT 或者 DPV4 FLASH 我觉得有点不太值,或者再买三台DGX SPARK 做4TP的 GLM 5.3 FLASH 更不值,我宁可多买点云端服务的额度。
-
@Kk-Hh 单台多少钱买的?
-
重要的不是别人说如何,是你自己感觉如何,你觉得好就行。
在我的工作环境下,实测这个版本的qwen 3.8 next flash 要好于我的qwen3.8 27b q8,就是速度对于dgx spark来说还是提不上来。所以呢着急我就用线上的glm 5.3 flash 和qwen 3.8 flash ,不着急的晚上挂机的,就让这个本地跑。https://commandcode.ai 这个站有个好处中外的模型都有了,特别复杂的就花钱用贵的模型。我这个本地机器就是平时做挂机基础执行环节的。

