DGX的低功耗、安静、CUDA原生支持是我选择它的原因,但跑起本地大模型者实拉垮,直到我看见github上这个项目——Qwen3.8-27B-SGLang-DGX-Spark

NVIDIA的官网也有推荐

行动不如行动,火速通知Hermes——搞起!

结果是这个样子

按照惯例,此时应该由亲爱的Deepseek V4 Flash做总结陈词:
这个RadixArk版NVFP4模型可以理解成:为了在DGX Spark上跑出极致速度,而用“几乎无损的精度换数倍性能”的工程优化版本。
它并非简单的“低精度阉割版”,而是一个经过精密设计的混合精度方案。下面从三个维度来帮你拆解:
精度与性能的平衡:为什么说“几乎无损”
它不是纯4-bit:虽然名字叫NVFP4,但RadixArk的这个检查点是混合精度的。模型里关键的注意力投影(Attention projections)和语言模型头(lm_head)等部分保持FP8精度,只有MLP(多层感知机)层使用了4-bit。实际平均下来大约在6.5 bits/参数,比纯4bit精度更高。这种策略保护了对精度最敏感的部分。
官方精度数据支撑:NVIDIA官方博客指出,在代码生成、长文本等关键任务上,采用NVFP4 KV Cache的模型与BF16/FP8基线相比,精度损失不到1%。Unsloth团队的数据也显示,NVFP4方案的top-1精度恢复率能达到92%–97%(其中代码任务为96.68%,聊天为92.15%)。
实测能力不降级:从你实测的benchmark来看,这个模型在数学推理能达到43.6 tok/s,代码生成稳定在34 tok/s,且Hermes的tool calling评测得分达到92/100。这些都印证了它在实际智能体(Agent)和推理任务中的能力保持得很好。
NVFP4的核心价值:专为Blackwell架构优化的“快车道”
NVFP4不只是简单的4-bit量化,它是NVIDIA为Blackwell架构(如你的DGX Spark)专门设计的格式。
硬件级加速:它利用Blackwell的FP4 tensor core,相比传统FP8,GEMM(通用矩阵乘法)吞吐量有巨大提升。
更精细的缩放:它采用更小的微缩块和E4M3缩放因子,相比同类4-bit格式(如MXFP4),能更有效地保留离群值信息,量化误差更小。
为什么DGX Spark需要它
核心在于内存带宽墙。你实测35 tok/s的速度,已接近DGX Spark物理带宽的理论上限。如果用BF16或FP8模型,会被带宽严重限制;而NVFP4将权重从~28.5GB(FP8)压缩到~16.5GB,让数据搬运更快,DSpark投机解码才能发挥威力。
总结
所以,精度的“代价”被控制在极低水平,而速度的“收益”是巨大的。它并非官方FP8的降级版,而是为你的DGX Spark硬件量身定制的、用微小精度换极致性能的最优解。
它的高分推理成绩和稳定的35 tok/s表现,足以证明它在实际使用中是高度可靠的。

确定了一个关键结论:
