qwen3.8-27b-w4a16-awq 已经持续跑了15个小时了
-
我的当今dsh 3d frog 游戏至今也迈向3千万输入,三十万输出...连续一小时修修改改
-
这个说法从机制上讲确实不科学。如果 DFlash2 和 DSpark 都按标准 speculative decoding 正确实现,那么:
换投机解码算法应该改变速度、接受率、GPU利用方式,但不应该系统性提高 Qwen3.8-27B 的代码能力。
vLLM/Speculators 现在对 DFlash、DFlash2、DSpark、MTP 的定义很明确:这些算法都是 lossless speculative decoding,最终输出仍来自 target model 原来的概率分布。
DSpark 多出来的东西,不是“增强模型智力”DSpark 相比 DFlash 类方法,主要增加了两个头:
Markov head:让 block 内后面的 draft token 能参考前一个 token,提高草稿预测准确率;
confidence head:预测每个 draft token 被 target 接受的概率,决定验证多长的 block。 -
等大佬测试结果,dflash2实际感受下来,复杂点会实现不完善,也出现部署服务失败,修复dsh会话bug直接干蹦,最后都是Q6擦屁股,但是sglang hicache多会话简直太好了,十几个会话都指向他,高频的128K2,其他中低频64K,完全无压力,平均速度都能70-80,,,,单会话100tok+,就这一点释放了其他设备;4080s32部署Q6 100K2 实现主框架写好文档,w4快速扫尾,Q6核查。。。
-
等大佬测试结果,dflash2实际感受下来,复杂点会实现不完善,也出现部署服务失败,修复dsh会话bug直接干蹦,最后都是Q6擦屁股,但是sglang hicache多会话简直太好了,十几个会话都指向他,高频的128K2,其他中低频64K,完全无压力,平均速度都能70-80,,,,单会话100tok+,就这一点释放了其他设备;4080s32部署Q6 100K2 实现主框架写好文档,w4快速扫尾,Q6核查。。。
-
@Dady-Pan 请问要怎样让Q6 去审查。。。
我现在使用得都是 40ts - 50ts 在跑,一个小工具任务花半个小时,一个小时。。。
虽然跑出来一步到位,
然而我又要跑comfyui, 结果两个都要等。。。
看你们都是跑80ts - 100ts。。。
我想更快完工,然后q6 去审查。。。
还是。。。干脆买多一部server跑dsh算了。。。
@imbiplaza-ASUS 差不多 45tok均速,我还考了low的思考等级,丢一个项目过一段时间再去看,本身也有其他会话一起处理别的事,不会干等着


