从dflash2换到dspark,代码的质量感觉上了一个台阶。
速度从110 t/s 掉到平均 85 t/s 还是可以的,任务量不小,一直在跟踪进度,react 转 react native web。

_折騰_
-
qwen3.8-27b-w4a16-awq 已经持续跑了15个小时了 -
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQllama.app Qwen3.8 27B Q6K DFlash2 实测速度也还可以,持续写入平均在96 tok/s 上下浮动,Q6模型比W4A16-AWQ的精度高出1%-2%(理论值,实际感知不大),但模型大小多出8个G左右。 两个模型目前基本达到理想配置了,已经没有能力再提升了。
-
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ这个速度还有没有提升空间了?同配置同模型下,还有更高的token速度吗?请晒出参数,学习一下。
配置:4090 魔改48GB 64GB内存
SGlang版本:0.5.19.dev20260825+g1fa32d50e1
实测DSH,长时间多轮写码 平均 110 tok/s
参数:
│ --model-path /home/root1/code/llm/sglang/models/Qwen3.8-27B-W4A16-AWQ
│ --served-model-name qwen3.8-27b-w4a16-awq-dflash2
│ --speculative-algorithm DFLASH
│ --speculative-draft-model-path /home/root1/code/llm/sglang/models/Qwen3.8-27B-DFlash2
│ --speculative-num-draft-tokens 8
│ --speculative-draft-model-quantization unquant
│ --default-chat-template-kwargs {"reasoning_effort":"medium"}
│ --attention-backend flashinfer(主模型)
│ --speculative-draft-attention-backend triton(草稿,滑窗)
│ --linear-attn-backend triton(GDN/mamba 层)
│ --context-length 250000
│ --kv-cache-dtype fp8_e4m3
│ --mem-fraction-static 0.75
│ --max-total-tokens 240000
-
4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ@xiaote 正常编码没问题,效果很好。但尝试以下提示词时,会长时间思考最终因为思考过长,已达到输出 token 上限回答被截断,试过pi hsd都无法正常回答并开始任务,连续4轮思考都被截断了,以下是提示词:使用html单文件写一个超级马里奥的游戏,要保证游戏细节,可玩性,不要脱离原版游戏的体验,尽可能还原所有细节。
有没有成功的?实测开启 HiCache 输出速度会砍掉一半!
-
M5 Max/Ultral AI性能强悍?苹果、AMD、英伟达AI小主机AI性能全面分析,潜力很大但统一内存并非万能!朋友M5 MACBOOK 128G 跑27B都非常拉夸,不是硬件不行,而是目前配套框架还不给力,看着我的4090的速度,他直掉眼泪。。。
-
Qwen releases Qwen3.8-Flash-Next! 來了RTX PRO 6000 跑起来都累,27B养老吧!