@Ben-Lee 这个模型是FP8
7900xtx 跑的是低精度模型。
楼主应该用
tcclaviger/Qwen3.8-27B-DFlash2-FP8
这个模型,不应该用MTP3,层数太深也影响效率。
如果一定要用MTP,可以改成1
https://github.com/magiccodingman/vllm-radiance
https://github.com/StevenChenSE/sglang/tree/gfx1100-support#chinese
@Ben-Lee 这个模型是FP8
7900xtx 跑的是低精度模型。
楼主应该用
tcclaviger/Qwen3.8-27B-DFlash2-FP8
这个模型,不应该用MTP3,层数太深也影响效率。
如果一定要用MTP,可以改成1
https://github.com/magiccodingman/vllm-radiance
https://github.com/StevenChenSE/sglang/tree/gfx1100-support#chinese