5090 + vLLM + Qwen3.6-27B 成功分享
-
此主題已被删除!
-
T terry 于 将此主题固定
-
非常不错,这下子图文并茂,挺好的,5090跑差不多就行了,不要着迷于优化,先把hermes安排点小任务,跑起来,优化有空了慢慢来,主要是MTP,Dflash,Turboquant,MTP目前比较成熟了。先跑。你不用折腾NVFP4,它和Q4量化没啥区别,它在Deepseek这样的原生模型中有优势,区别也不是很大。5090比较值得你折腾的就MTP。然后是turoquant。
此主題已被删除! -
[[topic:post-is-deleted]]
-
此主題已被删除!
-
[[topic:post-is-deleted]]
-
@Trypt-Wang 不行试试llama.cpp,3080跑27b开了MTP差不多40-60tokens/s,hermes跑任务差不多50左右。可以先给hermes接入DeepSeek,让DeepSeek帮忙部署,我是花了两三块钱搞定的。
此主題已被删除! -
[[topic:post-is-deleted]]
-
系统 于 取消固定此主题

