qwen 3.8 27b mtp vllm0.26测试,benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑
-
3090 24G双卡,破解P2P驱动(实际没派上用场),功率都限制260W,关闭NCCL,张量并行
(卡间数据走8X/8X PCH通道,应该每个token只有那一瞬间要用到PCIE传输数据,影响不大)
选定的模型:https://huggingface.co/twolven/Qwen3.8-27B-abliterated-AWQ-MTP 考虑到这个模型比较新,抖音某博主说qwen 3.8使用0.27版本可能有问题,所以vllm选择0.26版本。
4位权重,FP8 kv缓存,KV 缓存池大约在2倍于262K = 520K 容量。镜像模板和容器,都是DEEPSEEK V4 FLASH配置的,现在的FLASH感觉比以前的PRO还强。
关掉思考,再用上v22的那个模板之后,快速15项测试涨了3分,时间快了11秒:

换话题,TTFT就会2-3秒,卡得难受。 但是在Litellm里面测试速度又飞快。这里遇上第一个坑:这个模型文件目录下面有个generationconfig.json文件 temp 默认是1.0,难怪非常啰嗦(思维过于发散),一个小任务搞半小时!根本不适合做这种维护性质的工作,让HERMES自己改了模型配置之后,再试:

同时把模型目录下面的值也改掉:


第二个坑,vllm启动里面有个参数,如果不修改,在hermes里面工具调用 也会思考 速度爆慢,经过修改之后,工具调用也清爽了,hermes也不啰嗦了:
--default-chat-template-kwargs '{"enable_thinking": false, "reasoning_effort": "medium", "auto_disable_thinking_with_tools": true, "preserve_thinking": true}' \第三个,qwen 3.8 27B,设置不同思考等级,模型的行为差别如下:

手动根据当前任务难度选择不同的思考等级以获得最佳效果。在上下文超过115K时,查看后台日志,速度变化不大:

双并发,其中一个WEBUI的简单文本测试,约60T/S

另一边HERMES比单流略慢一点。最后,benchlocal得分 79%



如果单独从比分来看,还不如以前 3.6 27B Q4 K xl 单卡跑145K上下文(无视觉)。 旧帖子链接
摘录一些别人的其它模型测试结果:
【这人的是3090两张,有nvlink】另外:单卡3090可考虑这个人的配置:
https://github.com/syv-ai/qwen38-27b-rtx3090 按它说法,单卡150K上下文是可用的。最高极限190K。 -
,
T terry 固定了此主题
-
俄罗斯方块是和3.6不一样的风格:

回答站长的问题:整体速度的感受:反正比我单卡时代要好些,没有35B A3B那种秒出的过瘾感觉,但是27B的智商给人很实在的感觉。
脑筋急转弯,11个,思考真的久:
https://fboom.me/file/6c27500d8eddc俄罗斯方块,hermes里关不掉思考也是很久:
https://fboom.me/file/c78267afc43d8 -
,系统 取消固定了此主题










