<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[qwen 3.8 27b mtp vllm0.26测试，benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑]]></title><description><![CDATA[<p dir="auto">3090 24G双卡，破解P2P驱动（实际没派上用场），功率都限制260W，关闭NCCL，张量并行<br />
（卡间数据走8X/8X PCH通道，应该每个token只有那一瞬间要用到PCIE传输数据，影响不大）<br />
选定的模型：<a href="https://huggingface.co/twolven/Qwen3.8-27B-abliterated-AWQ-MTP" rel="nofollow ugc">https://huggingface.co/twolven/Qwen3.8-27B-abliterated-AWQ-MTP</a>  考虑到这个模型比较新，抖音某博主说qwen 3.8使用0.27版本可能有问题，所以vllm选择0.26版本。<br />
4位权重，FP8 kv缓存，KV 缓存池大约在2倍于262K = 520K 容量。</p>
<p dir="auto">镜像模板和容器，都是DEEPSEEK V4 FLASH配置的，现在的FLASH感觉比以前的PRO还强。</p>
<p dir="auto">关掉思考，再用上v22的那个模板之后，快速15项测试涨了3分，时间快了11秒：<br />
<img src="https://upload.lcz.me/uploads/f8387961-4b11-4229-9417-b1ea80dcb359.jpeg" alt="43d05286-499a-4993-af2b-014b01635c47-image.jpeg" class=" img-fluid img-markdown" /><br />
换话题，TTFT就会2-3秒，卡得难受。 但是在Litellm里面测试速度又飞快。</p>
<p dir="auto">这里遇上第一个坑：这个模型文件目录下面有个generationconfig.json文件 temp 默认是1.0，难怪非常啰嗦（思维过于发散），一个小任务搞半小时！根本不适合做这种维护性质的工作，让HERMES自己改了模型配置之后，再试：<br />
<img src="https://upload.lcz.me/uploads/8305c4d8-c8ca-4f3d-bff9-ed1d54fc6ac2.jpeg" alt="dfd818b9-2ce7-417f-835d-fe7101915c78-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">同时把模型目录下面的值也改掉：<br />
<img src="https://upload.lcz.me/uploads/ea5cdb14-16c1-4a9c-bff9-ba4d383bdcf1.jpeg" alt="aec218a6-bd4e-4f14-a0b2-54c944878ece-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/a31552d0-1bda-48b9-a9a5-797bea96d958.jpeg" alt="1c0179f6-501b-4553-bbbe-0dd1a7e660b7-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">第二个坑，vllm启动里面有个参数，如果不修改，在hermes里面工具调用 也会思考 速度爆慢，经过修改之后，工具调用也清爽了，hermes也不啰嗦了：</p>
<pre><code>  --default-chat-template-kwargs '{"enable_thinking": false, "reasoning_effort": "medium", "auto_disable_thinking_with_tools": true, "preserve_thinking": true}' \
</code></pre>
<p dir="auto">第三个，qwen 3.8 27B，设置不同<strong>思考等级</strong>，模型的行为差别如下：<br />
<img src="https://upload.lcz.me/uploads/e19b667c-e001-44e3-8719-ce346e86105a.jpeg" alt="6704da45-073e-432f-ab22-657a64a5c96b-image.jpeg" class=" img-fluid img-markdown" /><br />
手动根据当前任务难度选择不同的思考等级以获得最佳效果。</p>
<p dir="auto">在上下文超过115K时，查看后台日志，速度变化不大：<br />
<img src="https://upload.lcz.me/uploads/ac282fb9-f668-4a84-a5f3-a7b7673ce70b.jpeg" alt="14157bd3-1366-49ce-b7c7-fee538523256-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">双并发，其中一个WEBUI的简单文本测试，约60T/S<br />
<img src="https://upload.lcz.me/uploads/cc978388-8644-4467-a9c2-d97162a62a09.jpeg" alt="7f7f54f1-a3d7-4321-bc69-73f2aae05a21-image.jpeg" class=" img-fluid img-markdown" /><br />
另一边HERMES比单流略慢一点。</p>
<p dir="auto">最后，benchlocal得分 79%<br />
<img src="https://upload.lcz.me/uploads/befd2a19-33dd-4d28-a840-8b21bb79e33c.jpeg" alt="3d528fc2-f128-488b-81d9-a52447f3c366-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/3873b832-41f5-41fe-b932-0e8e40df359a.jpeg" alt="44f2a25a-2f86-4aa3-b56a-c58ac3a1b840-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/ebb17ea3-8146-485f-b124-149a0b773e63.jpeg" alt="5fc38b70-cc40-4de6-bc43-61f896d7a82e-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">如果单独从比分来看，还不如以前 3.6 27B Q4 K xl 单卡跑145K上下文（无视觉）。 <a href="https://lcz.me/topic/863/2026-07-%E5%B0%8F%E6%B5%8B%E4%B8%80%E4%B8%AA%E9%80%82%E5%90%8824g%E5%8D%95%E5%8D%A1%E8%B7%91hermes-%E7%9A%84%E6%A8%A1%E5%9E%8B-qwen3.6-35b-a3b-ud-iq4_nl_xl-140t-s-170k%E4%B8%8A%E4%B8%8B%E6%96%87-tooleval-96%E5%88%86/9">旧帖子链接</a></p>
<p dir="auto">摘录一些别人的其它模型测试结果：</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/4ccf6439-2880-4900-ab91-1c42127f6177.jpeg" alt="dfd53b22-a2f1-475e-8cea-89c5c43a81ec-image.jpeg" class=" img-fluid img-markdown" />  【这人的是3090两张，有nvlink】</p>
<p dir="auto">另外：单卡3090可考虑这个人的配置：<br />
<a href="https://github.com/syv-ai/qwen38-27b-rtx3090" rel="nofollow ugc">https://github.com/syv-ai/qwen38-27b-rtx3090</a> 按它说法，单卡150K上下文是可用的。最高极限190K。</p>
]]></description><link>https://lcz.me/topic/1156</link><generator>RSS for Node</generator><lastBuildDate>Thu, 10 Sep 2026 00:43:40 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1156.rss" rel="self" type="application/rss+xml"/><pubDate>Mon, 17 Aug 2026 03:54:02 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to qwen 3.8 27b mtp vllm0.26测试，benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑 on Tue, 18 Aug 2026 01:26:28 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/8e3159c5-9962-4e1d-b801-fae6b710837e.jpeg" alt="e2cf7a84-8616-463e-83b4-64a71f92b411-image.jpeg" class=" img-fluid img-markdown" /><br />
目前的任务，应急的时候用35B A3B，30秒就能跑起来。 然后有空的时候再让27B xhigh慢慢复核。</p>
]]></description><link>https://lcz.me/post/12633</link><guid isPermaLink="true">https://lcz.me/post/12633</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Tue, 18 Aug 2026 01:26:28 GMT</pubDate></item><item><title><![CDATA[Reply to qwen 3.8 27b mtp vllm0.26测试，benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑 on Mon, 17 Aug 2026 16:47:27 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/terry" aria-label="Profile: terry">@<bdi>terry</bdi></a> 我这两张都是游戏显卡，一张在主机内，另一张引到主机后面，基本没有噪音。除非一直满载超过5分钟会有点风扇声。</p>
]]></description><link>https://lcz.me/post/12593</link><guid isPermaLink="true">https://lcz.me/post/12593</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 17 Aug 2026 16:47:27 GMT</pubDate></item><item><title><![CDATA[Reply to qwen 3.8 27b mtp vllm0.26测试，benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑 on Mon, 17 Aug 2026 16:03:44 GMT]]></title><description><![CDATA[<p dir="auto">挺好的，你现在温度如何，卡扛得住吗？噪音2张不是特么的反天了，是不是搞在专门的房间？</p>
]]></description><link>https://lcz.me/post/12580</link><guid isPermaLink="true">https://lcz.me/post/12580</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Mon, 17 Aug 2026 16:03:44 GMT</pubDate></item><item><title><![CDATA[Reply to qwen 3.8 27b mtp vllm0.26测试，benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑 on Mon, 17 Aug 2026 14:09:23 GMT]]></title><description><![CDATA[<p dir="auto">俄罗斯方块是和3.6不一样的风格：<br />
<img src="https://upload.lcz.me/uploads/ecea81ee-da3f-4211-8846-fb78eebfcc5c.jpeg" alt="51273263-5cfb-42f7-a483-c4c6636f1440-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">回答站长的问题：整体速度的感受：反正比我单卡时代要好些，没有35B A3B那种秒出的过瘾感觉，但是27B的智商给人很实在的感觉。</p>
<p dir="auto">脑筋急转弯，11个，思考真的久：<br />
<a href="https://fboom.me/file/6c27500d8eddc" rel="nofollow ugc">https://fboom.me/file/6c27500d8eddc</a></p>
<p dir="auto">俄罗斯方块，hermes里关不掉思考也是很久：<br />
<a href="https://fboom.me/file/c78267afc43d8" rel="nofollow ugc">https://fboom.me/file/c78267afc43d8</a></p>
]]></description><link>https://lcz.me/post/12546</link><guid isPermaLink="true">https://lcz.me/post/12546</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 17 Aug 2026 14:09:23 GMT</pubDate></item><item><title><![CDATA[Reply to qwen 3.8 27b mtp vllm0.26测试，benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑 on Mon, 17 Aug 2026 12:27:30 GMT]]></title><description><![CDATA[<p dir="auto">VLLM驱动Agent体验如何，实话实话，我以前部署的时候觉得太慢，缓存和狗屎一样。</p>
]]></description><link>https://lcz.me/post/12526</link><guid isPermaLink="true">https://lcz.me/post/12526</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Mon, 17 Aug 2026 12:27:30 GMT</pubDate></item><item><title><![CDATA[Reply to qwen 3.8 27b mtp vllm0.26测试，benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑 on Mon, 17 Aug 2026 16:55:42 GMT]]></title><description><![CDATA[<p dir="auto"><img src="https://upload.lcz.me/uploads/f4c887fd-603f-4ae4-86e1-b7d78d708e26.jpeg" alt="c7c5bbd0-c996-4e5f-b388-aa7022674776-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">今天用了一段时间，比单卡跑27B体验舒服多了，也好过我之前草率测试的2-3个vllm模型。</p>
<p dir="auto">用trae调用 的时候，后台数据很漂亮，冲到120+ token/s ?<br />
<img src="https://upload.lcz.me/uploads/624c9fea-4e9f-4dda-99f6-835360c8f477.jpeg" alt="1f5e2777-476b-4214-ae4f-02a9f99b72c4-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/12501</link><guid isPermaLink="true">https://lcz.me/post/12501</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 17 Aug 2026 16:55:42 GMT</pubDate></item><item><title><![CDATA[Reply to qwen 3.8 27b mtp vllm0.26测试，benchlocal得分79% 平均速度约50-60token/s 分享遇到的几个坑 on Mon, 17 Aug 2026 14:34:13 GMT]]></title><description><![CDATA[<p dir="auto">终极测试，写一个三关的仿超级玛丽HTML5小游戏【15:40开始】：<br />
<img src="https://upload.lcz.me/uploads/efc6307b-214c-4ede-9858-2a295da4734b.jpeg" alt="6879174f-b2d6-402e-a46b-be6d46783e7e-image.jpeg" class=" img-fluid img-markdown" /><br />
16点12分完成，显示代码6000多行，耗用token 28K：<br />
<img src="https://upload.lcz.me/uploads/f369299d-d46b-448b-8025-baf447de685d.jpeg" alt="ee47a60f-5e13-4d40-8a22-8aa0f3ee776d-image.jpeg" class=" img-fluid img-markdown" /><br />
BUG一堆，又要让它修复，然后玩玩看QWEN 3.8的公主长啥样。</p>
<p dir="auto">由于代码实在太烂，没法玩到最后，让它写了一个无敌模式，我混到最后去看看：<br />
<img src="https://upload.lcz.me/uploads/7b01c680-531d-4918-9e9d-b7693d8118da.jpeg" alt="6fbf2606-fbea-4984-8646-3983d00e3727-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/2616112f-7769-465a-8ee7-f8ae6936f4f2.jpeg" alt="d7abc554-6495-47ec-9903-0d846d57cca8-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/99adadec-ee55-4826-9ac1-824238ec7efd.jpeg" alt="eb8cf6a1-f129-4fc8-8f00-0c7499963f0a-image.jpeg" class=" img-fluid img-markdown" /><br />
审美感觉不咋地啊，不过这个模型的记忆力还可以。不知道f16原版模型写出来的超级玛丽会是怎样的。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/5f2c0d90-bbb1-49ac-b674-453fd91f84d2.jpeg" alt="02a13ff7-daa8-4eb9-bd61-de51ec1017b0-image.jpeg" class=" img-fluid img-markdown" /><br />
QWEN 3.8 27B这些黑话，应该是新版跟哪个模型蒸馏学来的吧？ 以前似乎没有这种话风。</p>
<p dir="auto"><img src="https://upload.lcz.me/uploads/4e2fb9b9-6965-451c-9d40-b211221a401b.jpeg" alt="fcf18636-c3cf-4870-b952-c4eb3f96e613-image.jpeg" class=" img-fluid img-markdown" /></p>
<p dir="auto">用了temp = 0.6还是啰嗦。<br />
<img src="https://upload.lcz.me/uploads/bd850ee1-a8f2-4c24-8f8d-de2222152f77.jpeg" alt="dece0b4a-77f1-4824-be2a-5052c2611739-image.jpeg" class=" img-fluid img-markdown" /></p>
]]></description><link>https://lcz.me/post/12463</link><guid isPermaLink="true">https://lcz.me/post/12463</guid><dc:creator><![CDATA[stxpnet]]></dc:creator><pubDate>Mon, 17 Aug 2026 14:34:13 GMT</pubDate></item></channel></rss>