Qwen3.8-27B 引入froggeric/Qwen-Fixed-Chat-Templates Fix: 思考深度控制,恢复快速模式,修复空思考污染,通用工具参数
-

Qwen-Fixed-Chat-Templates
看了B站一个视频,引入 jinja chat templates 可以改善一些问题。
我没有深度使用测试,发个帖子,给不知道引入的同学做个参考。
通过 froggeric/Qwen-Fixed-Chat-Templates 仓库的 v22 模板,设定不同思考模式来解决核心问题。
仓库内容介绍这是一个为 Qwen 3.5 / 3.6 / 3.8 打造的通用修复版聊天模板(chat template(聊天模板)= 提示词包装器,Jinja 格式,负责把对话历史 + 工具定义组织成模型能理解的格式)。
解决官方模板的 5 大问题(官方模板 = 模型发布时自带的原版模板):
# 修复项 官方模板的问题 → v22 的修复 1
️ 思考深度控制 · Reasoning Effort Steering官方 3.8 支持思考预算( xhigh极深 /high深 /medium中 /low浅),v22 默认注入xhigh指令,关思考时自动抑制2
恢复快速模式 · Fast Mode官方 3.8 传 enable_thinking=false(关闭思考)会直接崩溃!v22 解除此限制,可自由开关思考3 🧹 修复空思考污染 · Empty Think Bug 官方 3.8 多轮对话会插入空 </think>块,v22 干净提取思考内容不重复4
通用工具参数 · Universal Tool Arguments官方 3.8 收到标准 OpenAI(接口规范)字符串参数会 TypeError 崩溃!v22 兼容字典和 JSON 字符串两种格式 5 🦙 llama.cpp 原生支持 支持 --reasoning-preserve参数(保留思考、保证前缀缓存 100% 生效)
️ 支持平台:LM Studio / llama.cpp / vLLM / MLX / KoboldCPP 等一切支持 Hugging Face 模板的引擎。仓库根目录只需一个 chat_template.jinja文件,适用于所有 Qwen 3.5 / 3.6 / 3.8 模型。引入示例
git clone https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates启动参数:
#!/bin/bash # Qwen3.8-27B 启动脚本 - TurboQuant MTP 版 (200K 上下文, 视觉 + 投机解码) # 使用 llama-cpp-turboquant-mtp/ (最新 fork fca3093, 支持 draft-mtp) # 不依赖旧 b9082 build (无法加载 MTP 版 GGUF) SERVER="./llama-cpp-turboquant-mtp/build/bin/llama-server" MODEL="./models/Qwen3.8-27B-Q3_K_M.gguf" MMPROJ="./models/mmproj-BF16.gguf" PORT=8080 export LD_LIBRARY_PATH="$(cd "$(dirname "$SERVER")" && pwd):/opt/cuda/lib64:$LD_LIBRARY_PATH" CPU_THREADS=12 GPU_LAYERS=99 # CONTEXT_SIZE=131072 CONTEXT_SIZE=200000 BATCH_SIZE=512 echo "Starting Qwen3.8-27B (TurboQuant MTP) with 200K context..." ${SERVER} \ -m "${MODEL}" \ --mmproj "${MMPROJ}" \ --chat-template-file ./Qwen-Fixed-Chat-Templates/chat_template.jinja \ --reasoning-format deepseek \ --reasoning-preserve \ -c ${CONTEXT_SIZE} \ -n -1 \ -t ${CPU_THREADS} \ -ngl ${GPU_LAYERS} \ --parallel 1 \ --cache-type-k turbo3 \ --cache-type-v turbo3 \ --flash-attn on \ --load-mode mlock \ --batch-size ${BATCH_SIZE} \ --ubatch-size 512 \ --reasoning-budget -1 \ --spec-type draft-mtp \ --spec-draft-n-max 3 \ --spec-draft-p-min 0.75 \ --host 0.0.0.0 \ --port ${PORT} \ --log-disable \ & echo "Server started on http://localhost:${PORT}" echo "MMPROJ vision enabled, MTP speculative decoding enabled"简单测试结果:

-
二手 3090 满载 85℃,先别急着拆,给你一个能落地的判断标准:
先分清是哪个温度在 85℃:
- 核心(GPU 芯片):3090 默认温度墙就是 83℃,满载 80-85 是正常区间,90℃ 以上才需要紧张
- 显存结温(GDDR6X):这才是二手 3090 的重点。GDDR6X 天生巨热,满载结温 95-105℃ 都很常见,但长期 105℃+ 会加速显存老化
判断方法:跑 10 分钟满载负载(跑模型推理就行),用 HWiNFO 看 "GPU Memory Junction Temperature"(Windows)或者 GPU-Z 的显存温度:
- 核心 <85℃ 且 显存结温 <100℃:不用动,正常用
- 显存结温 100-105℃:建议换硅脂+导热垫,换完通常能降 10-20℃
- 显存结温 105℃+:必须处理,不然显存寿命肉眼可见地缩短
二手卡为什么普遍建议到手就换:前主人可能是矿卡,硅脂早就干透了、导热垫被压扁失去弹性,换完之后核心降 10℃+ 是常态,风扇噪音也跟着小一大截。
怕拆坏的话给你几个保命要点:
- 3090 拆解本身不难,真正的难点是导热垫厚度——不同型号混用 1.5mm/2mm/3mm,买之前先搜你自己这个型号的拆解帖,照着厚度买
- 核心换相变片(PTM7950)比硅脂省心,不用涂、寿命长;导热垫买对应厚度的,别买厚了导致核心接触不良
- 螺丝对角顺序拧,别一次拧死;显存供电区的排线轻拔
- 实在不敢拆:先清灰 + 检查风扇转速曲线 + 机箱风道,能压个 2-5℃;但硅脂老化是物理问题,治标不治本
一句话总结:85℃ 本身不是红线,先看显存结温再决定拆不拆;二手卡换硅脂属于"到手就该做"的常规保养,比显卡真出问题再修便宜太多了。
-
我使用功耗墙限制180W,加外置机箱风扇以最高转速对着显卡吹,夏天的地下室,无空调,室温32度左右。能基本上压制在85以下。让Hermes Agent在Ubuntu系统中写了一个服务器端监控脚本,持续监控GPU核心温度。我这里设定是持续超过85度3分钟以上就自动关机了。
-
我使用功耗墙限制180W,加外置机箱风扇以最高转速对着显卡吹,夏天的地下室,无空调,室温32度左右。能基本上压制在85以下。让Hermes Agent在Ubuntu系统中写了一个服务器端监控脚本,持续监控GPU核心温度。我这里设定是持续超过85度3分钟以上就自动关机了。
@2024fatwolf55 居然有人比我更狠 我限制245w

