能上传,图片不要太大!
像素盒子
-
Qwen3.8 27B AA综合评分与 DeepSeek V4 Flash 持平 -
Qwen3.8-27B 引入froggeric/Qwen-Fixed-Chat-Templates Fix: 思考深度控制,恢复快速模式,修复空思考污染,通用工具参数 -
Qwen3.8-27B 引入froggeric/Qwen-Fixed-Chat-Templates Fix: 思考深度控制,恢复快速模式,修复空思考污染,通用工具参数另外问一下大家,我买的二手3090,跑模型最高能跑到85℃,用不用更换硅脂,换硅胶散热什么的,一直懒得弄,怕给它拆坏了

-
Qwen3.8-27B 引入froggeric/Qwen-Fixed-Chat-Templates Fix: 思考深度控制,恢复快速模式,修复空思考污染,通用工具参数
Qwen-Fixed-Chat-Templates
看了B站一个视频,引入 jinja chat templates 可以改善一些问题。
我没有深度使用测试,发个帖子,给不知道引入的同学做个参考。
通过 froggeric/Qwen-Fixed-Chat-Templates 仓库的 v22 模板,设定不同思考模式来解决核心问题。
仓库内容介绍这是一个为 Qwen 3.5 / 3.6 / 3.8 打造的通用修复版聊天模板(chat template(聊天模板)= 提示词包装器,Jinja 格式,负责把对话历史 + 工具定义组织成模型能理解的格式)。
解决官方模板的 5 大问题(官方模板 = 模型发布时自带的原版模板):
# 修复项 官方模板的问题 → v22 的修复 1
️ 思考深度控制 · Reasoning Effort Steering官方 3.8 支持思考预算( xhigh极深 /high深 /medium中 /low浅),v22 默认注入xhigh指令,关思考时自动抑制2
恢复快速模式 · Fast Mode官方 3.8 传 enable_thinking=false(关闭思考)会直接崩溃!v22 解除此限制,可自由开关思考3 🧹 修复空思考污染 · Empty Think Bug 官方 3.8 多轮对话会插入空 </think>块,v22 干净提取思考内容不重复4
通用工具参数 · Universal Tool Arguments官方 3.8 收到标准 OpenAI(接口规范)字符串参数会 TypeError 崩溃!v22 兼容字典和 JSON 字符串两种格式 5 🦙 llama.cpp 原生支持 支持 --reasoning-preserve参数(保留思考、保证前缀缓存 100% 生效)
️ 支持平台:LM Studio / llama.cpp / vLLM / MLX / KoboldCPP 等一切支持 Hugging Face 模板的引擎。仓库根目录只需一个 chat_template.jinja文件,适用于所有 Qwen 3.5 / 3.6 / 3.8 模型。引入示例
git clone https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates启动参数:
#!/bin/bash # Qwen3.8-27B 启动脚本 - TurboQuant MTP 版 (200K 上下文, 视觉 + 投机解码) # 使用 llama-cpp-turboquant-mtp/ (最新 fork fca3093, 支持 draft-mtp) # 不依赖旧 b9082 build (无法加载 MTP 版 GGUF) SERVER="./llama-cpp-turboquant-mtp/build/bin/llama-server" MODEL="./models/Qwen3.8-27B-Q3_K_M.gguf" MMPROJ="./models/mmproj-BF16.gguf" PORT=8080 export LD_LIBRARY_PATH="$(cd "$(dirname "$SERVER")" && pwd):/opt/cuda/lib64:$LD_LIBRARY_PATH" CPU_THREADS=12 GPU_LAYERS=99 # CONTEXT_SIZE=131072 CONTEXT_SIZE=200000 BATCH_SIZE=512 echo "Starting Qwen3.8-27B (TurboQuant MTP) with 200K context..." ${SERVER} \ -m "${MODEL}" \ --mmproj "${MMPROJ}" \ --chat-template-file ./Qwen-Fixed-Chat-Templates/chat_template.jinja \ --reasoning-format deepseek \ --reasoning-preserve \ -c ${CONTEXT_SIZE} \ -n -1 \ -t ${CPU_THREADS} \ -ngl ${GPU_LAYERS} \ --parallel 1 \ --cache-type-k turbo3 \ --cache-type-v turbo3 \ --flash-attn on \ --load-mode mlock \ --batch-size ${BATCH_SIZE} \ --ubatch-size 512 \ --reasoning-budget -1 \ --spec-type draft-mtp \ --spec-draft-n-max 3 \ --spec-draft-p-min 0.75 \ --host 0.0.0.0 \ --port ${PORT} \ --log-disable \ & echo "Server started on http://localhost:${PORT}" echo "MMPROJ vision enabled, MTP speculative decoding enabled"简单测试结果:

-
Qwen3.8-27B 测试Nvidia RTX 3090 llama.cpp MTP TurboQuant文中有地方显示错误,还是输入问题。
Qwen3.6-27B-Q3_K_M.gguf 一直都是用的这个模型。感谢指正,我启动服务器去看了下,还好模型没错,只是输入错误!
-
Qwen3.8-27B 测试Nvidia RTX 3090 llama.cpp MTP TurboQuant@williamlouis 我被打脸了
@像素盒子 哥们你看下你的帖子,有要要修正的地方吗?感谢指正,我启动服务器去看了下,还好模型没错,只是输入错误!
-
Qwen3.8-27B 测试Nvidia RTX 3090 llama.cpp MTP TurboQuant
简单测试一下,供大家参考
配置项 具体信息 硬件 NVIDIA GeForce RTX 3090 24GB 推理框架 llama.cpp 加速技术 MTP (Multi-Token Prediction) 显存优化 TurboQuant 模型文件 Qwen3.8-27B-Q3_K_M.gguf 启动脚本
./llama-cpp-turboquant-mtp/build/bin/llama-server \ -m ./models/Qwen3.8-27B-Q3_K_M.gguf \ --mmproj ./models/mmproj-BF16.gguf \ -c 131072 \ -n 512 \ -t 12 \ -ngl 99 \ --parallel 1 \ --cache-type-k turbo3 \ --cache-type-v turbo3 \ --flash-attn on \ --mlock \ --batch-size 512 \ --ubatch-size 512 \ --reasoning-budget 0 \ --spec-type draft-mtp \ --spec-draft-n-max 3 \ --spec-draft-p-min 0.75 \ --host 0.0.0.0 \ --port 8080 \ --log-disable贪吃蛇简单测速

3D小球测试
请制作一个网页 3D 小球物理实验,要求同时存在 10 个不同颜色的球,它们受到重力影响并发生碰撞,用户可以拖动球,右侧可以调整重力和弹性,并提供开始、暂停、重置按钮。
-
DeepSeek最近使用感受 -
DeepSeek最近使用感受 -
还没找到组织,咱们有飞机群,或者微信群,或者QQ群吗?当技术大牛也要有责任感发这种信息确实有失水准了。
-
DeepSeek最近使用感受网上很多人说最近DeepSeek变蠢了,我的感受是变得固执了,固执的蠢!以前是你说什么,它不检查正确与否直接采纳你的说法,很蠢。现在是你纠正它错误,它非常非常固执仍然不认为有错。
AI就是这样它会的很多,可是你永远都不知道下一秒会出现惊喜还是惊吓。
这样形容:
以前是传染了Gemini臭毛病。
现在好了,又和豆包学起来了。

