跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
像素盒子像

像素盒子

@像素盒子
取消关注 关注
关于
帖子
11
主题
3
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • Qwen3.8 27B AA综合评分与 DeepSeek V4 Flash 持平
    像素盒子像 像素盒子
    LLM讨论区 qwen-27b deepseek

    能上传,图片不要太大!


  • Qwen3.8-27B 引入froggeric/Qwen-Fixed-Chat-Templates Fix: 思考深度控制,恢复快速模式,修复空思考污染,通用工具参数
    像素盒子像 像素盒子
    LLM讨论区 qwen-27b

    @stxpnet 说:

    我的满载73度。 你的如果是linux可以试试用coolercontorld,把风扇转速拉高点,让它空载时候的起始温度低一些,或许有帮助

    感謝,我看我的風扇吹的挺積極的80度基本都能維持 90%以上的轉速


  • Qwen3.8-27B 引入froggeric/Qwen-Fixed-Chat-Templates Fix: 思考深度控制,恢复快速模式,修复空思考污染,通用工具参数
    像素盒子像 像素盒子
    LLM讨论区 qwen-27b

    另外问一下大家,我买的二手3090,跑模型最高能跑到85℃,用不用更换硅脂,换硅胶散热什么的,一直懒得弄,怕给它拆坏了
    PixPin_2026-08-17_04-26-46.png


  • Qwen3.8-27B 引入froggeric/Qwen-Fixed-Chat-Templates Fix: 思考深度控制,恢复快速模式,修复空思考污染,通用工具参数
    像素盒子像 像素盒子
    LLM讨论区 qwen-27b

    33333.png

    Qwen-Fixed-Chat-Templates

    看了B站一个视频,引入 jinja chat templates 可以改善一些问题。
    我没有深度使用测试,发个帖子,给不知道引入的同学做个参考。

    🎯参考
    【分享】改善Qwen3.8雷霆大思考

    🎯 通过 froggeric/Qwen-Fixed-Chat-Templates 仓库的 v22 模板,设定不同思考模式来解决核心问题。

    📦 仓库内容介绍

    这是一个为 Qwen 3.5 / 3.6 / 3.8 打造的通用修复版聊天模板(chat template(聊天模板)= 提示词包装器,Jinja 格式,负责把对话历史 + 工具定义组织成模型能理解的格式)。

    解决官方模板的 5 大问题(官方模板 = 模型发布时自带的原版模板):

    # 修复项 官方模板的问题 → v22 的修复
    1 🎚️ 思考深度控制 · Reasoning Effort Steering 官方 3.8 支持思考预算(xhigh 极深 / high 深 / medium 中 / low 浅),v22 默认注入 xhigh 指令,关思考时自动抑制
    2 ⚡ 恢复快速模式 · Fast Mode 官方 3.8 传 enable_thinking=false(关闭思考)会直接崩溃!v22 解除此限制,可自由开关思考
    3 🧹 修复空思考污染 · Empty Think Bug 官方 3.8 多轮对话会插入空 </think> 块,v22 干净提取思考内容不重复
    4 🔧 通用工具参数 · Universal Tool Arguments 官方 3.8 收到标准 OpenAI(接口规范)字符串参数会 TypeError 崩溃!v22 兼容字典和 JSON 字符串两种格式
    5 🦙 llama.cpp 原生支持 支持 --reasoning-preserve 参数(保留思考、保证前缀缓存 100% 生效)

    🖥️ 支持平台:LM Studio / llama.cpp / vLLM / MLX / KoboldCPP 等一切支持 Hugging Face 模板的引擎。仓库根目录只需一个 chat_template.jinja 文件,适用于所有 Qwen 3.5 / 3.6 / 3.8 模型。

    引入示例

    git clone https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates
    

    启动参数:

    #!/bin/bash
    # Qwen3.8-27B 启动脚本 - TurboQuant MTP 版 (200K 上下文, 视觉 + 投机解码)
    # 使用 llama-cpp-turboquant-mtp/ (最新 fork fca3093, 支持 draft-mtp)
    # 不依赖旧 b9082 build (无法加载 MTP 版 GGUF)
    
    SERVER="./llama-cpp-turboquant-mtp/build/bin/llama-server"
    MODEL="./models/Qwen3.8-27B-Q3_K_M.gguf"
    MMPROJ="./models/mmproj-BF16.gguf"
    PORT=8080
    
    export LD_LIBRARY_PATH="$(cd "$(dirname "$SERVER")" && pwd):/opt/cuda/lib64:$LD_LIBRARY_PATH"
    
    CPU_THREADS=12
    GPU_LAYERS=99
    # CONTEXT_SIZE=131072
    CONTEXT_SIZE=200000
    BATCH_SIZE=512
    
    echo "Starting Qwen3.8-27B (TurboQuant MTP) with 200K context..."
    ${SERVER} \
      -m "${MODEL}" \
      --mmproj "${MMPROJ}" \
      --chat-template-file ./Qwen-Fixed-Chat-Templates/chat_template.jinja \
      --reasoning-format deepseek \
      --reasoning-preserve \
      -c ${CONTEXT_SIZE} \
      -n -1 \
      -t ${CPU_THREADS} \
      -ngl ${GPU_LAYERS} \
      --parallel 1 \
      --cache-type-k turbo3 \
      --cache-type-v turbo3 \
      --flash-attn on \
      --load-mode mlock \
      --batch-size ${BATCH_SIZE} \
      --ubatch-size 512 \
      --reasoning-budget -1 \
      --spec-type draft-mtp \
      --spec-draft-n-max 3 \
      --spec-draft-p-min 0.75 \
      --host 0.0.0.0 \
      --port ${PORT} \
      --log-disable \
      &
    echo "Server started on http://localhost:${PORT}"
    echo "MMPROJ vision enabled, MTP speculative decoding enabled"
    

    简单测试结果:

    PixPin_2026-08-17_03-48-17.png


  • Qwen3.8-27B 测试Nvidia RTX 3090 llama.cpp MTP TurboQuant
    像素盒子像 像素盒子
    LLM讨论区 qwen-27b rtx3090 llama.cpp

    @williamlouis 说:

    文中有地方显示错误,还是输入问题。
    Qwen3.6-27B-Q3_K_M.gguf 一直都是用的这个模型。

    感谢指正,我启动服务器去看了下,还好模型没错,只是输入错误!


  • Qwen3.8-27B 测试Nvidia RTX 3090 llama.cpp MTP TurboQuant
    像素盒子像 像素盒子
    LLM讨论区 qwen-27b rtx3090 llama.cpp

    @terry 说:

    @williamlouis 我被打脸了
    @像素盒子 哥们你看下你的帖子,有要要修正的地方吗?

    感谢指正,我启动服务器去看了下,还好模型没错,只是输入错误!


  • Qwen3.8-27B 测试Nvidia RTX 3090 llama.cpp MTP TurboQuant
    像素盒子像 像素盒子
    LLM讨论区 qwen-27b rtx3090 llama.cpp

    222.png

    简单测试一下,供大家参考

    配置项 具体信息
    硬件 NVIDIA GeForce RTX 3090 24GB
    推理框架 llama.cpp
    加速技术 MTP (Multi-Token Prediction)
    显存优化 TurboQuant
    模型文件 Qwen3.8-27B-Q3_K_M.gguf

    启动脚本

    ./llama-cpp-turboquant-mtp/build/bin/llama-server \
      -m ./models/Qwen3.8-27B-Q3_K_M.gguf \
      --mmproj ./models/mmproj-BF16.gguf \
      -c 131072 \
      -n 512 \
      -t 12 \
      -ngl 99 \
      --parallel 1 \
      --cache-type-k turbo3 \
      --cache-type-v turbo3 \
      --flash-attn on \
      --mlock \
      --batch-size 512 \
      --ubatch-size 512 \
      --reasoning-budget 0 \
      --spec-type draft-mtp \
      --spec-draft-n-max 3 \
      --spec-draft-p-min 0.75 \
      --host 0.0.0.0 \
      --port 8080 \
      --log-disable
    

    贪吃蛇简单测速

    PixPin_2026-08-16_05-36-34.png

    3D小球测试

    请制作一个网页 3D 小球物理实验,要求同时存在 10 个不同颜色的球,它们受到重力影响并发生碰撞,用户可以拖动球,右侧可以调整重力和弹性,并提供开始、暂停、重置按钮。
    

    a79cfecf-6fa7-413b-8b5c-13cc9289b7ae-image.jpeg


  • DeepSeek最近使用感受
    像素盒子像 像素盒子
    LLM讨论区 本地模型 deepseek

    @terry 你误解了,我的意思是说,听你视频里说:很多人说DeepSeek最近变笨了。


  • DeepSeek最近使用感受
    像素盒子像 像素盒子
    LLM讨论区 本地模型 deepseek

    @terry 很多人说DeepSeek变笨是看你视频得知的,哈哈。我是在不需要分析上下文的场景,会用DeepSeek的网页端讨论单独的问题。也不是吐槽DeepSeek,其实还是很好用的。就是有时候和DeepSeek对话了半天发现居然是错的,难免发一下牢骚。😁


  • 还没找到组织,咱们有飞机群,或者微信群,或者QQ群吗?
    像素盒子像 像素盒子
    随便聊聊

    当技术大牛也要有责任感发这种信息确实有失水准了。


  • DeepSeek最近使用感受
    像素盒子像 像素盒子
    LLM讨论区 本地模型 deepseek

    网上很多人说最近DeepSeek变蠢了,我的感受是变得固执了,固执的蠢!以前是你说什么,它不检查正确与否直接采纳你的说法,很蠢。现在是你纠正它错误,它非常非常固执仍然不认为有错。
    AI就是这样它会的很多,可是你永远都不知道下一秒会出现惊喜还是惊吓。
    这样形容:
    以前是传染了Gemini臭毛病。
    现在好了,又和豆包学起来了。
    bb619481-6521-483a-ba90-22264c193649-image.jpeg

  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组