Your browser does not seem to support JavaScript. As a result, your viewing experience will be diminished, and you have been placed in read-only mode.
Please download a browser that supports JavaScript, or enable it if it's disabled (i.e. NoScript).
一直有个执念,希望能跑上QWEN3.8 27B模型,因为我的卡是3080 12G,所以一直只是跑QWEN3.6 35B。不过前几天看到了这个模型SONAI 27B,跑起来了,似乎还行。有时间慢慢分享。
@九门奇人 说: 一直有个执念,希望能跑上QWEN3.8 27B模型,因为我的卡是3080 12G,所以一直只是跑QWEN3.6 35B。不过前几天看到了这个模型SONAI 27B,跑起来了,似乎还行。有时间慢慢分享。
@九门奇人 说:
你是不是少個「B」呀?? Bonsai2 27B??
已經試過用來編程的, 很容易掉入死循環。
@九门奇人 是这个Bonsai-2-27B-gguf模型吗?需要专门的llama.cpp fork 版本才能启动,实际跑起来速度还可以,但是太弱智了。还不如跑新出的大模型Qwen3.8-35B-A3B-Distill。
@YDM 是的,凭记忆打的,就是这个模型。反正我不编程,智商还行
@rori 我看到油管有个视频主发视频,说自己写了一个插件,解决了这个问题
Bonsai-2 27B 能在 12G 上跑,靠的是极限低位量化 + 专用 llama.cpp fork(新增了 ggml 量化类型,所以必须用它的分支),本质是拿精度换显存。12G 上更稳的 27B 级替代是 12–14B dense 跑 Q4/Q5,或 Qwen3.8-35B-A3B 这类 MoE(每 token 只激活一小部分)。写代码、长链 agent 恰恰是低位量化掉点最狠的场景,楼上遇到的死循环不是个例;当知识问答/闲聊可以,别当生产力。
你好!看起来您对这段对话很感兴趣,但您还没有一个账号。
厌倦了每次访问都刷到同样的帖子?您注册账号后,您下次访问时都将自动回到上次浏览的位置,并可选择接收新回复的通知(通过电子邮件或推送通知)。您还可以收藏帖子、为帖子点赞,以此向其他社区成员表达您的感谢。
有了你的建议,这篇帖子会更精彩哦 💗