大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?
-
说实话,本地老老实实Qwen3.6 27b,跟着版本走就对了,未来很长一段时间,Qwen就是本地天花板代名词,小作坊是不可能干的过阿里这样的大企业的。在线就是Deepseek V4 Flash,高端的就上A O两家的模型,过分折腾耽误做事。
-
qwen 3.6 27b 稳定性好。速度还行。
跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
但vison 模式 只有50k上下文,目前还没有解。 -
核心的参数如下,我是成功开启WMMA以后速度才狂飙起来的(以前也就2200左右,R9700),PP跑分能到3800tps,tp57左右,好爽。实际用Agent调用大概在2800tps,tp单槽49,双槽并行总共大概60tps。
记得要用对聊天模板,Agent场景这个非常重要。模型与模板:
Bash
--model /models/Ornith-1.0-35B-Q5_K_M.gguf
--mmproj /models/mmproj-35B-A3B-Q8_0.gguf
--alias Ornith-35B-WMMA
--chat-template-file /app/chat_template_ornith.jinja服务端:
copy
--host 0.0.0.0
--port 8080KV Cache:
copy
--cache-type-k q8_0
--cache-type-v q8_0
--ctx-size 524288 ← 512K批处理:
copy
--batch-size 1024
--ubatch-size 1024
--flash-attn on
--n-gpu-layers 99并行槽位:
copy
--parallel 2
--slot-prompt-similarity 0.50
--cache-reuse 1采样参数:
copy
--temp 0.6
--top-p 0.95
--top-k 20
--repeat-penalty 1.1
--frequency-penalty 0.1
--predict 8192视觉:
copy
--image-min-tokens 1536性能 Tuning:
copy
--poll 100
--poll-batch 1
--prio-batch 3 -
核心的参数如下,我是成功开启WMMA以后速度才狂飙起来的(以前也就2200左右,R9700),PP跑分能到3800tps,tp57左右,好爽。实际用Agent调用大概在2800tps,tp单槽49,双槽并行总共大概60tps。
记得要用对聊天模板,Agent场景这个非常重要。模型与模板:
Bash
--model /models/Ornith-1.0-35B-Q5_K_M.gguf
--mmproj /models/mmproj-35B-A3B-Q8_0.gguf
--alias Ornith-35B-WMMA
--chat-template-file /app/chat_template_ornith.jinja服务端:
copy
--host 0.0.0.0
--port 8080KV Cache:
copy
--cache-type-k q8_0
--cache-type-v q8_0
--ctx-size 524288 ← 512K批处理:
copy
--batch-size 1024
--ubatch-size 1024
--flash-attn on
--n-gpu-layers 99并行槽位:
copy
--parallel 2
--slot-prompt-similarity 0.50
--cache-reuse 1采样参数:
copy
--temp 0.6
--top-p 0.95
--top-k 20
--repeat-penalty 1.1
--frequency-penalty 0.1
--predict 8192视觉:
copy
--image-min-tokens 1536性能 Tuning:
copy
--poll 100
--poll-batch 1
--prio-batch 3 -
@Bunsei 除非时间不敏感或者需要质量(其实用v4 flash更好)的时候在开启27B就行。
我发现这个35B的Ornith Q5好强,对于我的用途几乎都能替代flash了。跑分的PP3800/TP57,实际抓日志看Opencode和Zcode还有Hermes的调用大概在PP2900,TP单发50,双发合计60左右,这个体验就很爽了。本地的模型知识不够多和不够新(其实任何参数的模型都一样),所以这个时间配个好用的搜索引擎就哼重要了,付费的EXA或者Searngx(我本地配的质量能到exa的80%左右)。
一套下来体验很好。
-
@Bunsei 除非时间不敏感或者需要质量(其实用v4 flash更好)的时候在开启27B就行。
我发现这个35B的Ornith Q5好强,对于我的用途几乎都能替代flash了。跑分的PP3800/TP57,实际抓日志看Opencode和Zcode还有Hermes的调用大概在PP2900,TP单发50,双发合计60左右,这个体验就很爽了。本地的模型知识不够多和不够新(其实任何参数的模型都一样),所以这个时间配个好用的搜索引擎就哼重要了,付费的EXA或者Searngx(我本地配的质量能到exa的80%左右)。
一套下来体验很好。
-
qwen 3.6 27b 稳定性好。速度还行。
跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
但vison 模式 只有50k上下文,目前还没有解。@wwcd2016
27B的话可以考虑这个版本,实测和Q4几乎没区别,速度更快,上下文可以开的更大而且还可以开视觉。
IQ 量化非常强,我感觉只要你做的任务不是特别偏门IQ3XXS版本完全可以替代 Q4,但是注意,只有这个 XXS 版本比较好,我试过它的 XS 版本和 S 版本在某些时候下会输出会蹦还不如这个 XXS 的稳定。我这种魔改版的都是第 3 方的这些人。 每天都在那量化好多模型,他们不可能一个一个测试的,所以如果用模改版的模型的话,还是要自己多测试几个版本,找一个最适合的。