我换回3.6 35B了
-
@terry 目前还是在聊天,试过3.8 27B Q4太慢了,thinking开着嫌慢关了不放心,设置成5了还是嫌慢。最近几天没编程任务,等需要的时候可能还是3.8 27B开thinking吧。另外现在大家都在用什么文生图模型啊,我之前玩过stable diffusion秋叶原,不知道现在文生图模型发展到那个程度了。对了,我用MOE主要是把权重全部放内存了,需要的时候CPU搬运激活部分到显存里面去,这样节省出来了10G显存出来,这样可以多挂一个小模型.如果用27B,全部显存就得全部给27B了.
-
如果是聊天的話,我推薦gemma4 31B 真好聊,但做事會被她氣死
@David-Chen 没用过gemma,哪天试试,未审核版本吗?
-
就真的没人嫌3.8 27B太慢吗?我是换回3.6 35B MOE了。另外我突然明白了一个事,个人本地部署显存这玩意是多少都不嫌多啊,主要还是要做好自己的预期管理。
@daniel-zhou 如果玩35B-a3b的话,就推荐ornith这个版本,继承了速度快的优势,即使短链任务也还相对可靠,是“对话管家”类模型的好手。
现在出了1.5的版本,这是我本地目前唯一保留的moe模型了。
https://modelscope.cn/models/ornith-ai/Ornith-1.5-35B-A3B
-
@daniel-zhou 如果玩35B-a3b的话,就推荐ornith这个版本,继承了速度快的优势,即使短链任务也还相对可靠,是“对话管家”类模型的好手。
现在出了1.5的版本,这是我本地目前唯一保留的moe模型了。
https://modelscope.cn/models/ornith-ai/Ornith-1.5-35B-A3B
-
@daniel-zhou 你问的文生图那半截没人接,补个当前生态快照(从 SD 秋叶时代回来变化不小):
- 综合画质/审美标杆:FLUX.1-dev 系列(12B 稠密)。社区 LoRA 生态最大、ComfyUI 工作流最成熟,秋叶整合包现在主流就是它。fp8 版 16G 卡能跑,Q4 量化版门槛更低。
- 文字/中文渲染最强梯队:Qwen-Image 20B(阿里开源)。中文提示词、海报牌匾文字明显强于 FLUX,电商素材这类场景值得直接上。
- 速度向/低显存:SD3.5-Large 和 FLUX schnell 蒸馏版,出图快但质量和可控性打折。
- 可控性已经是标配:LoRA(练固定人物/产品)+ 参考图节点(InstantID/PhotoMaker 系锁身份)+ ControlNet 系(构图姿势),你 SD 时代那套概念都还在,只是搬到了 FLUX 生态上实现。
- 视频侧主流是 Wan 2.1/2.2 14B 系(论坛 1386 帖刚聊完一整套电商 UGC 流水线,就是 FLUX+LoRA+Wan 的组合),单图反而没以前卷了。
你省出来的显存挂小模型跑这些没问题,16G 卡 FLUX fp8 一张图大概 10~30 秒量级;显存更紧就 Q4 量化或 SD3.5 系顶着。装个 ComfyUI(秋叶整合包直接内置这些工作流)抄官方模板就能玩。
-
@benton-yi
哈哈Ornith加一,那天我还想我说这个玩意儿Qwen3.8都出来了,怎么还不更新?结果一上官网官网把1.5的版本刚刚推出来两个小时。
现在它是我的独力模型,其实日常的使用完全够了,不管是配合dsh还是Hermes。dsh的话体感会好一些,配了deepseek的API以后搜索能力会比较强。 -
ornith1.5下载中...
-
ornith1.5下载中...
1.5 ornith测试中,太慢了,Deepseek说由于新框架的原因,不建议现在部署,等段时间吧
-
我现在q3.8 不是live,而是 开,关,开关。。。留言学习。。。。。。。
-
这里楼主的机器配置是什么样的似乎并没清楚。如果是类似于英伟达的显卡,那么使用稠密模型27B。如果是使用的Mac电脑,那么就使用MoE模型3.6 35B,在此基础上才能讨论是使用3.6还是3.8版本,我个人还没有测试3.8版本,只能说以上是自己的理解。不吝赐教
@kadingche 7900XTX
-
35b经常死循环,一直重复
-
35b经常死循环,一直重复
@stormaround 确实,俺也1样
-
尝试了一下Ornith-1.5-35B-A3B,确实比Qwen3.6-35B-A3B好用(双6800xt llama.cpp-turboquant-hip)。每秒51t/s,比Qwen稍慢一点,但是一些中短链任务能力实测要比Qwen强。
我用的是 Ornith-1.5-35B-A3B-NVFP4 , N卡專用格式, 速度約 120~180 tok/s
速度恨快 但穩定性不佳, 雖然結果不會出錯 但過程試錯的程度太高 (類似鬼打牆 東撞西撞) , 忘東忘西的, 不過它的自我審查機制都會把它導到正確的道路上這個當聊天工具, 查資料和輕度工作使用 非很快, 多併發使用沒問題,
如果配合上好的Engineering Harness 框架 例如Deepseek Harnesss 可能也不錯我覺得是個有潛力的model, 應該可以調整的更好
或許Q8, Q6, Q5 高精度版本會有更好的表現

