@fcme 老哥,看到你的回复了。你说「测试了不下20个版本后选了 Ornith Q5」——正好我昨天也把 Ornith-1.0-35B 拉下来测了一轮,想请教一下你选的 Q5 是哪个 repo 的量化?(我下的是 SC117 的 APEX MTP 版,I-Balanced 和 I-Quality 都试了)
先贴我的测试环境,方便对齐:
硬件/环境
- GPU:AMD AI PRO R9700 32GB(RDNA4, gfx1201)
- 系统:Ubuntu + ROCm 7.2.4
- 后端:llama.cpp Atomic TurboQuant(b10018-1.3.0),f16 KV + draft-mtp n=3
- 测试工具:Hermes Agent 自动跑(10 题:7 自动评分 + 3 人工 rubric,每模型 3 次取一致性)+ llama-benchy(server 模式,pp=39000 真实上下文)
智力测试结果(Ornith vs 我主力 Qwen3.6-35B-A3B-MTP)
| 模型 | 数学(2题×3次) | 逻辑(3题×3次) | 编程(2题×3次) | 平均/7 |
|---|---|---|---|---|
| Ornith I-Balanced | 0/6 | 6/9 | 6/6 | 4.0 |
| Ornith I-Quality | 0/6 | 6/9 | 6/6 | 4.0 |
| Qwen3.6-35B-A3B-MTP | 0/6 | 7/9 | 6/6 | 4.3 |
注:Ornith 和 Qwen 35B 的差别其实只有一道题——时钟夹角(3:15 → 7.5°)。Qwen 蒙对 1/3,Ornith 稳定答 82.5°。数学两个都是 0/6 全灭(3B active 硬伤),逻辑编程都全稳。说白了两者在智力上基本打平。
llama-benchy 速度(server 模式,pp=39K,3 runs)
| 模型 | pp39K (t/s) | tg100 | tg200 | tg500 |
|---|---|---|---|---|
| Ornith I-Balanced | 2290 | 64.9 | 66.8 | 63.0 |
| Ornith I-Quality | 2327 | 68.4 | 60.6 | 69.0 |
| Qwen3.6-35B-A3B-MTP (prod) | 2558 | 83.2 | 98.3 | 81.5 |
想请教几个问题:
- 速度:你那边 Ornith Q5 的 tg 大概多少?我这边 APEX 版 MTP 头是 graft 自 Qwen3.5 的,tg 只有 ~65,比 Qwen3.6-35B 的 ~98 慢了不少,可能 MTP acceptance 不高。你选 Q5 是不是不用 MTP、直接跑裸模型?如果是的话速度曲线是咋样?
- Agent 场景:你说「Agent 用的时候不便秘」「长链 toolcall 不掉链子」——这块正是我 10 题智力测试测不到的地方(单轮问答测不出 agentic 行为)。Ornith 的 self-scaffolding RL 训练应该在这块有优势。你跑 agent(Hermes/CLINE)的时候,Ornith 对比 Qwen3.5/3.6 在 toolcall 稳定性、长链任务完成率上具体强在哪?有没有量化数据?我打算把 Ornith 挂成二号模型专门跑 agent 任务,但想先确认这个优势是真实的。
- 越狱:确实,本地模型越狱自由度大,云端一点机会没有。这个也是本地党的核心价值之一哈哈。
我自己测下来的结论是:智力层面 Ornith 和 Qwen3.6-35B 基本打平(数学都拉胯,逻辑编程都稳),速度反而慢 30%。所以目前主力还是 Qwen3.6-35B。但如果你说的 agent 场景优势是真的,那 Ornith 的定位就很清晰了——专门跑 agent 任务的二号模型。求指点 
---
(以上测试均由 Hermes Agent 自动执行:写题 → 跑 3 次 → 入 SQLite → 出报告,全程无人工干预。)