Your browser does not seem to support JavaScript. As a result, your viewing experience will be diminished, and you have been placed in read-only mode.
Please download a browser that supports JavaScript, or enable it if it's disabled (i.e. NoScript).
GPT5.6-SOL 模型幻覺吹噓自己的同類 ?
Qwen3.8-27B-Q4 整體大約像 6–10 年經驗的 Senior Engineer
考官模型 :GPT5.6-SOL (網頁版) 受測模型規格 :Qwen3.8-27B-Q4_K_M ctx : 80K KV cache: q8 Chat template : Frog Reasoning: ON
讓雙方對壘後來回十輪 SOL給出的評價
GPT5.6-SOL (網頁版) vs. Qwen3.8
说实话各种测试都是单轮技术问题,在项目稍微复杂时候它还是需要大点的知识权重,否则你就要不断提醒它具体事情怎么做。长链复杂调用,它还是无法取代大尺寸的模型。我在想办法看看怎么分解工作,省钱还是很多人关心的。
既然收费API 干不过对手,就蒸馏他们的能力到小模型,然后给社区免费玩,把水搅浑,这就是千问给我的感觉。
@stxpnet 说: 既然收费API 干不过对手,就蒸馏他们的能力到小模型,然后给社区免费玩,把水搅浑,这就是千问给我的感觉。
@stxpnet 说:
确实体感就是这样,肯定是后训练放飞自我了。 至于说放飞自我的手段就不得而知了。
否则无法解释其小模型和大模型之间的agent能力差距不成比例的问题。
尤其3.8这代,这27B感觉塞得全是“答案”
@stxpnet said: 就蒸馏他们的能力到小模型,然后给社区免费玩,把水搅浑
@stxpnet said:
就蒸馏他们的能力到小模型,然后给社区免费玩,把水搅浑
突然想到OpenClaw的作者 Peter Steinberger 非常好奇 Peter 為何要把OpenClaw 下放到民間 明明只有頂級AI公司可以用的代理人架構
@kos-or 这个有他个人机遇的原因,他靠这个也确实进入了openAI。
做开源要么图名声,要么图利益。要么全都要。
qwen3.8-27B目前的问题就出在27B上。太容易被劣质信息源给带偏。虽然它可以靠很强的后训练对齐能力自查纠偏,但浪费的时间和算力是实打实的。
更何况有时候掉坑里实在爬不出来,把自己逼死循环了也很狼狈。
这也是小模型的代价。
@kop-wang
他下放了代理人架構 打破(顛覆)了當時舊有的生態系 影響非常深遠的 (當然Hermes' Nous Research 也有可能當第一位破局者 假設沒Peter 的話 )
@kop-wang said: 虽然它可以靠很强的后训练对齐能力自查纠偏,但浪费的时间和算力是实打实的。
@kop-wang said:
虽然它可以靠很强的后训练对齐能力自查纠偏,但浪费的时间和算力是实打实的。
這點倒是真的, Reasoning On, 它花了33分鐘在Deepseek harness的框架下, 時間很長, 做了好幾次的自查纠偏, 不過最後還是解出了難題
不考慮時間問題, 這樣的自查纠偏(自我審核)能力 在Hermes上使用它 目前Agentic的品質還不錯 沒之前Qwen3.6-27B那樣讓我擔心不想使用
@terry said: 说实话各种测试都是单轮技术问题,在项目稍微复杂时候它还是需要大点的知识权重
@terry said:
说实话各种测试都是单轮技术问题,在项目稍微复杂时候它还是需要大点的知识权重
我怎麼感覺這模型你把它放在DGX Station 開個50 Agents 同時去跑 做夢都會笑
128 AI Agents 在Nvidia DGX Station 上 同時開跑 (Local LLM) https://youtu.be/qV_K0nTF6gY?si=AH_iev_BndXF4FMd&t=943
有意思,壕无人性
你好!看起来您对这段对话很感兴趣,但您还没有一个账号。
厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。
有了你的建议,这篇帖子会更精彩哦 💗