Your browser does not seem to support JavaScript. As a result, your viewing experience will be diminished, and you have been placed in read-only mode.
Please download a browser that supports JavaScript, or enable it if it's disabled (i.e. NoScript).
R97002双卡,太拉夸了。我sglang R97002,第二天就退了。直入了4090D-48G,不开加速SGLANG 32t/s,开了MTP60-80t/s,chunk 4K\8K\16K速度在1400-1500t/s的样子。。不过sglang的mtp开启后命中降低得不偿失。现在考虑关闭MTP。。
干觉对于R9700来说推理框架支持WMMA和不支持就是俩卡!哈哈,我开了现在跑35BQ5,工具调用什么的堪比V4 flash一点也不拉跨,PP3800,原地起飞!
@fcme 35B Q5 +1,这个模型处理 Human In The Loop 类型的任务很不错,长任务在 context 接近极限时容易出现循环或者过度思考
@倭寇国を滅ぼす 请问找到更加适合的模型吗?我也是开了MTP之后就感觉降智了
@linkdesu Ornith 的版本我实测更好,他们官方放出的最低两化版本就是Q5,看来是有道理的。我用了一个日常工作当中用得到的比较难的三个场景测试,它跟deepseek v4 Flash的性能差距在1%,那基本上就是误差以内了。所以我最近连在线版的fassh都用的少了,哈哈,R9700搭配这个模型基本上日日常够用,需要云端的时候就用GLM5.2做个整体规划和验收就行。
你好,我有一个疑问想问一下,我看你使用SGLang的t/s表现得应该是比Llama.cpp差很多,为什么你要使用它来启动local LLM呢? 是它有什么更特别的地方吗?
@艷陽天 radix缓存树,简单说,prefill快很多,而Agent,长输入,短输出,预填充更重要。
这是未来的发展方向。看了KIMI K3 的左右互搏术。多线程即可以增加 AI的智力。这个方向目前看是正确的。 AI 这玩意 又快又好 很难哈。K3 玩了一手 乱拳打死老师傅。 一群低速的 Agent 一样能成事。
@smax 用越狱的FP8的都还不错,MTP真不能开,模型的原理是概率推测,TMP开启后会导致幻觉增加的风险,原因很简单,在模型推理里面错一个字后面的内容就往错的方向发展了。只有一个一个字的推,才能保证幻觉最低。
@terry 你不打算开的个电报群嘛,
看来看去我还是老老实实用云端,你们这24g都是入门级别
@付贵 现实就是这样啊,过时 的开源模型不会有人再研究打磨。 都盯着前沿模型去的。
@用户名违规 没有什么不能子啊论坛公开讨论的,版主有电报群,其他的不会开。我开电报群还不如搞下直播,和大家吹牛逼。约架抬杠。
你好!看起来您对这段对话很感兴趣,但您还没有一个账号。
厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。
有了你的建议,这篇帖子会更精彩哦 💗