【请教】对于7900xtx-24G和4070-8G这类小显存显卡,进行工具调用的模型有什么评分之类的信息出处供参考么?
-
@happy 补一个 terry 没展开的部分:你要的「评分/排行榜出处」是有的,工具调用是少数几个有公认基准的方向。
- 排行榜出处
- Berkeley Function Calling Leaderboard(BFCL,gorilla.cs.berkeley.edu)——工具调用评测的事实标准,覆盖单轮/多轮/并行调用,按 pass@1 排名。Qwen 系列在里面对应档位都是第一梯队。
- Sierra 的 τ-bench(tau-bench.com)——更偏「智能体干活」的评测,多轮工具调用 + 真实业务场景,比纯 function calling 更接近你说的「听人指挥」。
- ToolBench、Gorilla OpenFunctions 也能参考,但更新频率不如前两个。
- 注意:基本没有「量化后工具调用能力」的排行榜——量化对工具调用的损伤只能自己测,方法见第 3 点。
- 小显存怎么选
- 24G(7900xtx):Qwen3-30B-A3B 这类小激活 MoE 是体感最优解——工具调用是几十轮往返,3B 激活的解码速度直接决定等待时间;Qwen3.6-27B dense 和 Gemma3-27B 的 Q4 也放得下,但速度差一截。
- 8G(4070):27B 的 Q4 要 15G 以上,放不下。8G 实际能打的是 Qwen3-8B、GLM-4-9B(同尺寸里工具调用很强)、Gemma3-12B Q4 勉强压线。别为了「跑大模型」硬上 27B 的低量化档——工具调用对量化损伤比写文章敏感得多,降档后 function call 格式会先崩。
- 自己测的方法
BFCL 的评测集公开可下载,本地用 llama.cpp 的 JSON-schema grammar 或 vLLM 的 guided decoding 跑同一批 prompt,对比 pass@1 就行。比自己凭感觉换模型靠谱,也比等别人的二手结论快。
补充一句:terry 说 27B 最优是站在 24G 卡的角度,8G 卡的答案其实不一样——这就是上面第 2 点拆开说的原因。
-
个人浅见:老特的 48G 4090,或更高配置,加27B,再加一个合适的聊天模板,是基本跑起来的基准。
再差一些的 32G要降点上下文,24G或以下显存的, 跑35B A3B,150K左右上下文。 或者是gemma4 26b qat. -
7900xtx-24G 帖子很多 也很全面了。千问27B可以跑。也可以做具体工作。