最近agent工具和底层模型层出不穷,为了搞清楚每个工具最适合做什么,好早日实现标准化大型仓库的全本地化工作流,做了一个跨工具/模型控制变量实验探索各个工具/模型相比其他可选项的特点,主要集中在Qwen3.6-27B/Qwen3.8-27B,Hermes 0.16/Hermes 0.20,Deepseek Harness rc07。收获一些心得,特此分享,实验文档做了脱敏,不影响核心实验结论输出
Tony Xu 0
@Tony Xu 0
-
真实大型 Python 仓库上的自治软件工程全本地化Agent实验载荷 -
rtx pro 6000 max-q配合qwen3.6 MTP开到20收获前所有见的效率Avg generation throughput: 241.9 tokens/s
MTP = 20 可以高達這個速度嗎?
是的,但是要优化输出结构,实际之后又试了MTP=30/40,请求处理跑起来以后生成速度稳定上350 tokens/s,但是效率收益递减,没再开