根据论坛上的大佬们的贴子,将我的3090跑起来了,小任务确实还能应付一下。

尝试了一个将一个3.9万行的项目分别扔进本地部署的qwen3.8,在线的glm5.3flash,glm5.3,要求查bug及提出优化建议。
1、本地部署的Qwen3.8跑了2个小时,上下文竟然还没有爆,但是时间太长了,我只能手动终止,ai自已回复:完成进度:约 25%~30%(6 项待办完成 1 项,第 2 项进行中被中断)。
2、glm5.3flash用时大概在30分钟,中间感觉一直没有输出信息,问了一句什么进度,然后3分钟后输出任务完成。智谱的coding plan V2套餐 pro,显示周使用量从56%增加到58%。
3、glm5.3用时17分6秒,中间没有任务卡顿直接完成任务。智谱的coding plan V2套餐 pro,显示周使用量从58%增加到59%。
glm5.3flash与glm5.3都出了详细的报告,我用deepseek V4 pro帮我做了分析:

两个模型共同提出的16项,只有 glm5.3 指出的问题14项,只有 glm5.3flash 指出的问题也是14项。感觉这两个在线api也是傻,能各自漏掉14个问题?
现在主要问题是,我一个coding plan不够用了,经常跑几下就没了,想小任务交给本地部署的qwen3.8 27b来跑。但是感觉速度实在是太慢了,而且好像也感觉不太靠谱。如果加多一张3080 20G,不知道对速度提升大不大,像现在这样,在线的glm跑十几~三十分钟的任务,本地跑二个小时还是30%进度的话,意义真是不大了。







。
。应该是坚持一个agent加一个大模型会好一点吗?