AI 大模型/Agent入门推荐,Qwen3.8 27B/DeepSeek V4 Flash/国产替代模型/GPT, Hermes/Codex/DSH/OpenCode体验对比!
-
这段时间呢,就相继测试了很多AI硬件,也包括大模型,包括这种Agent以及各种工作流,展示了它们的能力。由于今天要送小孩上学,那么本期视频就水一下啊,我们就总结一下如何选择适合自己的大模型以及Agent,甚至说偶尔也会提到一些硬件。
那么首先从这个模型开始,就是Qwen 3.8 27B这个模型,就是当下最好的本地模型,没有之一。从这个3.5时代开始,Qwen的27B模型就一直是本地的性价比之王,它也是性能之王。这不仅仅是性价比的问题,它的综合性能也是遥遥领先。其他的所有本地模型,尽管很多本地模型它的这个跑分也比较好看,但是呢,在这个实际的应用过程中,它们毫无疑问在体验上都是被这个Qwen 3.8 27B给这个吊打。一直以来,就是包括这个谷歌的这个什么Gemma 4家族26B,包括31B模型,还是说是Meta发布的这个Muse Glimmer这个模型,它们都是要挑战Qwen的27B模型,但是实际上最后输得都很难看,都不是输一星半点。所以说在本地我们就不要犹豫了,如果说你要在本地部署一个AI大模型,能够让它干活,那么它毫无疑问就是Qwen 3.8 27B。
当然了,有人会说为什么你不提这个35B A3B模型呢?就一般问出这样问题的人,基本上都是小白啊。那么我也稍微地提一下,就说这个27B模型,它的尺寸虽然不如35B,但是它是稠密模型,它在这个推理的时候是270亿参数全部激活。然后35B A3B模型虽然它这个尺寸是35B,是350亿参数,但是它是MoE模型,混合专家模型,它同时只激活3B的参数,就是30亿的参数。所以说在长链任务这个推理中,它的推理的稳定性和准确性、一致性是没有办法跟27B模型相比的。你每一轮推理都会有一定的误差,那么如果说你一个长链的任务,你可能要十几步、20步,可能要前后几百轮、1000轮,你这个误差不断累进之后,你跟27B模型它最终能够交付的结果可能就是天差地别,甚至就是能与不能,能不能完成任务的这个区别。

当然了,我也知道有些哥们呢,可能说买了一些不太合适的显卡,就是说他们就一定要在这个什么评论区或者在论坛去展示他们用35B A3B模型干了什么。是的,你们展示的那些小玩具,让它写一个简单的脚本,是不是做一些简单的可能说七八步的推理,它也能够胜任。但是问题是,如果说你要把它跟Agent接到一起,让它给你执行这个长期的这个重型的任务,比如说编程开发,可能说前面几步它还干的活还不错,然后可能这个十轮八轮,一两百步之后,它们就变味了。那何必呢?没有必要浪费这个时间。就如果能用的话,我们都不是傻子,就是如果能用一个模型,然后就是跑得又快,又比这个什么27B聪明,我们为什么要接受27B模型呢?这是没有必要的。
那么总结一下,就如果说你在本地有这个大量的编程工作,就像我这样的,我轻度编程,偏向中度吧,轻度到中度之间,再加上我的论坛的一些脚本的维护,那么我使用DeepSeek V4 Flash,我每个月大概要花费300多块钱。

请注意,这里面还没有排除掉我使用这个Qwen 27B编程的这个情况,如果说全部算上的话,我估计一个月可能500块钱不一定能挡住。如果说你是重度编程的话,就是专业的程序员,或者说你在本地有大量的文档要处理,有这种合规要求,那么你还是去买一张显卡去部署这个Qwen 3.8 27B,就比较划算。因为这种情况下,你如果用在线模型的话,哪怕是最便宜的DeepSeek V4 Flash,1000块钱一个月也挡不住。甚至说如果说你是重度编程的话,我感觉100块钱一天呢,你用这个DeepSeek V4 Flash就轻轻松松是能给你搞掉的。
那么你想想,如果说你一个月要花一两千块钱,甚至3000块钱,那么你这个一年下来你要花好几万。有这个钱你为什么不去买一个4090 48G魔改卡,或者去买一个RTX Pro 4500,或者说是4080S 32G魔改卡,R9700 Pro,就AMD的AI PRO R9700,那你可以去买这个卡呀。那么这些卡部署Qwen 27B之后,它虽然体验上不一定有这个在线模型好,可能说速度要慢一点,但是这个差距是可以接受的,并且95%的工作你都不要再用这个在线API了,你都可以在本地完成,这是非常划算的。

另外呢,就说如果说你本身有这个什么生成图片,或者说是生成视频的这个需求,无论你是玩这个什么Flux,还是玩这个什么Qwen Image、ZImage,或者说是LTX、Wan,以及这个MiniMax H3,那你要知道,你如果是使用在线的这个AI来生成图片和视频的话,你有多少钱都挡不住,就你的钱包肯定是不够的。就这些任务它的Tokens消耗,它的API消耗要比这个什么我们用这个AI大模型来编程要高得多,这是高一个指数级别。在这种情况下,你去买一个48G显存的,或者说一个最起码得32G显存的这个卡来辅助你创作,那这个收益应该说,我觉得半年可能不要,你就能回本。
那么刨除你在本地有这个隐私、抗审查,还有就是说有大量的这种日常消耗的这种情况下,其他的所有情况,你都应该毫无疑问地去选择在线的API。因为在线的API它这个毕竟是集群服务,它是7×24小时在线,就掉线的情况是非常非常少的,而且你不用忍受本地这个噪音。就我们本地无论是4090 48G魔改卡,还是4080S 32G魔改卡,还是RTX Pro 4500、R9700,或者是RTX Pro 5000,那么它们都是这个涡轮卡,这个运行起来的噪音是相当大的。可能说情况比较好的,就是像什么7900 XTX、5090这种消费卡,它们的噪音可能说要稍微小一点,能够接受,但是毕竟你比起这个在线的AI,这种体验还是有差距的。
那么在线的大模型中,我就首推这个DeepSeek V4 Flash。就说这个模型非常的智能,非常的全能,你无论用它来干什么,它都是在线模型中应该说是性价比最高的,甚至说它目前就是最便宜的。然后它的能力呢,我可以说可以完成绝大部分人99%的工作。即便你是程序员,这种使用场景比较深度的情况,那么DeepSeek V4 Flash也能满足95%的这种情况需求。当然了,我们国产的一些替代模型,像小米的MiMo V2.5,这个GLM-5.3-Flash,什么腾讯的HY3、HY4,这些可能说都有各自的特点。其实我对HY4这个怎么说呢,印象不是很好,HY3我认为性价比还是挺不错的。就说国产模型是有这个替代的,包括MiniMax,这个什么Qwen,都有自家的模型,也包括豆包了,就各有特点,就你们根据自己的情况去选择。

国产的模型,讲实话能够满足你90%、95%的需求。如果说国产的模型实在是满足不了你,你要上那个高端的,甚至连你觉得连Kimi K3这样的,跑分跟OpenAI、跟这个Anthropic顶级模型非常接近的这样的大模型,将近3万亿参数的这个大模型,都不能满足你的需求,你就一定要用这个国外的模型,那么行不行?当然是可以的嘛。其实GPT它的订阅套餐我是比较推荐的,当然了,这个Anthropic也有自己的订阅套餐,不过从这个使用的友善度上来讲的话,还是OpenAI它更加友善。就是Anthropic它对于中国人使用它的模型是有各种各样的限制,就是总之你要搞定它,成本很高。就它能够带来的这个效能提升,我本人感觉,反正我是觉得是微乎其微的。如果说你一定要有高端的需求,我是建议你直接就上GPT-5.6 Sol,就跟着OpenAI就行了。
然后呢,OpenAI呢,它的这个套餐,就是20美金的套餐,我认为是目前所有的这个AI订阅套餐中性价比最高的,没有之一。就它的这个GPT Image给的额度是比较足的,如果说你每天用来画画图,像我同时有好几个油管频道在经营,用它来生成封面,基本上就是一次两次,最多3次就能够把你想要的这个封面给生成成功。就这个体验就非常的好,然后包括它生成的效果其实也都挺不错的。
它给的这个GPT 5.6 Luna,就虽然我觉得它用来编程、执行这个长链任务,我个人感觉是比较蠢。很多人说它能够调教,把这个思考模式什么提高之后,它就能够变得比较聪明,反正我本人感觉它还是比较傻的。不过如果说用它来搜索,用它来翻译,用它来执行一些日常的对话,它的这个额度给的是非常非常的足。你在网页版中跟它聊天,普通用户去跟它聊天都不计入你的这个额度消耗。你在这个Codex中去调用它,就它的这个额度好像是5个小时重置一次,还有这个7天,就是5个小时跟7天这两个标准嘛,就是协同重置。基本上你执行一些小的简单任务,它是用不完的。这个就是强烈推荐。
另外呢,应该大家这个避坑,这个就有哪些是大家不要使用的。就举个例子,就说这个什么谷歌的这个Gemini,我长期是20美金每个月的这个订阅,我在过去的视频中也多次展示了贴图。这就口述视频,对着镜头BB的视频我就不展示了,大家可以去翻翻我过往。我曾经是长期把这个Gemini当做主力模型来使用的。就这个模型不知道为什么,就从两个月之前嘛,就变得非常非常的蠢,就完全不如以前了,不如Gemini 3.1,你明白吗?就非常非常的夸张,你也不知道是为什么,就蠢得完全没有办法用。而且它这个图片模型本来是有一定优势的,不过现在体验也不好。这个20美金我认为,除了它有一个小功能,就是能够帮你分析YouTube视频,但是这个功能你即便是不订阅也是可以使用的。所以说Gemini我觉得那个避坑。
然后就是马国公的这个Grok。我是没有专门去订阅这个Grok和SuperGrok,但是我是这个什么Twitter的这个订阅用户,就是X的订阅用户,它会送一些额度给我。说实话这个额度我基本上就没用过,就也是蠢得TMD令人捉急,知道吗?你使用这样的模型就纯粹是属于浪费时间。当然了,如果说你使用这个Grok的高端模型,有些人说体验还不错,你愿意花那个钱,30美金去订阅一个什么SuperGrok,其实如果说你一定有这样的需求,比如说你要做一些政治敏感的视频,就像什么GPT、Gemini,它们经常就会拒绝,就会罢工,但是Grok是不会的。在这种情况下你使用它,它是有一定性价比的。其他时候,马国公的AI,我认为已经死了,知道吗?就他这个什么xAI,已经没有办法抢救了,就它的情况比谷歌还要更加严重,就没有必要在它上面浪费时间,就纯纯的就是坑。

那么喷完这个大模型,我们下面就开始这个介绍Agent。首先呢,我觉得就是说,如果说你是个新手,你日常有些工作,比如像我,我的论坛,它的这个发帖,就是发这个信息帖了,然后给这个什么帖子打这个标签,然后这个论坛软件的这个升级、漏洞的这个维护,就安全漏洞它的这个维护,我开发一些皮肤什么东西的,这些轻度的任务,当然现在开发皮肤已经交给Codex了,以前它也是能够完成的,一些轻度的一些安全插件,都是由这个Hermes来完成的。
就如果说你要有一个日常的工作助手,那么使用这个Hermes,它是非常的稳定,它也是世界顶级的,就目前流量最高的这个AI Agent。就它能够帮助你完成日常任务,当你的这个助手,然后它也能够编程,但是它编程的效率确实是不如DeepSeek Harness,不如Codex,也不如OpenCode。这个你要自己根据自己的场景去选择适合你的这个应用Agent。那么它我是作为日常Agent的这个主推。未来呢,可能DeepSeek Harness能够取代它,但是现在我觉得DeepSeek Harness它还需要这个有一个稳定的版本,最起码发布一个Beta版本之后,我才建议大家把它当做主力的Agent使用,就现在它还是有不少Bug的。
另外呢,Hermes之后呢,就是我刚才说的,就是Codex。就Codex呢,它也能够像Hermes一样当你的日常助手,它这个安装也非常的方便,入手这个难度是最低的。就你直接把它下载下来,在Windows上,在这个什么macOS上,就能够直接用。但是呢,我也必须说,就说它在这个编码方面的效率,我认为是非常高的,尤其是接这个DeepSeek V4 Flash,它的体验是非常的好。它接这个我本地的这个什么Qwen 3.8 27B,用SGLang驱动的话,它的体验也是很好的。但是它作为一个综合的助手,它的这个什么自进化系统,就是自我进化的这个能力,包括这个跨会话的这个记忆能力,跟Hermes比还是有差距的。就它适合长链的重型的这种编程任务、单一任务、比较复杂的任务。哦,对了,它接DeepSeek V4 Pro的编程体验也是非常好的,但是它就是不太推荐作为你这个个人的24小时在线的这个日常助手,因为毕竟它依赖UI嘛,它有CLI,它本身不是服务。
那么接下来就是DeepSeek Harness,就是我最为推荐的这个Agent。就目前呢,它由于NPM版本是这个RC2这个版本,就是还Alpha版本都不算,它的这个主干已经更新到了Alpha版本,但是我还没有去更新,因为我用的是NPM的版本。就DeepSeek Harness很有可能会成为全球最优秀的这个AI Agent。就它发布了短短十几天,不到20天的时间,它的这个GitHub星标已经是跟这个什么Hermes这样的优秀Agent,这样的当下的王者Agent,基本上处于同一个水平了。跟这个OpenCode这样长期发展、长期积淀自己生态的这种编程Agent,也是处于同一个水平。历史上星标数量最多的是这个OpenClaw,这个曾经引爆了全民养龙虾这个火热话题的这个Agent。

不过由于我在很早之前我就预测,我说这个Agent,它的本身框架写得很烂,它的代码质量非常的低,就完全不具备抢救的价值。我认为它迟早有一天会被一个能够自我进化,一个怎么说呢,代码质量比较高、相对稳定的框架取代。当时还有很多人嘲笑我,说我不懂。现在的结果就是证明,它在不久之后就被Hermes给取代了。DeepSeek Harness呢,我认为它目前展现出来的能力,就是它是比这个Hermes的上限要更高。它的稳定性现在还是有一定的Bug,但是它的代码质量是非常高的。我认为再迭代一两个版本,甚至都不用到它发布它的正式版,就是发布Beta版本的时候,我认为它就已经非常可用了。
如果说你是现在刚刚入门,需要一个Agent来帮你总领的话,那么还是推荐Hermes。你如果说一个新手想要使用这个AI Agent立刻开发,我还是推荐这个Codex。当然了,也有不少人推荐这个OpenCode,OpenCode也是一个非常优秀的一个软件。但是呢,我觉得OpenCode TMD界面太丑了,尤其是白色主题,它简直就是看不下去。我很难理解一个AI编程框架为什么要把自己做得这么丑,你把自己做得好看一点,这个就是最基本的呀,你是AI呀。除此之外,它的代码理解能力,包括它的这个什么调度能力,我个人认为是非常好的。如果说你不介意它比较丑,那么使用OpenCode也不错。但是OpenCode跟Codex都不能在这个作为Agent的助手方面来挑战Hermes。
下面就是到这个DeepSeek Harness了。如果说你是接入这个本地的Qwen 3.8 27B模型,它的体验就非常的好。如果是跟它自家的这个DeepSeek V4 Flash或者V4 Pro来配合开发,前一阵子呢是使用V4 Pro的体验比较好,使用V4 Flash效果我认为一般,但是迭代了几个版本之后,我认为现在它使用DeepSeek V4 Flash加上它就是一个黄金生产组合。尤其是这个现在的DeepSeek V4 Flash有这个视觉模块了,它发布了这个视觉版本,它的总体体验就非常非常的不错了。
这个评论区有人问说,怎么样让这个什么DeepSeek Harness支持图片?就如果说你这个模型本身支持图片的话,它这个框架它是支持的,你把它直接复制粘贴进去,或者把它拖进去都是可以的。前提是你的模型要支持。另外你要把它这个版本升级到NPM的最新版,就是这个RC2这个版本,或者说你把它这个官方的这个主分支给它拉下来,现在已经迭代到这个Alpha版本了。

就其实如果说你是愿意去花时间去看一看代码的话,你就应该知道,DeepSeek Harness它虽然也是基于Node.js,跟这个OpenClaw是一样的这个框架,但是你可以认真地读一读它的代码,你就会发现,就它的代码质量是要远远超过OpenClaw。这中间的这个差距,我可以说是天差地别。一个就是正规军的代码,非常的工整、严谨、美观,是工业艺术品;另外一个就是狗屎。真的,说实话,我都不知道这个框架是怎么火起来的,可能是赶上了Agent的这个风口。
它的这个插件系统,我认为设计得也是非常的好。一切都可以作为插件,一切都可以替代,甚至连这个Agent的这个主循环都可以替代。如果说你想长期研究Agent,长期深度定制,开发属于自己的这个AI工作流,那么它目前的这个生态也是足够的繁荣,插件也非常的多,值得你花时间去研究。
好吧,今天扯得有点细碎,就跟大家分享一下我的使用心得。好的,本期视频就到这里,有什么问题欢迎大家到这个论坛去发帖交流讨论,也欢迎在评论区批评指正。