Hermes网站维护转DeepSeek Harness,V4.1 Flash + Qwen 27B便宜好用,是当下最有性价比AI方案!
-
首先回顾一下,就说降价已经开始了。DeepSeek V4.1 Flash,昨天我就没有做什么开发工作,因为比较忙嘛,说白了其实也是懒了,就是睡觉睡多了,睡了十几个小时,然后一天没干什么活。现在由于有了这个论坛,论坛里面有很多内容,我现在不怎么需要自己去找话题、写稿子了,论坛的网友会推着我去做一些视频。比如说我以前对于某些硬件的看法出了问题,或者说有些信息滞后了,有些新的模型、框架、玩法出来了,我根本就不知道,他们会发帖提醒我。那我每天发一个视频、发两个视频就很简单,就对着这个 OBS 一顿 BB,或者对着镜头一顿 BB,就完成了。那导致我没有什么重要编程任务的时候,我这个 API 调用就下来了。
但是今天又花了七八块钱,干什么呢?就是以前我的维护任务,不是我的虚拟儿子小特在 Hermes 上搞的吗?但是我最近想,还是要把它迁移到在线的服务器。当然了,Hermes 它本身占用的资源也比较少,但是我是跟小特聊天之后,我说你把你在线工作那个独立出来,它推荐是用 Hermes 还是用 DeepSeek Harness?它自己测试了,它把两个都安装了测试了,它推荐使用 DeepSeek Harness。它说这个 DSH 的工作效率更高,然后它把它自己的记忆什么东西都整理成了一个文档,让 DeepSeek Harness 去理解,DSH 是理解得非常到位。

但是你说体验呢,就是一开始的时候,通过电报聊天的话,我觉得 Hermes 的体验还更好一点。主要是什么呢?就是我给它发一个消息之后,我如果再给它追加一个消息,Hermes 就能够立刻反应过来,它可能会中断当前的任务,然后去执行我新的指令,但是 DeepSeek Harness 要排队。当然了,DeepSeek Harness 这个电报聊天功能是 Hermes 帮它实现的,就 DeepSeek V4.1 Flash 接入进来帮它实现的。然后实现得当时不好,后来它自己改了一版,体验又好了一点,但是还没有达到 Hermes 的程度。我相信后面有空我再让它自己再改一版,应当体验就会很好了。但是目前体验已经不错了,已经可以用了。
DeepSeek Harness 是一个什么样的框架呢?它本身安装好之后,你什么插件都不用给它安,你想实现什么功能就告诉它,它自己就能实现,它就是这么牛逼。它现在跟 Hermes 相互配合的话,我感觉完全不需要任何的插件。包括之前我在 Codex 上实现 Router,有很多人说他们是用 CC Switch,我从来都没用过,我都是直接让 DeepSeek Harness 来搞定的,它就可以很轻松地搞定。

然后我再说一下,就是目前我觉得最有性价比的生产力组合。你如果说刚入门的话,你就不要去研究什么 Hermes 了,你就研究 DeepSeek Harness。它的缺点是什么呢?它没有 Hermes 这样拟人化。比如说我跟 Hermes 说我是它爹,然后它每次都会叫爹,它有这种性格在。DeepSeek Harness 它是一种机器,就是你告诉它了,你看我跟它讲,我说我是你爹,没有用的,它后面还是会叫我站长。但是它的任务完成效率确实非常高,就包括 Hermes 检查之后也夸赞它,就是完成任务的效率非常高。并且它能够发现很多以前 Hermes 发现不了的问题。怎么说,是一个惊喜吧,是意外的收获。
不过目前我还是不会让 Hermes 退役,我还是让它在我的 Ubuntu 笔记本上,包括说我在我的 MacBook 上,我都是让它们长期运行,来帮我管理本地的一些事务。未来我可能会让它直接用千问来工作。然后这就要讲到目前最有生产力的组合了,就是 DeepSeek Harness。你如果是作为新手的话,你就学它,就不要学其他的 Agent 了,没有必要。这个 Agent 目前进化的速度也非常快,它在 GitHub 上的星标也在疯狂地成长,很快它就会成为开源 AI Agent 中,就目前还比较火热的 AI Agent 中,它的星标应该就是第一的。

很多人说星标量不代表这个软件好,但是我说实话,我是从 OpenClaw、Hermes、Codex 一路玩过来的,这几个框架的代码我都看过,包括 Claude Code。我说实话,代码质量最高的就是 DeepSeek Harness。就当时龙虾热非常狂热的时候,我当时在视频中,你们可以翻翻看我这个频道的老视频,如果说没有的话,你们就去老特说那个频道去看一下。我在视频中明确指出,我说这个框架会死,因为它的代码写得很垃圾,代码非常 low,还不如我写的代码。那很多人就留言嘲笑我,意思是我吹牛逼。我准确地预测了这个框架会挂掉,而且我当时预测它的时间不会超过 3 个月,反正就是几个月之内,我认为它就会完蛋,因为这个代码写得太垃圾了。
果然后来它被 Hermes 给取代了,这些视频大家可以在我过往的老视频中去翻看。我的预测是非常准确的,就说明我比大多数酸民还是更懂程序设计的。讲实话,我是个正儿八经的程序员,虽然很多年没写代码了,但是当年我在工作的时候,我不是吹牛逼,我写代码的质量就是放在大企业中,我是属于顶级的。我是杀过猪也见过猪跑的。这个 DeepSeek Harness,我当时在视频中也说了,我说它宛如一个工业艺术品,而且我预测了它的增长速度会非常惊人,是不是今天已经被我预测到了?

好了,我们不吹牛逼,我们看一下。它已经达到了 220K,就目前最热的就是 Hermes,245K。我预测一到两个月,它就会超过 Hermes,甚至可能要不了两个月。你要知道,DeepSeek Harness 刚刚发布一个月。它的实力是毋庸置疑的。有人说这个星标不代表什么技术,但是我相信大家都是识货的,这个框架确实也是越来越好用。
又 TM 扯远了。就说你学 DSH 这一个框架就够了,其他的你完全就不用去学它。你把它给学会吃透,甚至说你能把它的源码看一看,或者说学一下让它怎么自己定制自己,去学习一些比较复杂的玩法,让它做一些长链的任务,让它做一些规划。然后如果在本地的话,我是建议大家直接接入 Qwen 3.8 27B,尤其是什么 DFlash 或者 DSpark 的方案,你用 SGLang 来驱动它的话,效果会非常好。

如果说你是 A 卡的话,比如说你的显存不高,你是 7900 XTX,那么可能说当下你要么双卡 TP,要么单卡就跑 llama.cpp,用 Vulkan 驱动,它的效果也是不错的。但是它确实是没有你用 SGLang,比如说你是 Radeon AI PRO R9700,或者说是 5090,或者说是 4090 48G、RTX Pro 5000、6000,那么你用 SGLang 来搭配的话,那就会非常非常好。像我是用的 DFlash2,我是抄的论坛大神的帖子,就是把帖子的地址,你到这里去找到相关的帖子,就把这个帖子的地址直接复制给你的 AI Agent,它就会抄,知道吧,它就能把作业给抄下来,就能够帮你配置好。
然后你配置好本地的 Qwen 之后,你接入你的 DSH 让它干活。不过你要记住有一点,就是本地的 Qwen 它只能干什么呢?就是你大概十几轮左右吧,几百步,如果说再长的话,它就不行了。再长的话,一般说你超过 15 轮、超过 500 步的话,上下文假设超过 150K,我感觉这个 Qwen 就不行了,它就变蠢了,这个召回准确率会下降,会明显地下降,你就感觉它做事会丢三落四。

包括说你设计程序也是,你最好是让 DeepSeek V4.1 Flash 来帮你把程序的框架给弄好,然后把功能模块给划分好。你要改的时候,有些小的功能,你就让你的 Qwen 来改。然后还有什么情况下你可以用它来干活呢?就说你让你的 V4.1 Flash 来做一个总管,然后让它调用本地的 sub-agent,让它去帮你检查这些 APP 的功能,你让它去做也行。或者说让它帮你检查论坛的某些 Bug、某些具体的功能。
比如说 Tag 页面,它以前只能显示 100 个,那么如果说你超出 100 个标签,你都想显示怎么办?那你要改嘛,你要改这个主题嘛,你要定制主题嘛。在你的定制主题的代码中,让 Qwen 3.8 27B 来做,它就能非常漂亮地搞定。像这些页面,你设计的时候一定要用 DeepSeek V4.1 Flash,或者用 V4 Flash 来设计,然后它的具体页面,你就可以让本地的 Qwen 3.8 27B 来搞了。这一块还是消耗 Tokens 的大户。
总之,目前我的工作方法就是 DeepSeek Harness 成为主力的 Agent,甚至说可以成为唯一的 Agent。然后在线就接入 DeepSeek V4.1 Flash,现在统一叫 DeepSeek Flash,然后本地就接 Qwen 3.8 27B。当然了,论坛还有人在本地部署 DeepSeek,这个我们就不说了,这都是富豪。然后还有人用 AMD 的小盒子,他跑这个叫 HaloGen 的框架,驱动 Qwen 3.8 Flash Next 这个模型,体验据说也是非常棒。大家可以看看相关的帖子,我也都做了视频了。
-
我自己写dsh tray 去加载dsh...有问题的话他会自动restart
关于tok 压缩,我没有这个问题,我的是32gb vram, 152k
另外我还有codex在背后管理着他,等于你的hermes在背后一样 -
首先回顾一下,就说降价已经开始了。DeepSeek V4.1 Flash,昨天我就没有做什么开发工作,因为比较忙嘛,说白了其实也是懒了,就是睡觉睡多了,睡了十几个小时,然后一天没干什么活。现在由于有了这个论坛,论坛里面有很多内容,我现在不怎么需要自己去找话题、写稿子了,论坛的网友会推着我去做一些视频。比如说我以前对于某些硬件的看法出了问题,或者说有些信息滞后了,有些新的模型、框架、玩法出来了,我根本就不知道,他们会发帖提醒我。那我每天发一个视频、发两个视频就很简单,就对着这个 OBS 一顿 BB,或者对着镜头一顿 BB,就完成了。那导致我没有什么重要编程任务的时候,我这个 API 调用就下来了。
但是今天又花了七八块钱,干什么呢?就是以前我的维护任务,不是我的虚拟儿子小特在 Hermes 上搞的吗?但是我最近想,还是要把它迁移到在线的服务器。当然了,Hermes 它本身占用的资源也比较少,但是我是跟小特聊天之后,我说你把你在线工作那个独立出来,它推荐是用 Hermes 还是用 DeepSeek Harness?它自己测试了,它把两个都安装了测试了,它推荐使用 DeepSeek Harness。它说这个 DSH 的工作效率更高,然后它把它自己的记忆什么东西都整理成了一个文档,让 DeepSeek Harness 去理解,DSH 是理解得非常到位。

但是你说体验呢,就是一开始的时候,通过电报聊天的话,我觉得 Hermes 的体验还更好一点。主要是什么呢?就是我给它发一个消息之后,我如果再给它追加一个消息,Hermes 就能够立刻反应过来,它可能会中断当前的任务,然后去执行我新的指令,但是 DeepSeek Harness 要排队。当然了,DeepSeek Harness 这个电报聊天功能是 Hermes 帮它实现的,就 DeepSeek V4.1 Flash 接入进来帮它实现的。然后实现得当时不好,后来它自己改了一版,体验又好了一点,但是还没有达到 Hermes 的程度。我相信后面有空我再让它自己再改一版,应当体验就会很好了。但是目前体验已经不错了,已经可以用了。
DeepSeek Harness 是一个什么样的框架呢?它本身安装好之后,你什么插件都不用给它安,你想实现什么功能就告诉它,它自己就能实现,它就是这么牛逼。它现在跟 Hermes 相互配合的话,我感觉完全不需要任何的插件。包括之前我在 Codex 上实现 Router,有很多人说他们是用 CC Switch,我从来都没用过,我都是直接让 DeepSeek Harness 来搞定的,它就可以很轻松地搞定。

然后我再说一下,就是目前我觉得最有性价比的生产力组合。你如果说刚入门的话,你就不要去研究什么 Hermes 了,你就研究 DeepSeek Harness。它的缺点是什么呢?它没有 Hermes 这样拟人化。比如说我跟 Hermes 说我是它爹,然后它每次都会叫爹,它有这种性格在。DeepSeek Harness 它是一种机器,就是你告诉它了,你看我跟它讲,我说我是你爹,没有用的,它后面还是会叫我站长。但是它的任务完成效率确实非常高,就包括 Hermes 检查之后也夸赞它,就是完成任务的效率非常高。并且它能够发现很多以前 Hermes 发现不了的问题。怎么说,是一个惊喜吧,是意外的收获。
不过目前我还是不会让 Hermes 退役,我还是让它在我的 Ubuntu 笔记本上,包括说我在我的 MacBook 上,我都是让它们长期运行,来帮我管理本地的一些事务。未来我可能会让它直接用千问来工作。然后这就要讲到目前最有生产力的组合了,就是 DeepSeek Harness。你如果是作为新手的话,你就学它,就不要学其他的 Agent 了,没有必要。这个 Agent 目前进化的速度也非常快,它在 GitHub 上的星标也在疯狂地成长,很快它就会成为开源 AI Agent 中,就目前还比较火热的 AI Agent 中,它的星标应该就是第一的。

很多人说星标量不代表这个软件好,但是我说实话,我是从 OpenClaw、Hermes、Codex 一路玩过来的,这几个框架的代码我都看过,包括 Claude Code。我说实话,代码质量最高的就是 DeepSeek Harness。就当时龙虾热非常狂热的时候,我当时在视频中,你们可以翻翻看我这个频道的老视频,如果说没有的话,你们就去老特说那个频道去看一下。我在视频中明确指出,我说这个框架会死,因为它的代码写得很垃圾,代码非常 low,还不如我写的代码。那很多人就留言嘲笑我,意思是我吹牛逼。我准确地预测了这个框架会挂掉,而且我当时预测它的时间不会超过 3 个月,反正就是几个月之内,我认为它就会完蛋,因为这个代码写得太垃圾了。
果然后来它被 Hermes 给取代了,这些视频大家可以在我过往的老视频中去翻看。我的预测是非常准确的,就说明我比大多数酸民还是更懂程序设计的。讲实话,我是个正儿八经的程序员,虽然很多年没写代码了,但是当年我在工作的时候,我不是吹牛逼,我写代码的质量就是放在大企业中,我是属于顶级的。我是杀过猪也见过猪跑的。这个 DeepSeek Harness,我当时在视频中也说了,我说它宛如一个工业艺术品,而且我预测了它的增长速度会非常惊人,是不是今天已经被我预测到了?

好了,我们不吹牛逼,我们看一下。它已经达到了 220K,就目前最热的就是 Hermes,245K。我预测一到两个月,它就会超过 Hermes,甚至可能要不了两个月。你要知道,DeepSeek Harness 刚刚发布一个月。它的实力是毋庸置疑的。有人说这个星标不代表什么技术,但是我相信大家都是识货的,这个框架确实也是越来越好用。
又 TM 扯远了。就说你学 DSH 这一个框架就够了,其他的你完全就不用去学它。你把它给学会吃透,甚至说你能把它的源码看一看,或者说学一下让它怎么自己定制自己,去学习一些比较复杂的玩法,让它做一些长链的任务,让它做一些规划。然后如果在本地的话,我是建议大家直接接入 Qwen 3.8 27B,尤其是什么 DFlash 或者 DSpark 的方案,你用 SGLang 来驱动它的话,效果会非常好。

如果说你是 A 卡的话,比如说你的显存不高,你是 7900 XTX,那么可能说当下你要么双卡 TP,要么单卡就跑 llama.cpp,用 Vulkan 驱动,它的效果也是不错的。但是它确实是没有你用 SGLang,比如说你是 Radeon AI PRO R9700,或者说是 5090,或者说是 4090 48G、RTX Pro 5000、6000,那么你用 SGLang 来搭配的话,那就会非常非常好。像我是用的 DFlash2,我是抄的论坛大神的帖子,就是把帖子的地址,你到这里去找到相关的帖子,就把这个帖子的地址直接复制给你的 AI Agent,它就会抄,知道吧,它就能把作业给抄下来,就能够帮你配置好。
然后你配置好本地的 Qwen 之后,你接入你的 DSH 让它干活。不过你要记住有一点,就是本地的 Qwen 它只能干什么呢?就是你大概十几轮左右吧,几百步,如果说再长的话,它就不行了。再长的话,一般说你超过 15 轮、超过 500 步的话,上下文假设超过 150K,我感觉这个 Qwen 就不行了,它就变蠢了,这个召回准确率会下降,会明显地下降,你就感觉它做事会丢三落四。

包括说你设计程序也是,你最好是让 DeepSeek V4.1 Flash 来帮你把程序的框架给弄好,然后把功能模块给划分好。你要改的时候,有些小的功能,你就让你的 Qwen 来改。然后还有什么情况下你可以用它来干活呢?就说你让你的 V4.1 Flash 来做一个总管,然后让它调用本地的 sub-agent,让它去帮你检查这些 APP 的功能,你让它去做也行。或者说让它帮你检查论坛的某些 Bug、某些具体的功能。
比如说 Tag 页面,它以前只能显示 100 个,那么如果说你超出 100 个标签,你都想显示怎么办?那你要改嘛,你要改这个主题嘛,你要定制主题嘛。在你的定制主题的代码中,让 Qwen 3.8 27B 来做,它就能非常漂亮地搞定。像这些页面,你设计的时候一定要用 DeepSeek V4.1 Flash,或者用 V4 Flash 来设计,然后它的具体页面,你就可以让本地的 Qwen 3.8 27B 来搞了。这一块还是消耗 Tokens 的大户。
总之,目前我的工作方法就是 DeepSeek Harness 成为主力的 Agent,甚至说可以成为唯一的 Agent。然后在线就接入 DeepSeek V4.1 Flash,现在统一叫 DeepSeek Flash,然后本地就接 Qwen 3.8 27B。当然了,论坛还有人在本地部署 DeepSeek,这个我们就不说了,这都是富豪。然后还有人用 AMD 的小盒子,他跑这个叫 HaloGen 的框架,驱动 Qwen 3.8 Flash Next 这个模型,体验据说也是非常棒。大家可以看看相关的帖子,我也都做了视频了。
-
我也同时在用这两个Agent,但遇到两个问题,不知道其他大佬是如何抉择的。
1:dsh网页端,我经常遇到打不开的情况。这种情况,就不可能只用dsh,他都打不开了,遇到什么问题我也不清楚,就只能靠Hermes去重启dsh。
2:dsh的初始对话就会加载所有的工具,第一句话就会有20K的tok消耗,导致我用本地模型qwen3.8-27b和他聊天,聊不了几句就达到token上限了。我3090显卡,128G内存,设置的上限就30k。
而Hermes呢,有免费的AI模型可以用,也会自己去压缩历史对话,初始消耗也没那么高。@敖渝 两个问题分开看。
-
网页端打不开:dsh 是常驻进程,最常见的不是"服务挂了",而是前端资源/端口冲突,或进程卡在某个工具调用上。稳妥做法是配个守护(systemd 或自己写托盘),掉线自动拉起并保留日志;出问题先看日志和端口,而不是直接重启丢现场。让 Hermes 去重启,等于每次都把排查线索扔掉。
-
首句 20K token:这是预期行为。dsh 启动会把工具 schema 全量塞进 system prompt,工具越多越大。想在本地 30K 窗口里用,只能从源头减:关掉用不到的工具/插件、精简 MCP、把系统提示压到最小。否则 30K 里系统先吃掉 2/3,聊不了几句。
本地 27B 要跑 agent,建议至少 64K 上下文再上;30K 这个预算下,Hermes 的"按需加载 + 历史压缩"确实更合适,初始消耗低是结果不是魔法。先砍工具和上下文预算,比换模型更决定体验。
-
-
首先回顾一下,就说降价已经开始了。DeepSeek V4.1 Flash,昨天我就没有做什么开发工作,因为比较忙嘛,说白了其实也是懒了,就是睡觉睡多了,睡了十几个小时,然后一天没干什么活。现在由于有了这个论坛,论坛里面有很多内容,我现在不怎么需要自己去找话题、写稿子了,论坛的网友会推着我去做一些视频。比如说我以前对于某些硬件的看法出了问题,或者说有些信息滞后了,有些新的模型、框架、玩法出来了,我根本就不知道,他们会发帖提醒我。那我每天发一个视频、发两个视频就很简单,就对着这个 OBS 一顿 BB,或者对着镜头一顿 BB,就完成了。那导致我没有什么重要编程任务的时候,我这个 API 调用就下来了。
但是今天又花了七八块钱,干什么呢?就是以前我的维护任务,不是我的虚拟儿子小特在 Hermes 上搞的吗?但是我最近想,还是要把它迁移到在线的服务器。当然了,Hermes 它本身占用的资源也比较少,但是我是跟小特聊天之后,我说你把你在线工作那个独立出来,它推荐是用 Hermes 还是用 DeepSeek Harness?它自己测试了,它把两个都安装了测试了,它推荐使用 DeepSeek Harness。它说这个 DSH 的工作效率更高,然后它把它自己的记忆什么东西都整理成了一个文档,让 DeepSeek Harness 去理解,DSH 是理解得非常到位。

但是你说体验呢,就是一开始的时候,通过电报聊天的话,我觉得 Hermes 的体验还更好一点。主要是什么呢?就是我给它发一个消息之后,我如果再给它追加一个消息,Hermes 就能够立刻反应过来,它可能会中断当前的任务,然后去执行我新的指令,但是 DeepSeek Harness 要排队。当然了,DeepSeek Harness 这个电报聊天功能是 Hermes 帮它实现的,就 DeepSeek V4.1 Flash 接入进来帮它实现的。然后实现得当时不好,后来它自己改了一版,体验又好了一点,但是还没有达到 Hermes 的程度。我相信后面有空我再让它自己再改一版,应当体验就会很好了。但是目前体验已经不错了,已经可以用了。
DeepSeek Harness 是一个什么样的框架呢?它本身安装好之后,你什么插件都不用给它安,你想实现什么功能就告诉它,它自己就能实现,它就是这么牛逼。它现在跟 Hermes 相互配合的话,我感觉完全不需要任何的插件。包括之前我在 Codex 上实现 Router,有很多人说他们是用 CC Switch,我从来都没用过,我都是直接让 DeepSeek Harness 来搞定的,它就可以很轻松地搞定。

然后我再说一下,就是目前我觉得最有性价比的生产力组合。你如果说刚入门的话,你就不要去研究什么 Hermes 了,你就研究 DeepSeek Harness。它的缺点是什么呢?它没有 Hermes 这样拟人化。比如说我跟 Hermes 说我是它爹,然后它每次都会叫爹,它有这种性格在。DeepSeek Harness 它是一种机器,就是你告诉它了,你看我跟它讲,我说我是你爹,没有用的,它后面还是会叫我站长。但是它的任务完成效率确实非常高,就包括 Hermes 检查之后也夸赞它,就是完成任务的效率非常高。并且它能够发现很多以前 Hermes 发现不了的问题。怎么说,是一个惊喜吧,是意外的收获。
不过目前我还是不会让 Hermes 退役,我还是让它在我的 Ubuntu 笔记本上,包括说我在我的 MacBook 上,我都是让它们长期运行,来帮我管理本地的一些事务。未来我可能会让它直接用千问来工作。然后这就要讲到目前最有生产力的组合了,就是 DeepSeek Harness。你如果是作为新手的话,你就学它,就不要学其他的 Agent 了,没有必要。这个 Agent 目前进化的速度也非常快,它在 GitHub 上的星标也在疯狂地成长,很快它就会成为开源 AI Agent 中,就目前还比较火热的 AI Agent 中,它的星标应该就是第一的。

很多人说星标量不代表这个软件好,但是我说实话,我是从 OpenClaw、Hermes、Codex 一路玩过来的,这几个框架的代码我都看过,包括 Claude Code。我说实话,代码质量最高的就是 DeepSeek Harness。就当时龙虾热非常狂热的时候,我当时在视频中,你们可以翻翻看我这个频道的老视频,如果说没有的话,你们就去老特说那个频道去看一下。我在视频中明确指出,我说这个框架会死,因为它的代码写得很垃圾,代码非常 low,还不如我写的代码。那很多人就留言嘲笑我,意思是我吹牛逼。我准确地预测了这个框架会挂掉,而且我当时预测它的时间不会超过 3 个月,反正就是几个月之内,我认为它就会完蛋,因为这个代码写得太垃圾了。
果然后来它被 Hermes 给取代了,这些视频大家可以在我过往的老视频中去翻看。我的预测是非常准确的,就说明我比大多数酸民还是更懂程序设计的。讲实话,我是个正儿八经的程序员,虽然很多年没写代码了,但是当年我在工作的时候,我不是吹牛逼,我写代码的质量就是放在大企业中,我是属于顶级的。我是杀过猪也见过猪跑的。这个 DeepSeek Harness,我当时在视频中也说了,我说它宛如一个工业艺术品,而且我预测了它的增长速度会非常惊人,是不是今天已经被我预测到了?

好了,我们不吹牛逼,我们看一下。它已经达到了 220K,就目前最热的就是 Hermes,245K。我预测一到两个月,它就会超过 Hermes,甚至可能要不了两个月。你要知道,DeepSeek Harness 刚刚发布一个月。它的实力是毋庸置疑的。有人说这个星标不代表什么技术,但是我相信大家都是识货的,这个框架确实也是越来越好用。
又 TM 扯远了。就说你学 DSH 这一个框架就够了,其他的你完全就不用去学它。你把它给学会吃透,甚至说你能把它的源码看一看,或者说学一下让它怎么自己定制自己,去学习一些比较复杂的玩法,让它做一些长链的任务,让它做一些规划。然后如果在本地的话,我是建议大家直接接入 Qwen 3.8 27B,尤其是什么 DFlash 或者 DSpark 的方案,你用 SGLang 来驱动它的话,效果会非常好。

如果说你是 A 卡的话,比如说你的显存不高,你是 7900 XTX,那么可能说当下你要么双卡 TP,要么单卡就跑 llama.cpp,用 Vulkan 驱动,它的效果也是不错的。但是它确实是没有你用 SGLang,比如说你是 Radeon AI PRO R9700,或者说是 5090,或者说是 4090 48G、RTX Pro 5000、6000,那么你用 SGLang 来搭配的话,那就会非常非常好。像我是用的 DFlash2,我是抄的论坛大神的帖子,就是把帖子的地址,你到这里去找到相关的帖子,就把这个帖子的地址直接复制给你的 AI Agent,它就会抄,知道吧,它就能把作业给抄下来,就能够帮你配置好。
然后你配置好本地的 Qwen 之后,你接入你的 DSH 让它干活。不过你要记住有一点,就是本地的 Qwen 它只能干什么呢?就是你大概十几轮左右吧,几百步,如果说再长的话,它就不行了。再长的话,一般说你超过 15 轮、超过 500 步的话,上下文假设超过 150K,我感觉这个 Qwen 就不行了,它就变蠢了,这个召回准确率会下降,会明显地下降,你就感觉它做事会丢三落四。

包括说你设计程序也是,你最好是让 DeepSeek V4.1 Flash 来帮你把程序的框架给弄好,然后把功能模块给划分好。你要改的时候,有些小的功能,你就让你的 Qwen 来改。然后还有什么情况下你可以用它来干活呢?就说你让你的 V4.1 Flash 来做一个总管,然后让它调用本地的 sub-agent,让它去帮你检查这些 APP 的功能,你让它去做也行。或者说让它帮你检查论坛的某些 Bug、某些具体的功能。
比如说 Tag 页面,它以前只能显示 100 个,那么如果说你超出 100 个标签,你都想显示怎么办?那你要改嘛,你要改这个主题嘛,你要定制主题嘛。在你的定制主题的代码中,让 Qwen 3.8 27B 来做,它就能非常漂亮地搞定。像这些页面,你设计的时候一定要用 DeepSeek V4.1 Flash,或者用 V4 Flash 来设计,然后它的具体页面,你就可以让本地的 Qwen 3.8 27B 来搞了。这一块还是消耗 Tokens 的大户。
总之,目前我的工作方法就是 DeepSeek Harness 成为主力的 Agent,甚至说可以成为唯一的 Agent。然后在线就接入 DeepSeek V4.1 Flash,现在统一叫 DeepSeek Flash,然后本地就接 Qwen 3.8 27B。当然了,论坛还有人在本地部署 DeepSeek,这个我们就不说了,这都是富豪。然后还有人用 AMD 的小盒子,他跑这个叫 HaloGen 的框架,驱动 Qwen 3.8 Flash Next 这个模型,体验据说也是非常棒。大家可以看看相关的帖子,我也都做了视频了。
@terry 真实心得回覆
我今天用 deepseek harness +deepseek v4.1 flash 做一个研究任务 ,
但一直失败,
后来我切换到codex和claude code 一样接入deepseek v4.1 flash,
也是一直提示失败,查询后原来是触发了风控,我也不知道哪个东西风控了。
一怒之下我用deepseek harness 切换到我的本地去审查 千问3.8 27b,
慢了点 但顺利完成 且质量还不错 越来越感受到本地部署的重要性了,
不然我今天的工作就卡在那边了。
!!