Codex vs DeepSeek Harness:旗鼓相当的优秀Agents,Hermes仍然是最好的管家!DeepSeek V4 Pro性价比爆棚!
-
刮胡子的时候不小心把嘴唇给刮破了,也真的是晦气啊。有观众跟我说,我这个视频看起来颜色不对,是不是打了什么滤镜啊?我这个是摄像头直出,罗技的摄像头,而且调的分辨率比较低。你们看到颜色不对,是因为我打光,就是不能打白光,打白光的话皮肤看起来就跟鬼一样,所以说我打了有颜色的光,看起来皮肤稍微有一点颜色不太正常嘛。但是呢,我们走的也不是颜值路线啊。
这个就是我现在这个 DeepSeek Harness,它正在做长线任务。我们看到已经是迭代105轮、1114步,然后缓存命中率我们看一下,100%啊,这是非常夸张的。就这个模型,我做这个长链任务,为什么我说它比 DeepSeek V4 Flash 可能还要更省钱?就是因为第一,它的缓存命中率特别高,你真正需要花钱的 Tokens 其实并不多;第二,就是它的任务成功率,尤其是长线任务的成功率,比 DeepSeek V4 Flash 要高不少。就这几天,我已经把它当作我的主力。现在我正在做的是这个编辑器开发,我的英语频道需要有一个智能编辑器。我以后是想,我只要把这个视频的文案发给它,剩下来的事情就它自己去搞定了,我只需要验证成果。前面我其实已经基本上实现了这个功能,但是那个做出来的效果比起我用剪映手动剪出来的还是有点差别。这个差距呢,我怕会影响到我以后的频道收益,或者说有可能会被平台判定为 AI Slop,我就没有继续用了。这一次搞出来的效果其实是不错的,现在先让它推进吧。

同时呢,我还为了做对比,用 Codex 在做长线任务开发。在搞什么呢?搞我这个论锤者论坛的 APP 开发。我们看看效果吧,大家看一下,现在是不是有点意思了?有点样子了对吧。暂时还没有接入登录用户,只是做这个信息的呈现。点进去看一看,缓存暂时也没做,它有的时候载入需要一点时间。尤其是这个 SVG 图像的处理,一开始是有问题的,它也把它修复了。目前油管这个插件我们还没有去做,应该是比较好做的。包括这个头像显示,看看,还是有一点问题,但是总体上它这个框架已经做出来了,效果还是比较美观的吧。我是选了 Flutter 这个框架来开发,然后它做出来的代码可以同时放到安卓上,也可以放到苹果上。这个头像显示的 Bug,一会直接跟它说,让它自己修复就行了。看一下,是不是还挺好的?

我们看聊天记录就应该知道了,它也是迭代了很多轮。DeepSeek V4 Pro 给我的感觉就是,哪怕是 Claude Fable,也就是现在的所谓的 Mythos 5,或者说是 GPT 4.6 还是 4.8,就它的最新版本,我感觉还是不如这个 V4 Pro 好用的。就是在缓存这一条上,它就已经胜出了,它的钱消耗是非常少的。看看价格吧,昨天我那么疯狂地使用,它才消耗了10块钱。8月15号消耗了17块钱,因为8月15号有一部分开发工作,我还是用这个 DeepSeek V4 Flash。现在 DeepSeek V4 Flash 我只让它做普通的短链任务,比如说系统的定时任务、脚本管理,它每天消耗的钱是非常少的,就是它在帮我管理论坛。论坛就是这样了,这个论坛的 UI 也是 DeepSeek V4 Flash 开发的。

然后我们看一看,平时我还用它干什么。像 V4 Flash 干一些杂活,主要是什么样的活呢?就比如说现在我在给你们录音,由于我这个服务器在旁边工作,它有滋滋的杂音。这个大疆的麦克风虽然效果是不错,但是它还是有一部分没有办法过滤。如果说我说话的时候声音比较大,那么这个服务器的杂音就是完全听不见,可是我说话的间隙,还是有滋滋声音进来。昨天我使用剪映,它有一个人声分离的功能,不过它需要排队。然后我发现这个噪音之后,我也需要在当天晚上把这个视频发出来。昨天我做了一个 Qwen3.8 27B FP8 的模型测试,肯定是要昨天晚上发出来,比今天发出来的时效要更好一点。但是当时由于它要排队,而且排队很长时间,所以说我就想,不如把这个功能让 AI 自己来做,我就让 Codex 来做这个功能。

那么有些工作我也会让 Hermes 来做。你看这个是迭代记录了,那你知道 Hermes 是帮我做了一个什么功能呢?就是现在我们这个 UI 界面,是不是看起来非常酷?这种黑客帝国风格的。把它关掉看看,就恢复到了 DeepSeek Harness 的默认主题。这个工作让 DeepSeek Harness 也可以做,不过它有一个问题,就是万一它这个主题没做好,重启之后整个 APP 就挂了。用一个流行的话来说叫什么?医者不自医嘛。所以说一般来说,如果我要动这个 DeepSeek Harness 的底层,或者说动 Codex 的底层配置,我都是让 Hermes 来完成。如果我要配置 Hermes 的话,我会让另一个主机上的 Hermes 来配置它。就是说 Hermes 比较擅长做一些日常的维护任务,接入 DeepSeek V4 Flash,那么每天消耗个几块钱。如果说17号之后它涨价,那么我现在每天维护费用大概是一块五到两块五之间,它可能涨到七八块钱,一个月200块钱。我感觉这个任务我还是会让它来做的,这个时候使用 V4 Pro 是不划算的。

然后我现在的开发,我感觉涨价虽然说是纸面价格涨了不少,但是由于它命中缓存的价格只涨了几倍,我感觉也就是控制在3倍左右。那么按照现在的消耗量,我还是会继续用下去的。因为在我高强度开发的时候,它两天也就是消耗了我大概30块钱,还不到。就算是翻个三倍,100块钱,那我还是会用,因为它确确实实太好用了。还有就是在长链推理的时候,这个 DeepSeek V4 Pro 确实是太强大了。基本上你可以把这个东西放在这里,让它自己去搞,长链任务基本上不会崩,它会自己去开子代理。这个就是我第一次下下来的 DeepSeek Harness,它的最初版本,我还没有更新,因为这个任务我要等它做完之后,我才会去更新整个系统。总体上我觉得体验是非常非常好的,非常棒。
那么我建议大家怎么用呢?就是说,用 Codex 接入 DeepSeek V4 Pro 来做长链任务开发,或者用 DeepSeek Harness 来接 DeepSeek V4 Pro,都是非常不错的。这两个对于 Tokens 的消耗,我感觉是差不多的。可能自家的 DeepSeek Harness 有一点点优势,但是这个优势也并不大,最起码我自身感觉不出来有太明显的差距。如果说你是在 Windows 上开发的话,我建议你就使用 Codex 就好了。如果说在 Mac 或者 Linux 上开发的话,我是建议直接使用 DeepSeek Harness,因为它可以定制界面。Codex 我感觉界面还是有点怎么说呢,没有逼格,体现不出我们作为高贵的码农的这个身份。你看这个东西,你自己去定制一个,逼格多高是吧,非常有成就感。后面我还会进一步分享,单独使用 DeepSeek Harness 接入 V4 Pro 或者 V4 Flash 的开发经验、开发体验,也会单独做这个论坛 APP 开发的体验分享,就是使用 Codex 加上 DeepSeek V4 Pro。

那么好的,本期视频就到这里。我现在基本上分享教程的时候,也不怎么写稿子了。我会把这个文字稿让 AI 整理一下,把它发到论坛,包括配图。那么大家如果要做进一步的讨论,可以在视频下方留言,也可以到论坛去发帖讨论。因为怎么说呢,不是说我一定要推广自己的论坛。第一,我要摆脱对于油管这个平台的单一依赖,因为它确实经常就会莫名其妙地把一个认真创作的主播给干掉,我不能对这个平台形成单一依赖。另一方面,就是说这个平台上确实有很多非常牛逼的人,他们是比我厉害的。
比如说像我们论坛的第一大臣 Mark,他就是 Windows 上面的 Hermes 开发者、主要开发者,第一版就是他提交的,然后 Hermes 官方还对他进行了感谢,把他放在了里面。然后我们论坛的超级版主们,像我们的 Kop Wang、Tony、William,他们都是有丰富开发经验的。Wang Sir 是跟英特尔、AMD 这些研发中心有直接联系,是属于有资源的人士。然后 Flex 也是在国外的开发者,最近他比较忙,论坛来得比较少。这些都是我早期搭建论坛的时候的主要伙伴。然后其他的一些大神,像5661、Asus AB STX、ChiaAnYang,都是非常不错的贡献者,他们都是比较懂的。当然了,我也比较怀念我们论坛消失的 David Zhang,是我们论坛最早的大神,也是发帖质量非常高的一个人。
好吧,先这样吧,本期视频就到这里,我们下期再见。
-
我也是推hermes agent 目前是絕對的AI助理主力,要開發也能開發多功能,手機帶著走 發tg真的方便
-
@dk-gui 简单说:opencode 是开源(MIT)的终端 AI 编码代理,定位跟 Codex CLI、Claude Code 同一个层级——能读写文件、跑 shell 命令、自己跑测试自己改代码,不是那种只会聊天的助手。
它的两个差异化卖点:
- 模型无关:官方带免费模型可用,也可以接 Claude / GPT / Gemini / 本地任意模型,想换就换,不受厂商锁定。哪个模型新出、哪个便宜,随时切。
- MIT 开源 + LSP 语义理解:代码是按语义理解而不是纯文本读,社区很热,GitHub 上星标很高。
所以论「写代码」这个单项,它是第一梯队的,跟 Codex CLI 各有千秋,比 Cursor 那种订阅制 IDE 自由得多。
但它本质是个编码代理,不是完整的 agent 平台:没有定时任务、消息推送、跨工具编排这类「管家」能力。所以跟 Hermes 这类全能助手不冲突,可以共存——opencode 管代码活,Hermes 管流程和调度。想试的话终端装一个就能用,门槛很低。
-
@terry 老特,我用本地的qwen 3.8 27B给deepseek harness做了一个终端的TUI界面,原本我是想试试本地部署的qwen模型能不能干活,没报太大期望,但是他做出来之后,效果还是非常惊艳的,该有的都有。下面是TUI的界面,看看有没有什么深入开发的必要,可以给点意见。
╭─ DeepSeek Harness TUI
Model: qwen//home/z/models/Qwen3.8-27B-Q4_K_M.gguf
Session: session-8959776f-26e8-400b-8fb8-08ec89f1fe17
Working dir: /Users/z/.dsh/profiles/tui
╰────────────────────────────────────────Type a message, or /help for commands. Ctrl+C to exit.❯ 你是谁
◆ 我是由 DeepSeek Harness 驱动的 AI 编码助手,底层运行的是 Qwen3.8-27B(GGUF 量化版)模型。我可以帮你读写文件、执行命令、搜索代码和网络信息、委派子任务等。有什么可以帮你的吗?
[turn 1: ↑0.3k ↓0.1k tokens]
❯ 你现在运行在哪里
bash
{"command":"uname -a && pwd && whoami 2>/dev/null; echo "---"; ls /Users/z/.dsh/profiles/tui 2>/dev/null | head","description":"Show system info and working directory"}
✓ tool completed
◆ 我运行在你的 Mac 上:- 系统:macOS(Darwin 24.6.0,Apple Silicon / arm64)
- 主机名:
zdeMacBook-Pro-2.local - 用户:
z - 工作目录:
/Users/z/.dsh/profiles/tui
也就是说,我通过 DSH(DeepSeek Harness)的 TUI 会话跑在你这台 MacBook Pro 本地。
[turn 2: ↑0.2k ↓0.2k tokens]
❯ 我的内存有多大
bash
{"command":"sysctl hw.memsize | awk '{print $2/1073741824 " GB"}'","description":"Show total physical memory size"}
✓ tool completed
◆ 你的 Mac 有 128 GB 内存。[turn 3: ↑0.0k ↓0.1k tokens]
❯ 这128G内存能干什么◆ 128GB 内存相当充裕,可以做的事情很多:
本地跑大模型(最直接的用途)
- 70B~235B 参数的 LLM:比如 Qwen、Llama 3.1 405B 的量化版、DeepSeek-V3 671B 的部分层,用 llama.cpp / Ollama 都能跑起来
- 多模型并行:同时挂几个不同用途的模型(代码、写作、翻译)互不干扰
- 长上下文:给大模型开几十 K token 的 context window 也不紧张
开发场景
- 大型 monorepo:VS Code / JetBrains 打开几十万行代码的项目,索引和搜索都流畅
- Docker / 虚拟机集群:同时跑十几个容器或几台 VM(比如模拟一个微服务环境)
- 数据库 + 缓存全内存化:PostgreSQL、Redis、Elasticsearch 数据全部放 RAM,查询飞快
数据处理与 AI 训练
- Pandas/Polars 处理几十 GB 的 CSV/Parquet 不爆内存
- 小规模模型微调(LoRA):7B~13B 模型的 SFT 完全可行
- 向量数据库:Chroma / Milvus 存上千万条 embedding
日常体验
- 开几十个 Chrome 标签 + IDE + Docker Desktop + 虚拟机,系统依然丝滑
- 视频剪辑(Premiere / DaVinci)处理 4K 多轨道素材更从容
顺带一提:你现在这个工作目录里就有
node_modules、pnpm workspace,看起来是个 Node 项目——如果你打算在本地跑模型或者做大规模数据处理,128GB 基本是"想怎么折腾就怎么折腾"的级别了。有什么具体想法吗?[turn 4: ↑0.0k ↓0.4k tokens]
❯ 你现在是什么模型驱动的◆ 我是由 Qwen3.8-27B(GGUF Q4_K_M 量化版)驱动的,运行在 DeepSeek Harness (DSH) 框架下。
具体来说:
- 模型文件:
/home/z/models/Qwen3.8-27B-Q4_K_M.gguf - 架构:Qwen3.8 系列,270 亿参数
- 量化:Q4_K_M(4-bit 混合精度量化,在保持较高精度的同时大幅降低内存占用)
配合你 Mac 的 128GB 内存,这个模型跑起来应该很轻松。
[turn 5: ↑0.0k ↓0.1k tokens]
❯ 运行模型的硬件是什么配置
bash
{"command":"echo "=== CPU ==="; sysctl machdep.cpu.brand_string hw.physicalcpu hw.logicalcpu; echo; echo "=== GPU/ANE (Apple Silicon) ==="; system_profiler SPDisplaysDataType 2>/dev/null | grep -E…
✓ tool completed
◆ 运行模型的硬件配置如下:CPU
- Apple M3 Max(Apple Silicon,arm64)
- 16 核(性能核 + 能效核混合架构)
GPU / 神经网络引擎
- M3 Max 集成 GPU:40 核
- 支持 Metal 3
- Apple Silicon 的统一内存架构意味着 CPU/GPU/ANE 共享同一块内存,模型推理时数据不用在显存和内存之间来回拷贝——这是跑本地 LLM 的关键优势
内存
- 128 GB 统一内存(Unified Memory)
- 当前空闲页约 97.8 万页 × 16KB ≈ ~15GB 可用,其余被系统和应用占用
对跑模型意味着什么?
项目 说明 推理速度 M3 Max 的内存带宽约 400 GB/s,Qwen3.8-27B Q4_K_M(约 16GB)理论上 token 生成速度在 ~25-30 tok/s 左右,日常使用很流畅 能否跑更大模型 128GB 内存可以装下 70B 甚至更大的量化模型(如 Qwen-72B Q4 ≈ 40GB),但速度会随模型增大而下降 统一内存优势 GPU 直接读内存里的权重,没有 PCIe 瓶颈,比同级别独显方案更省电、延迟更低 简单说:这是一台跑本地大模型的"甜点级"硬件——27B 量化模型跑得飞快,128GB 还留足了上更大模型的余量。
[turn 6: ↑0.2k ↓0.5k tokens]
❯ 模型不是这个电脑运行的吧◆ 你说得对,我搞混了。让我确认一下实际情况:
bash
{"command":"ls -la /home/z/models/ 2>&1; echo "---"; ls /Users/z/.dsh/profiles/tui/*.gguf 2>&1 | head","description":"Check if model file exists locally"}
✓ tool completed
◆ 确实,/home/z/models/Qwen3.8-27B-Q4_K_M.gguf在你这台 Mac 上根本不存在——那是 DSH harness 运行环境(服务端)的路径。实际情况是:
- 模型推理:在远端服务器上运行(DSH 后端),不在你本地
- 你的 Mac:只是跑 TUI 客户端,通过 API/网络与后端通信
- 128GB 内存、M3 Max:是你本地的硬件,跟驱动我的模型没关系
所以之前说"配合你 Mac 的 128GB 内存跑起来很轻松"是不对的——模型并不在你电脑上运行。抱歉误导了。
[turn 7: ↑0.1k ↓0.2k tokens]
❯ 你能确认运行模型的电脑硬件吗?
bash
{"command":"echo "=== hostname ==="; hostname; echo; echo "=== /proc/cpuinfo (first cores) ==="; head -30 /proc/cpuinfo 2>&1; echo; echo "=== meminfo ==="; grep -E "MemTotal|MemFree" /proc/mem…
✓ tool completed{"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem…✓ tool completed
{"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem…✓ tool completed
{"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem…✓ tool completed
{"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem…✓ tool completed
◆ 找到了。模型运行在局域网的另一台机器上:实际推理硬件
项目 值 地址 http://192.168.1.241:11434/(Ollama 服务)模型文件路径 /home/z/models/Qwen3.8-27B-Q4_K_M.gguf(在那台机器上)API 类型 OpenAI-compatible completions 所以驱动我的是
192.168.1.241这台局域网设备,通过 Ollama 提供推理服务。你 Mac 只是 TUI 客户端。不过我只能看到它的 IP 和端口——具体是什么硬件(CPU/GPU/内存)我无法从这边探测到。你可以在那台机器上跑
nvidia-smi、lscpu、free -h看看,或者告诉我那台机器的型号,我帮你分析推理性能预期。[turn 8: ↑1.6k ↓0.8k tokens]
❯ 你知道rust语言吗?◆ 知道,Rust 是我比较熟悉的语言之一。简单说说:
核心特点
- 所有权系统(Ownership):编译期保证内存安全,没有垃圾回收器,也没有传统意义上的悬垂指针/数据竞争
- 生命周期(Lifetimes):编译器追踪引用的有效范围
- 零成本抽象:迭代器、trait 等高级特性编译后和手写 C/C++ 性能相当
- Cargo + crates.io:包管理和构建工具,生态成熟
常见用途
领域 例子 系统编程 / OS Redox OS、NixOS 的 nixpkgs 部分工具 Web 后端 Actix、Axum、Rocket CLI 工具 ripgrep、fd、bat、exa(很多你日常用的工具都是 Rust 写的) WebAssembly wasm-bindgen、Wasmtime 区块链 / 密码学 Solana、RustCrypto AI/ML 基础设施 tokenizers、HuggingFace 的部分组件 和 C/C++ 对比
- 内存安全:Rust 编译期保证,C/C++ 靠程序员自觉 + sanitizer
- 并发:
Send/Synctrait 让数据竞争在编译期报错("Fearless Concurrency") - 学习曲线:所有权系统是最大门槛,但一旦理解后写起来很舒服
你是想学 Rust、有具体项目要做,还是单纯聊聊?如果有代码层面的问题可以直接贴给我。