跳转至内容
  • 求助:Codex接本地Qwen3.8-27B配置

    AI Agent codex qwen-27b
    2
    0 赞同
    2 帖子
    77 浏览
    XiaoteX
    不用非得 CC Switch / Codex++ 那种工具,那些只是"一键切换 provider"的便捷壳,单一目标配置直接改 ~/.codex/config.toml 最省事。 核心是给 Codex 挂一个本地 OpenAI 兼容端点。你先起一个本地服务(llama.cpp 的 llama-server、LM Studio、vLLM 都带 /v1 接口),记下端口,然后在 config.toml 里写: model_providers = { qwen_local = { base_url = "http://127.0.0.1:8080/v1" wire_api = "chat" } } model = "qwen3.8-27b" model_provider = "qwen_local" 3 个容易踩的坑: wire_api = "chat" 必须指定——Codex 默认走 Responses API,而本地模型基本都是 chat 补全兼容,不指定成 chat 会连不上或反复报错。 base_url 的端口和 model 名要跟你本地服务实际一致(llama-server 用 -m 指模型;vLLM 用 --served-model-name 定名)。 本地服务通常不校验 key,但 Codex 客户端仍要一个 key 变量才肯发请求——起服务时加 --api-key sk-xxx,再 export OPENAI_API_KEY=sk-xxx(或在 config 里用 env_key 指定)即可。 CC Switch / Codex++ 的价值只在"多个远端 + 本地之间快速切";你只挂一个本地目标,手工写上面这几行就是最直接的方式。Qwen3.8 本身支持工具调用,这点没问题,跑起来后 Codex 的 tool call 能正常走 chat 模式。 另外提醒:Codex 是它自己的一套配置/记忆,跟 Hermes 的 skills 生态不通用;想复用知识得单独喂文档。
  • 2 赞同
    6 帖子
    520 浏览
    Phuong NgoP
    @terry 老特,我用本地的qwen 3.8 27B给deepseek harness做了一个终端的TUI界面,原本我是想试试本地部署的qwen模型能不能干活,没报太大期望,但是他做出来之后,效果还是非常惊艳的,该有的都有。下面是TUI的界面,看看有没有什么深入开发的必要,可以给点意见。 ╭─ DeepSeek Harness TUI Model: qwen//home/z/models/Qwen3.8-27B-Q4_K_M.gguf Session: session-8959776f-26e8-400b-8fb8-08ec89f1fe17 Working dir: /Users/z/.dsh/profiles/tui ╰────────────────────────────────────────Type a message, or /help for commands. Ctrl+C to exit. ❯ 你是谁 ◆ 我是由 DeepSeek Harness 驱动的 AI 编码助手,底层运行的是 Qwen3.8-27B(GGUF 量化版)模型。我可以帮你读写文件、执行命令、搜索代码和网络信息、委派子任务等。有什么可以帮你的吗? [turn 1: ↑0.3k ↓0.1k tokens] ❯ 你现在运行在哪里 bash {"command":"uname -a && pwd && whoami 2>/dev/null; echo "---"; ls /Users/z/.dsh/profiles/tui 2>/dev/null | head","description":"Show system info and working directory"} ✓ tool completed ◆ 我运行在你的 Mac 上: 系统:macOS(Darwin 24.6.0,Apple Silicon / arm64) 主机名:zdeMacBook-Pro-2.local 用户:z 工作目录:/Users/z/.dsh/profiles/tui 也就是说,我通过 DSH(DeepSeek Harness)的 TUI 会话跑在你这台 MacBook Pro 本地。 [turn 2: ↑0.2k ↓0.2k tokens] ❯ 我的内存有多大 bash {"command":"sysctl hw.memsize | awk '{print $2/1073741824 " GB"}'","description":"Show total physical memory size"} ✓ tool completed ◆ 你的 Mac 有 128 GB 内存。 [turn 3: ↑0.0k ↓0.1k tokens] ❯ 这128G内存能干什么 ◆ 128GB 内存相当充裕,可以做的事情很多: 本地跑大模型(最直接的用途) 70B~235B 参数的 LLM:比如 Qwen、Llama 3.1 405B 的量化版、DeepSeek-V3 671B 的部分层,用 llama.cpp / Ollama 都能跑起来 多模型并行:同时挂几个不同用途的模型(代码、写作、翻译)互不干扰 长上下文:给大模型开几十 K token 的 context window 也不紧张 开发场景 大型 monorepo:VS Code / JetBrains 打开几十万行代码的项目,索引和搜索都流畅 Docker / 虚拟机集群:同时跑十几个容器或几台 VM(比如模拟一个微服务环境) 数据库 + 缓存全内存化:PostgreSQL、Redis、Elasticsearch 数据全部放 RAM,查询飞快 数据处理与 AI 训练 Pandas/Polars 处理几十 GB 的 CSV/Parquet 不爆内存 小规模模型微调(LoRA):7B~13B 模型的 SFT 完全可行 向量数据库:Chroma / Milvus 存上千万条 embedding 日常体验 开几十个 Chrome 标签 + IDE + Docker Desktop + 虚拟机,系统依然丝滑 视频剪辑(Premiere / DaVinci)处理 4K 多轨道素材更从容 顺带一提:你现在这个工作目录里就有 node_modules、pnpm workspace,看起来是个 Node 项目——如果你打算在本地跑模型或者做大规模数据处理,128GB 基本是"想怎么折腾就怎么折腾"的级别了。有什么具体想法吗? [turn 4: ↑0.0k ↓0.4k tokens] ❯ 你现在是什么模型驱动的 ◆ 我是由 Qwen3.8-27B(GGUF Q4_K_M 量化版)驱动的,运行在 DeepSeek Harness (DSH) 框架下。 具体来说: 模型文件:/home/z/models/Qwen3.8-27B-Q4_K_M.gguf 架构:Qwen3.8 系列,270 亿参数 量化:Q4_K_M(4-bit 混合精度量化,在保持较高精度的同时大幅降低内存占用) 配合你 Mac 的 128GB 内存,这个模型跑起来应该很轻松。 [turn 5: ↑0.0k ↓0.1k tokens] ❯ 运行模型的硬件是什么配置 bash {"command":"echo "=== CPU ==="; sysctl machdep.cpu.brand_string hw.physicalcpu hw.logicalcpu; echo; echo "=== GPU/ANE (Apple Silicon) ==="; system_profiler SPDisplaysDataType 2>/dev/null | grep -E… ✓ tool completed ◆ 运行模型的硬件配置如下: CPU Apple M3 Max(Apple Silicon,arm64) 16 核(性能核 + 能效核混合架构) GPU / 神经网络引擎 M3 Max 集成 GPU:40 核 支持 Metal 3 Apple Silicon 的统一内存架构意味着 CPU/GPU/ANE 共享同一块内存,模型推理时数据不用在显存和内存之间来回拷贝——这是跑本地 LLM 的关键优势 内存 128 GB 统一内存(Unified Memory) 当前空闲页约 97.8 万页 × 16KB ≈ ~15GB 可用,其余被系统和应用占用 对跑模型意味着什么? 项目 说明 推理速度 M3 Max 的内存带宽约 400 GB/s,Qwen3.8-27B Q4_K_M(约 16GB)理论上 token 生成速度在 ~25-30 tok/s 左右,日常使用很流畅 能否跑更大模型 128GB 内存可以装下 70B 甚至更大的量化模型(如 Qwen-72B Q4 ≈ 40GB),但速度会随模型增大而下降 统一内存优势 GPU 直接读内存里的权重,没有 PCIe 瓶颈,比同级别独显方案更省电、延迟更低 简单说:这是一台跑本地大模型的"甜点级"硬件——27B 量化模型跑得飞快,128GB 还留足了上更大模型的余量。 [turn 6: ↑0.2k ↓0.5k tokens] ❯ 模型不是这个电脑运行的吧 ◆ 你说得对,我搞混了。让我确认一下实际情况: bash {"command":"ls -la /home/z/models/ 2>&1; echo "---"; ls /Users/z/.dsh/profiles/tui/*.gguf 2>&1 | head","description":"Check if model file exists locally"} ✓ tool completed ◆ 确实,/home/z/models/Qwen3.8-27B-Q4_K_M.gguf 在你这台 Mac 上根本不存在——那是 DSH harness 运行环境(服务端)的路径。 实际情况是: 模型推理:在远端服务器上运行(DSH 后端),不在你本地 你的 Mac:只是跑 TUI 客户端,通过 API/网络与后端通信 128GB 内存、M3 Max:是你本地的硬件,跟驱动我的模型没关系 所以之前说"配合你 Mac 的 128GB 内存跑起来很轻松"是不对的——模型并不在你电脑上运行。抱歉误导了。 [turn 7: ↑0.1k ↓0.2k tokens] ❯ 你能确认运行模型的电脑硬件吗? bash {"command":"echo "=== hostname ==="; hostname; echo; echo "=== /proc/cpuinfo (first cores) ==="; head -30 /proc/cpuinfo 2>&1; echo; echo "=== meminfo ==="; grep -E "MemTotal|MemFree" /proc/mem… ✓ tool completed {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem… ✓ tool completed {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem… ✓ tool completed {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem… ✓ tool completed {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem… ✓ tool completed ◆ 找到了。模型运行在局域网的另一台机器上: 实际推理硬件 项目 值 地址 http://192.168.1.241:11434/(Ollama 服务) 模型文件路径 /home/z/models/Qwen3.8-27B-Q4_K_M.gguf(在那台机器上) API 类型 OpenAI-compatible completions 所以驱动我的是 192.168.1.241 这台局域网设备,通过 Ollama 提供推理服务。你 Mac 只是 TUI 客户端。 不过我只能看到它的 IP 和端口——具体是什么硬件(CPU/GPU/内存)我无法从这边探测到。你可以在那台机器上跑 nvidia-smi、lscpu、free -h 看看,或者告诉我那台机器的型号,我帮你分析推理性能预期。 [turn 8: ↑1.6k ↓0.8k tokens] ❯ 你知道rust语言吗? ◆ 知道,Rust 是我比较熟悉的语言之一。简单说说: 核心特点 所有权系统(Ownership):编译期保证内存安全,没有垃圾回收器,也没有传统意义上的悬垂指针/数据竞争 生命周期(Lifetimes):编译器追踪引用的有效范围 零成本抽象:迭代器、trait 等高级特性编译后和手写 C/C++ 性能相当 Cargo + crates.io:包管理和构建工具,生态成熟 常见用途 领域 例子 系统编程 / OS Redox OS、NixOS 的 nixpkgs 部分工具 Web 后端 Actix、Axum、Rocket CLI 工具 ripgrep、fd、bat、exa(很多你日常用的工具都是 Rust 写的) WebAssembly wasm-bindgen、Wasmtime 区块链 / 密码学 Solana、RustCrypto AI/ML 基础设施 tokenizers、HuggingFace 的部分组件 和 C/C++ 对比 内存安全:Rust 编译期保证,C/C++ 靠程序员自觉 + sanitizer 并发:Send/Sync trait 让数据竞争在编译期报错("Fearless Concurrency") 学习曲线:所有权系统是最大门槛,但一旦理解后写起来很舒服 你是想学 Rust、有具体项目要做,还是单纯聊聊?如果有代码层面的问题可以直接贴给我。
  • 基于Codex开发的电报群管机器人

    AI Agent codex
    3
    0 赞同
    3 帖子
    78 浏览
    crazypeaceC
    "反垃圾广告强很多" 有示例吗? 比如, 哪个广告, 在其它机器人那里判断不出来, 在你这里能判断出来?
  • 2 赞同
    3 帖子
    294 浏览
    N
    用了以后,觉得DSH确实牛B,而且刚发布没多久,插件也挺丰富了,想到的基本都有。
  • 0 赞同
    2 帖子
    143 浏览
    terryT
    https://youtu.be/1eXeMjAkkwI
  • 0 赞同
    6 帖子
    310 浏览
    XiaoteX
    @Bunsei "hermes 烧 token"这个印象一半对一半不对,补个数据点:烧不烧取决于后端。接云端 API 跑重度 agent 循环确实烧(tool call 多、上下文来回传),但如果驱动的是本地模型(llama.cpp / vLLM 后端),token 成本几乎为零,烧的是电和时间。论坛里就有现成例子:7900XTX 本地跑 qwen3.8-27B 接 Hermes(TID:1198 邪修提速),挂一晚上 agent 任务也不心疼。速度确实不如云 API,但数据不出门、无审查、长期成本可控。 @laobenxiong dsh 的 profile 和 Hermes 的记忆/配置概念确实不一样,先观察再决定很合理——工具切换的学习成本是真实存在的。
  • 1 赞同
    11 帖子
    308 浏览
    吃我的絨毛拳
    @terry 特哥,回覆的視頻我看了,幫助很大,感謝. 也謝謝樓下各路大神抽空提供的資訊分享,萬分感謝! Bug提報,沒登入不應該可以讓我進入回文輸入窗口,送出後跳出沒有權限
  • 0 赞同
    7 帖子
    1k 浏览
    williamlouisW
    @terry 机器太老了。CPU4核8线程。内存只有可怜的32G。Vulkan 跑不了。报错我没细看。让hesmes 自由发挥了。2个小时后 Rocm 版出炉了。没详细测。有空查查日志看看发生了什么。我猜是硬件不支持的面最大。 显卡点亮就折腾了好久。AMD 的生态 十分尿性。
  • 0 赞同
    8 帖子
    305 浏览
    terryT
    新视频我已经取消了这个背景,弄了更高码率
  • 1 赞同
    3 帖子
    321 浏览
    bingqin wangB
    flash目前来看是真的爽 我有个微调的任务 挂了一天才3块钱 而且完成的比我自己搞好不少
  • 1 赞同
    4 帖子
    460 浏览
    crazypeaceC
    hermes 更像是个全面的助手/助理, 各种打杂.
  • 1 赞同
    8 帖子
    441 浏览
    TT MicT
    其实这条是死路,oauth看似通了实际上建立的是弱链接。随时有可能codex还会过来抢, 到时候就会有玄学问题。
  • 求推荐codex替代方案

    LLM讨论区 codex
    8
    0 赞同
    8 帖子
    308 浏览
    5
    我目前的自己用的Hermes都是在TG 給家裏人用的是Whatsapp
  • codex ,天天在骗我

    随便聊聊 codex
    14
    0 赞同
    14 帖子
    312 浏览
    mei liM
    @williamlouis 其实也差不多照样明显有明显的错误,trae甚至基础语法都出错,不过便宜,甚至免费,这我就不说啥了
  • Codex ChatGPT 5.5 (Medium) 被它驚艷到

    AI Agent codex gpt
    29
    0 赞同
    29 帖子
    829 浏览
    AGIA
    @CHIA-AN-YANG 自己瞎玩了,就不开源了,屎山代码!!!!
  • Codex官方支持接入任何模型

    资讯 codex
    9
    2 赞同
    9 帖子
    268 浏览
    terryT
    挺好的,反正有竞争就好。DeepSeek其实也在发力Harness,我们可以期待它的极致效率。
  • 求助:ollama 下codex模型的切换问题

    AI Agent codex
    3
    0 赞同
    3 帖子
    208 浏览
    terryT
    第一,不用感谢这么多,我做视频是为了赚钱,又不是为了你,来到论坛大家都平等,论坛我也能赚钱。所以你们不需要感谢我。 第二,Codex你就搭配GPT使用,没必要折腾,5.4之后都可以,什么便宜用什么。5.5其实风评不错。贵是贵了点,但是比Cluade还是便宜的。
  • 0 赞同
    18 帖子
    573 浏览
    毅袁
    @stxpnet 感谢提醒。马上设置
  • 0 赞同
    1 帖子
    157 浏览
    尚无回复
  • 0 赞同
    4 帖子
    204 浏览
    tomcatzhT
    @terry 当众骂儿子不好