跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 项目 AI 广场
Phuong NgoP

Phuong Ngo

@Phuong Ngo
取消关注 关注
关于
帖子
13
主题
2
分享
0
群组
0
粉丝
1
关注
0

帖子

最新 最佳 有争议的

  • Codex vs DeepSeek Harness:旗鼓相当的优秀Agents,Hermes仍然是最好的管家!DeepSeek V4 Pro性价比爆棚!
    Phuong NgoP Phuong Ngo

    @terry 老特,我用本地的qwen 3.8 27B给deepseek harness做了一个终端的TUI界面,原本我是想试试本地部署的qwen模型能不能干活,没报太大期望,但是他做出来之后,效果还是非常惊艳的,该有的都有。下面是TUI的界面,看看有没有什么深入开发的必要,可以给点意见。

    ╭─ DeepSeek Harness TUI
    Model: qwen//home/z/models/Qwen3.8-27B-Q4_K_M.gguf
    Session: session-8959776f-26e8-400b-8fb8-08ec89f1fe17
    Working dir: /Users/z/.dsh/profiles/tui
    ╰────────────────────────────────────────Type a message, or /help for commands. Ctrl+C to exit.

    ❯ 你是谁

    ◆ 我是由 DeepSeek Harness 驱动的 AI 编码助手,底层运行的是 Qwen3.8-27B(GGUF 量化版)模型。我可以帮你读写文件、执行命令、搜索代码和网络信息、委派子任务等。有什么可以帮你的吗?

    [turn 1: ↑0.3k ↓0.1k tokens]
    ❯ 你现在运行在哪里

    ⚙ bash
    {"command":"uname -a && pwd && whoami 2>/dev/null; echo "---"; ls /Users/z/.dsh/profiles/tui 2>/dev/null | head","description":"Show system info and working directory"}
    ✓ tool completed
    ◆ 我运行在你的 Mac 上:

    • 系统:macOS(Darwin 24.6.0,Apple Silicon / arm64)
    • 主机名:zdeMacBook-Pro-2.local
    • 用户:z
    • 工作目录:/Users/z/.dsh/profiles/tui

    也就是说,我通过 DSH(DeepSeek Harness)的 TUI 会话跑在你这台 MacBook Pro 本地。

    [turn 2: ↑0.2k ↓0.2k tokens]
    ❯ 我的内存有多大

    ⚙ bash
    {"command":"sysctl hw.memsize | awk '{print $2/1073741824 " GB"}'","description":"Show total physical memory size"}
    ✓ tool completed
    ◆ 你的 Mac 有 128 GB 内存。

    [turn 3: ↑0.0k ↓0.1k tokens]
    ❯ 这128G内存能干什么

    ◆ 128GB 内存相当充裕,可以做的事情很多:

    本地跑大模型(最直接的用途)

    • 70B~235B 参数的 LLM:比如 Qwen、Llama 3.1 405B 的量化版、DeepSeek-V3 671B 的部分层,用 llama.cpp / Ollama 都能跑起来
    • 多模型并行:同时挂几个不同用途的模型(代码、写作、翻译)互不干扰
    • 长上下文:给大模型开几十 K token 的 context window 也不紧张

    开发场景

    • 大型 monorepo:VS Code / JetBrains 打开几十万行代码的项目,索引和搜索都流畅
    • Docker / 虚拟机集群:同时跑十几个容器或几台 VM(比如模拟一个微服务环境)
    • 数据库 + 缓存全内存化:PostgreSQL、Redis、Elasticsearch 数据全部放 RAM,查询飞快

    数据处理与 AI 训练

    • Pandas/Polars 处理几十 GB 的 CSV/Parquet 不爆内存
    • 小规模模型微调(LoRA):7B~13B 模型的 SFT 完全可行
    • 向量数据库:Chroma / Milvus 存上千万条 embedding

    日常体验

    • 开几十个 Chrome 标签 + IDE + Docker Desktop + 虚拟机,系统依然丝滑
    • 视频剪辑(Premiere / DaVinci)处理 4K 多轨道素材更从容

    顺带一提:你现在这个工作目录里就有 node_modules、pnpm workspace,看起来是个 Node 项目——如果你打算在本地跑模型或者做大规模数据处理,128GB 基本是"想怎么折腾就怎么折腾"的级别了。有什么具体想法吗?

    [turn 4: ↑0.0k ↓0.4k tokens]
    ❯ 你现在是什么模型驱动的

    ◆ 我是由 Qwen3.8-27B(GGUF Q4_K_M 量化版)驱动的,运行在 DeepSeek Harness (DSH) 框架下。

    具体来说:

    • 模型文件:/home/z/models/Qwen3.8-27B-Q4_K_M.gguf
    • 架构:Qwen3.8 系列,270 亿参数
    • 量化:Q4_K_M(4-bit 混合精度量化,在保持较高精度的同时大幅降低内存占用)

    配合你 Mac 的 128GB 内存,这个模型跑起来应该很轻松。

    [turn 5: ↑0.0k ↓0.1k tokens]
    ❯ 运行模型的硬件是什么配置

    ⚙ bash
    {"command":"echo "=== CPU ==="; sysctl machdep.cpu.brand_string hw.physicalcpu hw.logicalcpu; echo; echo "=== GPU/ANE (Apple Silicon) ==="; system_profiler SPDisplaysDataType 2>/dev/null | grep -E…
    ✓ tool completed
    ◆ 运行模型的硬件配置如下:

    CPU

    • Apple M3 Max(Apple Silicon,arm64)
    • 16 核(性能核 + 能效核混合架构)

    GPU / 神经网络引擎

    • M3 Max 集成 GPU:40 核
    • 支持 Metal 3
    • Apple Silicon 的统一内存架构意味着 CPU/GPU/ANE 共享同一块内存,模型推理时数据不用在显存和内存之间来回拷贝——这是跑本地 LLM 的关键优势

    内存

    • 128 GB 统一内存(Unified Memory)
    • 当前空闲页约 97.8 万页 × 16KB ≈ ~15GB 可用,其余被系统和应用占用

    对跑模型意味着什么?

    项目 说明
    推理速度 M3 Max 的内存带宽约 400 GB/s,Qwen3.8-27B Q4_K_M(约 16GB)理论上 token 生成速度在 ~25-30 tok/s 左右,日常使用很流畅
    能否跑更大模型 128GB 内存可以装下 70B 甚至更大的量化模型(如 Qwen-72B Q4 ≈ 40GB),但速度会随模型增大而下降
    统一内存优势 GPU 直接读内存里的权重,没有 PCIe 瓶颈,比同级别独显方案更省电、延迟更低

    简单说:这是一台跑本地大模型的"甜点级"硬件——27B 量化模型跑得飞快,128GB 还留足了上更大模型的余量。

    [turn 6: ↑0.2k ↓0.5k tokens]
    ❯ 模型不是这个电脑运行的吧

    ◆ 你说得对,我搞混了。让我确认一下实际情况:

    ⚙ bash
    {"command":"ls -la /home/z/models/ 2>&1; echo "---"; ls /Users/z/.dsh/profiles/tui/*.gguf 2>&1 | head","description":"Check if model file exists locally"}
    ✓ tool completed
    ◆ 确实,/home/z/models/Qwen3.8-27B-Q4_K_M.gguf 在你这台 Mac 上根本不存在——那是 DSH harness 运行环境(服务端)的路径。

    实际情况是:

    • 模型推理:在远端服务器上运行(DSH 后端),不在你本地
    • 你的 Mac:只是跑 TUI 客户端,通过 API/网络与后端通信
    • 128GB 内存、M3 Max:是你本地的硬件,跟驱动我的模型没关系

    所以之前说"配合你 Mac 的 128GB 内存跑起来很轻松"是不对的——模型并不在你电脑上运行。抱歉误导了。

    [turn 7: ↑0.1k ↓0.2k tokens]
    ❯ 你能确认运行模型的电脑硬件吗?

    ⚙ bash
    {"command":"echo "=== hostname ==="; hostname; echo; echo "=== /proc/cpuinfo (first cores) ==="; head -30 /proc/cpuinfo 2>&1; echo; echo "=== meminfo ==="; grep -E "MemTotal|MemFree" /proc/mem…
    ✓ tool completed

    {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem…
    

    ✓ tool completed

    {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem…
    

    ✓ tool completed

    {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem…
    

    ✓ tool completed

    {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem…
    

    ✓ tool completed
    ◆ 找到了。模型运行在局域网的另一台机器上:

    实际推理硬件

    项目 值
    地址 http://192.168.1.241:11434/(Ollama 服务)
    模型文件路径 /home/z/models/Qwen3.8-27B-Q4_K_M.gguf(在那台机器上)
    API 类型 OpenAI-compatible completions

    所以驱动我的是 192.168.1.241 这台局域网设备,通过 Ollama 提供推理服务。你 Mac 只是 TUI 客户端。

    不过我只能看到它的 IP 和端口——具体是什么硬件(CPU/GPU/内存)我无法从这边探测到。你可以在那台机器上跑 nvidia-smi、lscpu、free -h 看看,或者告诉我那台机器的型号,我帮你分析推理性能预期。

    [turn 8: ↑1.6k ↓0.8k tokens]
    ❯ 你知道rust语言吗?

    ◆ 知道,Rust 是我比较熟悉的语言之一。简单说说:

    核心特点

    • 所有权系统(Ownership):编译期保证内存安全,没有垃圾回收器,也没有传统意义上的悬垂指针/数据竞争
    • 生命周期(Lifetimes):编译器追踪引用的有效范围
    • 零成本抽象:迭代器、trait 等高级特性编译后和手写 C/C++ 性能相当
    • Cargo + crates.io:包管理和构建工具,生态成熟

    常见用途

    领域 例子
    系统编程 / OS Redox OS、NixOS 的 nixpkgs 部分工具
    Web 后端 Actix、Axum、Rocket
    CLI 工具 ripgrep、fd、bat、exa(很多你日常用的工具都是 Rust 写的)
    WebAssembly wasm-bindgen、Wasmtime
    区块链 / 密码学 Solana、RustCrypto
    AI/ML 基础设施 tokenizers、HuggingFace 的部分组件

    和 C/C++ 对比

    • 内存安全:Rust 编译期保证,C/C++ 靠程序员自觉 + sanitizer
    • 并发:Send/Sync trait 让数据竞争在编译期报错("Fearless Concurrency")
    • 学习曲线:所有权系统是最大门槛,但一旦理解后写起来很舒服

    你是想学 Rust、有具体项目要做,还是单纯聊聊?如果有代码层面的问题可以直接贴给我。

    AI Agent deepseek codex dsharness

  • 7900XTX+Qwen 3.8 27B Q4 + DeepSeek Harness 实测
    Phuong NgoP Phuong Ngo

    这个截图到没有,晚上快快的部署了,用了用,qwen3.8 27B的思考链太长了,有时候还会重头思考,3.6 27B好像没有出现过这个问题。上面那个任务它跑了20多分钟。花在思考上的时间非常多,明天准备把思考链关了试试,看看输出有没有太大区别。

    AI硬件 7900xtx qwen-27b deepseek

  • 7900XTX+Qwen 3.8 27B Q4 + DeepSeek Harness 实测
    Phuong NgoP Phuong Ngo

    我的配置

    项目 配置
    系统 Ubuntu 26.04 LTS
    CPU i5-12600KF
    内存 32 GB
    显卡 AMD RX 7900 XTX 24G
    推理后端 llama.cpp
    模型 Qwen 3.8 27B,Q4_K_M 量化
    Agent 框架 DeepSeek Harness(@deepseek-ai/dsh v0.1.0-rc.6)

    模型文件约 16G,24G 显存能全部塞进 GPU

    速度实测

    场景 输入长度 输出 token 首字延迟 生成速度
    简单问答 67 tok 128 0.29s 33.4 tok/s
    写代码 127 tok 512 0.15~0.31s 33.0 tok/s
    长文档问答(9K 上下文) 9,392 tok 160 0.17~0.22s 29 tok/s
    冷启动预填充(2.8K 新提示) 2,815 tok — 4.25s ~663 tok/s

    具体让它干了什么

    手上有一个电机工程的技能包(一个 .skill 文件,里面是算法脚本),功能是把电机 MAP 长表转成四象限二维 Lookup Table,给 MATLAB/Simulink 用。

    任务是:把它工程化成一个符合 MCP 规范的 Server,让 Claude Desktop、Cursor、Kimi 这些支持 MCP 的客户端都能直接调用。它自己用了快20分钟,生成了交付物,我测了一下,效果确实是我想要的效果,看起来实现的非常不错。它自己开发,测试脚本自己写自己测,整个流程都是它自己在优化,全程没有在指导过什么。
    总结:非常好用,能力很强的稠密模型再加上harness工程,确实是一把干活的利器。

    AI硬件 7900xtx qwen-27b deepseek

  • 大佬们,中小企业自建本地大模型有没有什么可行的方案?
    Phuong NgoP Phuong Ngo

    @kop-wang 额,也对。已经有RTX6000PRO了,那让IT迁移迁移系统,慢慢一步一步做优化慢慢尝试和测试,至少先在逻辑上实现跑通,云端和本地两条腿走路。多谢佬耐心提意见。

    LLM讨论区 本地模型

  • 大佬们,中小企业自建本地大模型有没有什么可行的方案?
    Phuong NgoP Phuong Ngo

    @kop-wang
    1.用openclaw是我司老板过年听说龙虾很厉害,没有怎么仔细研究就想要在本地搭建,交给公司的IT全权负责搭建,也没有研究诸如用claude code、opencode等调用其他模型的API的路子。
    2.目前的现状是公司的IT部署什么模型,我们就用什么模型,也没有什么真正的产出,顶多就是截取一些代码片段,让agent分析这段代码哪里出现问题了,改改,就这样了。其实主要还是以云端的AI为主,用的最多的就是微软的copilot,因为能在vscode中直接进行代码补全等操作,方便省事。目前我司在AI编程领域处于探索和摸索阶段。
    3.明白,系统改迁移还是迁移。
    4.对于多卡部署,佬有什么建议,尽管提出来,洗耳恭听。

    LLM讨论区 本地模型

  • 大佬们,中小企业自建本地大模型有没有什么可行的方案?
    Phuong NgoP Phuong Ngo

    多卡部署可以解决并发的难题么?

    LLM讨论区 本地模型

  • 大佬们,中小企业自建本地大模型有没有什么可行的方案?
    Phuong NgoP Phuong Ngo

    我司也有类似的需求,公司要求满足30并发需求,主要用LLM进行代码生成,测试用例编写。已采购RTXpro6000 96G的,主机内存64G,但是现在我司的半吊子IT跑模型用的是windows系统,上面跑的模型是GPT 122B,qwen 3.5 35BA3B的模型,开放内网地址让大家用openclaw去调用,现在很难满足30调用,连并发10都做不到,也想问问这种情况如果迁移到ubuntu下,再好好优化一下能否有比较明显的改善,例如全员从openclaw迁移到Hermes Agent。

    LLM讨论区 本地模型

  • macbookpro M3max 128G 8T怎么折腾玩本地AI?
    Phuong NgoP Phuong Ngo

    最新进展
    7900XTX和ubuntu的环境已经搭起来了,老特说的没错,128KQ8确实能跑起来,最后给到了160KQ8,显存占用91%
    ,用hermes agent实测28token/s,本地养hermes确实够用了。hermes折腾过了,返回来在折腾comfyUI生图生视频。折腾这些的初衷不为别的,就是让自己找点事干,买了macbookpro之后本地模型跑起来速度确实慢,有点受不了了,刚好碰到老特了,燃起希望了,目前看来6000的XTX真是太夯了。先在论坛抄各位大佬的作业先玩起来。

    AI硬件 mac apple-m3

  • macbookpro M3max 128G 8T怎么折腾玩本地AI?
    Phuong NgoP Phuong Ngo

    @terry 我买的xtx到了,已经装了ubuntu,部署了qwen 3.6 27B模型,hermes也已经配好了,有个问题就是现在显存占用21G左右,给hermes设的上下文是64K,emm最大上下文能到多少?

    AI硬件 mac apple-m3

  • macbookpro M3max 128G 8T怎么折腾玩本地AI?
    Phuong NgoP Phuong Ngo

    @mark 等我买的xtx显卡回来测试一下,看看是模型问题还是硬件带宽就是不行。

    AI硬件 mac apple-m3

  • macbookpro M3max 128G 8T怎么折腾玩本地AI?
    Phuong NgoP Phuong Ngo

    @terry 好的,老特。我下单了xtx,京东6089,三年质保,准备在旧的windows主机上跑个Ubuntu,装个双系统先玩玩,后面再买洋垃圾在攒个主机。macbookpro暂时也先不卖了,多个折腾的硬件吧,m3max不跑大模型性能还是非常强的,就是可惜了128G的大内存了。

    AI硬件 mac apple-m3

  • macbookpro M3max 128G 8T怎么折腾玩本地AI?
    Phuong NgoP Phuong Ngo

    补充一点,自己还有一台win主机,配置是12600KF+RTX3080 10G,这个主机看看能不能用起来,或者换显卡,再折腾。

    AI硬件 mac apple-m3

  • macbookpro M3max 128G 8T怎么折腾玩本地AI?
    Phuong NgoP Phuong Ngo

    【环境】

    • 设备:MacBook Pro 16" M3 Max (14C CPU + 40C GPU)
    • 内存:128GB 统一内存
    • 存储:8TB SSD
    • 系统:macOS 15.6

    【目标】

    想在本地搭建一套可长期运行的 AI 工作流,主要用途:

    1. LLM 推理:跑 27B 级稠密模型(如 Qwen3.5-27B)作 Hermes Agent 后端,要求低延迟、可并发
    2. 文生图:ComfyUI 工作流,非商用,纯个人玩,能玩起来比什么都重要
    3. 数字人/视频:轻量级尝试,不追求实时,先玩起来

    【已尝试】

    • 通过 Ollama 部署过 Qwen3.5-27B,但感觉响应极慢,每次提问都有明显 "thinking" 时间
    • 了解过 MLX 框架,尚未深入测试 4bit 量化版本的实际 token/s
    • 考虑过卖掉 Mac 换 RTX 3080 20G / 7900XTX,但舍不得统一内存的带宽优势

    希望折腾过的老哥给点建议,多谢多谢。

    AI硬件 mac apple-m3
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组