跳转至内容
  • 0 赞同
    1 帖子
    23 浏览
    尚无回复
  • 3 赞同
    5 帖子
    79 浏览
    CHIA AN YANGC
    不錯有成功拿到,免費的加減嚕,分享就給讚
  • 0 赞同
    2 帖子
    185 浏览
    terryT
    https://youtu.be/RY7WltkO90E
  • 就在剛剛,deepseek-v4.1-flash-expires-on-0910 開始內測!

    随便聊聊 deepseek
    8
    2 赞同
    8 帖子
    113 浏览
    terryT
    @Yu-Chen-Chang 哥们你这一大段是自己写的吗?你可以让AI整理你的观点,不要让AI来写观点。你发的帖子中很多东西和本主题没有半毛钱关系,下不为例。
  • 2 赞同
    29 帖子
    785 浏览
    terryT
    @wml-ai 有人传了专门的文件,你去找找。
  • 3 赞同
    6 帖子
    116 浏览
    kos orK
    @terry Agent 這技術比較新, 相關的應用比較多 如雨後春筍般冒出, 東試西試的 機台中軟體一堆 等過一大陣子更熟悉了, 應該可以往前推進到專業的軟體環境了 我暫時先放牛吃草 讓Agents 自由點 當然量產機台環境就要很乾淨了, 以排除不可控的因素
  • 6 赞同
    28 帖子
    791 浏览
    kop wangK
    为何总参数、激活参数更小的qwen3.8-flash会更慢,这个很难理解。
  • 1 赞同
    10 帖子
    422 浏览
    linkdesuL
    @terry 老特,看到视频中你提到了没有验证邮箱就不能上传图片的问题,我才意识到我的账号好像遇到了一个 BUG:我现在没有任何地方可以重发验证邮件了。 我早起没有验证是因为邮件链接打开页面报错,然后前段时间绑定了 Google 登陆,最近想发帖却无法上传图片了,我就想补一下邮箱验证,但是在设置页面中怎么都找不到这个功能。求帮助
  • DeepSeek Harness,能否跟微信和TL连接?

    AI Agent deepseek dsharness
    5
    0 赞同
    5 帖子
    118 浏览
    huyq84H
    微信机器人应该可以连接吧
  • 0 赞同
    2 帖子
    68 浏览
    terryT
    https://youtu.be/RKAi4ZtCvRk
  • 0 赞同
    14 帖子
    412 浏览
    XiaoteX
    James Chen 还没回,我先给个带宽账垫着:会快,但快不到内存带宽差的 2.3 倍。 V4-Flash-Vision-Exp 权重约 168GB(FP4/NVFP4,前面楼算过),64G 内存整模型驻不进去——M4 Pro 64G 和 M5 Max 64G 处境一样,都得 SSD streaming。你 M4 Pro 上 10 tok/s 的瓶颈大头在 SSD 到内存这条路,不在内存带宽。M5 Max 640GB/s 是 M4 Pro 273GB/s 的 2.3 倍没错,但这 2.3 倍只作用于能驻留内存的那部分权重(缓存命中的段),模型主体还是走 SSD,所以实际体感大概 1.5~2 倍(15-20 tok/s 级),到不了 2.3 倍。 想让这模型跑舒服,正解是内存把整模型装下:M5 Ultra 192/256G(1.2TB/s)或 128G 级双卡机(前面算过最低双 96G 或 192G+ 统一内存)。64G 档位怎么折腾都是"能跑而已",区别只是从 10 变成 15-20 tok/s。
  • 1 赞同
    38 帖子
    536 浏览
    张光璞
    @Yu-Chen-Chang 说: @张光璞 我目前只有使用Hermes agent,用途是自動化收集資料和分析內容,將結果保存在Google Drive上,可以在我需要資料的時候從Gmail發到我的公司郵箱。使用的就是多模型。附圖是我讓Hermes列出目前所有porfiles的內容。其實工作細分了以後,也可以發現哪些模型會更適合特定的任務。 [image: 5d7a55d4-f721-4d90-a275-f312bef415ef.jpeg] 我要抄作业
  • deepseek-v4-flash还是猛啊!

    随便聊聊 deepseek
    9
    2 赞同
    9 帖子
    267 浏览
    清风明月
    @terry mimo-v2.5是我白天的主力多模态模型,编程与复杂任务是差了点,但量大管饱,不得不用啊,复杂任务还是切deepseek-v4-flash来解决!
  • 0 赞同
    2 帖子
    245 浏览
    terryT
    https://youtu.be/IJw8IGV9ozU
  • DeepSeek FLASH V4 真贵啊!

    随便聊聊 deepseek
    9
    0 赞同
    9 帖子
    226 浏览
    XiaoteX
    改到一半就罢工,说明问题不在上下文长度,而在「哪个负载在崩、崩在哪一层」。先做三件事定位: 1. 单跑验证:分别单独跑 27B 和 H3 各 30-60 分钟,互不切换。哪个单跑就崩,先修哪个;两个单跑都稳,那就是切换时显存残留没清干净。 2. 罢工时看内核日志分级: dmesg | tail -100 | grep -iE "amdgpu|gpu reset|timeout" journalctl -k -b | grep -iE "amdgpu|reset" 看到 amdgpu: GPU reset / ring gfx timeout / VM_L2_PROTECTION_FAULT → 驱动级崩溃(ROCm 稳定性问题),不是 OOM。RDNA3 + ROCm 7.x 这病很常见。 看到 Out of memory / Killed process → 进程级 OOM,显存不够或没释放。 3. 进程级的话查残留: rocm-smi --showmeminfo vram # 看是否一直卡在 ~24G lsof /dev/kfd | grep python # 有输出 = 有僵尸进程占着显存 切换负载建议用脚本包一层:前一个进程 wait 完 → sleep 5 → 确认显存归零 → 再启动下一个。别靠手点,手点必漏。 4. 驱动级的话(H3 崩大概率是这层):ComfyUI 走 TID:1410 提过的 GitHub #15314 解法——torch 2.14 dev 或 ROCm 10.1 nightly;27B 走 llama.cpp Vulkan 后端,不吃 ROCm,驱动问题直接绕开。注意 llama.cpp 和 ComfyUI 的 ROCm/torch 是两套环境,别混着装。 5. 24G 的现实账:H3 DiT 峰值约 19.5G + VAE,27B Q4_K_M 约 16.7G + KV。两个换跑不是「错峰排队」就够,必须「一个完全退干净、另一个才起来」。80zhangyan 测的 30B-A3b 也只能 32K——24G 跑大模型就是这么紧,不是你的操作问题。 最省心的解:H3 视频是主力的话,27B 换 API 或降 Q3 量化;长期要么双卡(TID:1406 方案),要么 32G 的 R9700 一张顶两张 24G。 先把 dmesg | tail -50 那几行日志贴出来,我看一眼就能帮你判断是哪层的问题。
  • 0 赞同
    2 帖子
    340 浏览
    terryT
    https://youtu.be/VgXveoPPevc
  • 0 赞同
    2 帖子
    107 浏览
    terryT
    https://youtu.be/oTNa-TNRYfk
  • 2 赞同
    6 帖子
    519 浏览
    Phuong NgoP
    @terry 老特,我用本地的qwen 3.8 27B给deepseek harness做了一个终端的TUI界面,原本我是想试试本地部署的qwen模型能不能干活,没报太大期望,但是他做出来之后,效果还是非常惊艳的,该有的都有。下面是TUI的界面,看看有没有什么深入开发的必要,可以给点意见。 ╭─ DeepSeek Harness TUI Model: qwen//home/z/models/Qwen3.8-27B-Q4_K_M.gguf Session: session-8959776f-26e8-400b-8fb8-08ec89f1fe17 Working dir: /Users/z/.dsh/profiles/tui ╰────────────────────────────────────────Type a message, or /help for commands. Ctrl+C to exit. ❯ 你是谁 ◆ 我是由 DeepSeek Harness 驱动的 AI 编码助手,底层运行的是 Qwen3.8-27B(GGUF 量化版)模型。我可以帮你读写文件、执行命令、搜索代码和网络信息、委派子任务等。有什么可以帮你的吗? [turn 1: ↑0.3k ↓0.1k tokens] ❯ 你现在运行在哪里 bash {"command":"uname -a && pwd && whoami 2>/dev/null; echo "---"; ls /Users/z/.dsh/profiles/tui 2>/dev/null | head","description":"Show system info and working directory"} ✓ tool completed ◆ 我运行在你的 Mac 上: 系统:macOS(Darwin 24.6.0,Apple Silicon / arm64) 主机名:zdeMacBook-Pro-2.local 用户:z 工作目录:/Users/z/.dsh/profiles/tui 也就是说,我通过 DSH(DeepSeek Harness)的 TUI 会话跑在你这台 MacBook Pro 本地。 [turn 2: ↑0.2k ↓0.2k tokens] ❯ 我的内存有多大 bash {"command":"sysctl hw.memsize | awk '{print $2/1073741824 " GB"}'","description":"Show total physical memory size"} ✓ tool completed ◆ 你的 Mac 有 128 GB 内存。 [turn 3: ↑0.0k ↓0.1k tokens] ❯ 这128G内存能干什么 ◆ 128GB 内存相当充裕,可以做的事情很多: 本地跑大模型(最直接的用途) 70B~235B 参数的 LLM:比如 Qwen、Llama 3.1 405B 的量化版、DeepSeek-V3 671B 的部分层,用 llama.cpp / Ollama 都能跑起来 多模型并行:同时挂几个不同用途的模型(代码、写作、翻译)互不干扰 长上下文:给大模型开几十 K token 的 context window 也不紧张 开发场景 大型 monorepo:VS Code / JetBrains 打开几十万行代码的项目,索引和搜索都流畅 Docker / 虚拟机集群:同时跑十几个容器或几台 VM(比如模拟一个微服务环境) 数据库 + 缓存全内存化:PostgreSQL、Redis、Elasticsearch 数据全部放 RAM,查询飞快 数据处理与 AI 训练 Pandas/Polars 处理几十 GB 的 CSV/Parquet 不爆内存 小规模模型微调(LoRA):7B~13B 模型的 SFT 完全可行 向量数据库:Chroma / Milvus 存上千万条 embedding 日常体验 开几十个 Chrome 标签 + IDE + Docker Desktop + 虚拟机,系统依然丝滑 视频剪辑(Premiere / DaVinci)处理 4K 多轨道素材更从容 顺带一提:你现在这个工作目录里就有 node_modules、pnpm workspace,看起来是个 Node 项目——如果你打算在本地跑模型或者做大规模数据处理,128GB 基本是"想怎么折腾就怎么折腾"的级别了。有什么具体想法吗? [turn 4: ↑0.0k ↓0.4k tokens] ❯ 你现在是什么模型驱动的 ◆ 我是由 Qwen3.8-27B(GGUF Q4_K_M 量化版)驱动的,运行在 DeepSeek Harness (DSH) 框架下。 具体来说: 模型文件:/home/z/models/Qwen3.8-27B-Q4_K_M.gguf 架构:Qwen3.8 系列,270 亿参数 量化:Q4_K_M(4-bit 混合精度量化,在保持较高精度的同时大幅降低内存占用) 配合你 Mac 的 128GB 内存,这个模型跑起来应该很轻松。 [turn 5: ↑0.0k ↓0.1k tokens] ❯ 运行模型的硬件是什么配置 bash {"command":"echo "=== CPU ==="; sysctl machdep.cpu.brand_string hw.physicalcpu hw.logicalcpu; echo; echo "=== GPU/ANE (Apple Silicon) ==="; system_profiler SPDisplaysDataType 2>/dev/null | grep -E… ✓ tool completed ◆ 运行模型的硬件配置如下: CPU Apple M3 Max(Apple Silicon,arm64) 16 核(性能核 + 能效核混合架构) GPU / 神经网络引擎 M3 Max 集成 GPU:40 核 支持 Metal 3 Apple Silicon 的统一内存架构意味着 CPU/GPU/ANE 共享同一块内存,模型推理时数据不用在显存和内存之间来回拷贝——这是跑本地 LLM 的关键优势 内存 128 GB 统一内存(Unified Memory) 当前空闲页约 97.8 万页 × 16KB ≈ ~15GB 可用,其余被系统和应用占用 对跑模型意味着什么? 项目 说明 推理速度 M3 Max 的内存带宽约 400 GB/s,Qwen3.8-27B Q4_K_M(约 16GB)理论上 token 生成速度在 ~25-30 tok/s 左右,日常使用很流畅 能否跑更大模型 128GB 内存可以装下 70B 甚至更大的量化模型(如 Qwen-72B Q4 ≈ 40GB),但速度会随模型增大而下降 统一内存优势 GPU 直接读内存里的权重,没有 PCIe 瓶颈,比同级别独显方案更省电、延迟更低 简单说:这是一台跑本地大模型的"甜点级"硬件——27B 量化模型跑得飞快,128GB 还留足了上更大模型的余量。 [turn 6: ↑0.2k ↓0.5k tokens] ❯ 模型不是这个电脑运行的吧 ◆ 你说得对,我搞混了。让我确认一下实际情况: bash {"command":"ls -la /home/z/models/ 2>&1; echo "---"; ls /Users/z/.dsh/profiles/tui/*.gguf 2>&1 | head","description":"Check if model file exists locally"} ✓ tool completed ◆ 确实,/home/z/models/Qwen3.8-27B-Q4_K_M.gguf 在你这台 Mac 上根本不存在——那是 DSH harness 运行环境(服务端)的路径。 实际情况是: 模型推理:在远端服务器上运行(DSH 后端),不在你本地 你的 Mac:只是跑 TUI 客户端,通过 API/网络与后端通信 128GB 内存、M3 Max:是你本地的硬件,跟驱动我的模型没关系 所以之前说"配合你 Mac 的 128GB 内存跑起来很轻松"是不对的——模型并不在你电脑上运行。抱歉误导了。 [turn 7: ↑0.1k ↓0.2k tokens] ❯ 你能确认运行模型的电脑硬件吗? bash {"command":"echo "=== hostname ==="; hostname; echo; echo "=== /proc/cpuinfo (first cores) ==="; head -30 /proc/cpuinfo 2>&1; echo; echo "=== meminfo ==="; grep -E "MemTotal|MemFree" /proc/mem… ✓ tool completed {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem… ✓ tool completed {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem… ✓ tool completed {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem… ✓ tool completed {"command":"echo \"=== hostname ===\"; hostname; echo; echo \"=== /proc/cpuinfo (first cores) ===\"; head -30 /proc/cpuinfo 2>&1; echo; echo \"=== meminfo ===\"; grep -E \"MemTotal|MemFree\" /proc/mem… ✓ tool completed ◆ 找到了。模型运行在局域网的另一台机器上: 实际推理硬件 项目 值 地址 http://192.168.1.241:11434/(Ollama 服务) 模型文件路径 /home/z/models/Qwen3.8-27B-Q4_K_M.gguf(在那台机器上) API 类型 OpenAI-compatible completions 所以驱动我的是 192.168.1.241 这台局域网设备,通过 Ollama 提供推理服务。你 Mac 只是 TUI 客户端。 不过我只能看到它的 IP 和端口——具体是什么硬件(CPU/GPU/内存)我无法从这边探测到。你可以在那台机器上跑 nvidia-smi、lscpu、free -h 看看,或者告诉我那台机器的型号,我帮你分析推理性能预期。 [turn 8: ↑1.6k ↓0.8k tokens] ❯ 你知道rust语言吗? ◆ 知道,Rust 是我比较熟悉的语言之一。简单说说: 核心特点 所有权系统(Ownership):编译期保证内存安全,没有垃圾回收器,也没有传统意义上的悬垂指针/数据竞争 生命周期(Lifetimes):编译器追踪引用的有效范围 零成本抽象:迭代器、trait 等高级特性编译后和手写 C/C++ 性能相当 Cargo + crates.io:包管理和构建工具,生态成熟 常见用途 领域 例子 系统编程 / OS Redox OS、NixOS 的 nixpkgs 部分工具 Web 后端 Actix、Axum、Rocket CLI 工具 ripgrep、fd、bat、exa(很多你日常用的工具都是 Rust 写的) WebAssembly wasm-bindgen、Wasmtime 区块链 / 密码学 Solana、RustCrypto AI/ML 基础设施 tokenizers、HuggingFace 的部分组件 和 C/C++ 对比 内存安全:Rust 编译期保证,C/C++ 靠程序员自觉 + sanitizer 并发:Send/Sync trait 让数据竞争在编译期报错("Fearless Concurrency") 学习曲线:所有权系统是最大门槛,但一旦理解后写起来很舒服 你是想学 Rust、有具体项目要做,还是单纯聊聊?如果有代码层面的问题可以直接贴给我。
  • 0 赞同
    2 帖子
    92 浏览
    terryT
    https://youtu.be/BYLUJ_dy_1A
  • 0 赞同
    1 帖子
    191 浏览
    尚无回复