跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
rock shiR

rock shi

@rock shi
劳动模范 德高望重
取消关注 关注
关于
帖子
95
主题
7
分享
0
群组
2
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • DeepSeek Harness已经成为最好用的AI Agent, Hermes和Codex依然不错,也在进步,但DSH确实更加全面,潜力更大!
    rock shiR rock shi

    以下是用了几天harness的体会,发给了DeepSeek一起总结的。
    我问:我还是搞不懂我本地的harness、codex、hermes有什么区别。这几天我玩下来感觉hermes的记忆力更好,更人性化,但是真正干太多活了记忆上限就会成为瓶颈。干活我发现harness比较适配,虽然我用的不多,但是我的初步感觉是可以分不同的工作区,不同的工作区就可以有不同的记忆模块,尽量减少记忆压力。codex就明显啥都不行,因为昨天刚用,所以还没啥体会。

    DeepSeek答:你的三个印象基本都对,而且"分工作区=分记忆模块"这个直觉正是关键。三者的差别其实不在"谁更聪明",而在记忆模型 + 任务形态:

    Hermes DSH(harness) Codex
    记忆 单一、自我演化,每轮大量注入 → 连续感强、像人;但记忆越厚越贵越慢越爱漂移 文件化、分层、按工作区切;注入小(AGENTS.md+memory.md 几十行),需要你有意识地策展 几乎没有跨会话记忆(有 AGENTS.md/memories,但很弱),默认每次从零
    定位 24h 常驻个人助手:论坛运维、定时活、脚本维护 工程/多步任务的执行台:子代理、workflow、goals、skills、MCP 单会所长链编码:工具循环稳、apply_patch 强
    成本 走 API,每天几块(最近降到 1.5/天) token 最省(你自己实测过) 官方 5 小时/周额度;接本地模型可脱离额度

    为什么 Hermes"记忆好但扛不住大活":它是把"一个人格+一份不断长大的记忆"整体带进每一轮。好处是它记得你、说话像人;坏处是记忆一膨胀,瓶颈同时出现在三处——上下文塞满、token 变贵、旧信息开始污染当前任务。这就是你说的"记忆上限成为瓶颈",结构性的,不是调参能解决的。

    为什么 DSH 干活更适配:它默认不把所有东西都塞进上下文。记忆是分层的:

    • 全局:$DSH_HOME/AGENTS.md + D:\dsh\memory.md(你现在的机器环境/约定/运维备忘,26 行,就该保持这么薄);
    • 工作区/项目:各工作区自己的 AGENTS.md(比如 E:\harness、某个 repo)——这就是你说的"不同工作区不同记忆模块",隔离在这里发生;
    • 任务级:goals(目标状态)、subagents(临时上下文)、会话历史(情景记忆,要的时候搜/捞,不默认注入);
    • 程序性记忆:skills(把重复流程固化,而不是记在"脑子"里)。

    所以 DSH 的记忆压力不是"没有上限",而是可切分、可丢弃:一个工作区的噪音不会污染另一个,项目细节落在项目文件里,而不是全挤在一条长期记忆上。代价是它不会自己长大——得你(或 agent)主动往里写。

    Codex 别急着判死刑:它是把手术刀,不是工作台。它真正强的是"一个会话里把一条长链编码任务干到底"(比 Hermes 强,和 DSH 互有胜负——这跟论坛里 terry 的评价一致:开发 APP 时两者伯仲之间,Codex 更稳一点)。另外它现在在你机器上还有个独特角色:唯一一个右下角能同时切官方 GPT 和本地 qwen 的入口。

    落到你身上,我建议的分工:

    1. Hermes:继续当常驻助手(论坛、定时、运维脚本)。别让它扛大工程,那是它的短板。
    2. DSH:工程和多步任务的默认入口。每个常驻项目建一份自己的工作区 AGENTS.md + 项目笔记;全局 memory.md 只放跨项目事实(机器、约定、坑)。
    3. Codex:临时用——单会长链编码、或者需要切模型时(官方额度/本地 qwen 一个菜单切换)。
    4. 知识库(你的 E:\Obsidian-Vault)当 L2:按需 read,不进注入。这样"记忆"就不再是一口锅,而是全局偏好 / 项目笔记 / 按需知识库三层,压力自然分散。

    要不要我把这套分区方案落地一次?具体可以做两件小事:给 E:\harness 建一份工作区级 AGENTS.md(写清这个工作区干什么、记忆往哪放),再把全局 memory.md 里跟项目细节有关的部分挪到对应项目笔记里——你看着改,我给你出 diff。

    AI Agent deepseek dsharness hermes

  • DeepSeek Harness已经成为最好用的AI Agent, Hermes和Codex依然不错,也在进步,但DSH确实更加全面,潜力更大!
    rock shiR rock shi

    直接把这个帖子的链接发给了harness,搞定了

    AI Agent deepseek dsharness hermes

  • DeepSeek Harness已经成为最好用的AI Agent, Hermes和Codex依然不错,也在进步,但DSH确实更加全面,潜力更大!
    rock shiR rock shi

    ff8b75489c2977c42ca9ca1ca5454d85.png

    AI Agent deepseek dsharness hermes

  • 京东自营上架二手3090,标价8699,近期有自建本地AI算力的玩家可以给东哥走个面,单卡或者双卡TP都很有CP值,比7900XTX新卡更好!
    rock shiR rock shi

    @johnnybegood 刚刚看了看咸鱼已经涨了啊,好像3500-3900了。之前2780买了两张

    AI硬件 rtx3090 多卡部署

  • 离线 AI 开发笔记本求推荐:5090 24G 还是 M5 Pro 64G?
    rock shiR rock shi

    @imbiplaza-ASUS 估计楼主的离线需求太高,手机可能也算不上纯离线?

    AI硬件 rtx5090 mac apple-m5

  • 我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?
    rock shiR rock shi

    @kos-or 是的是的👍

    AI硬件 本地模型 多卡部署

  • 我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?
    rock shiR rock shi

    @kos-or 对于准96g mac用户,还是蛮期待未来迭代。毕竟大参数里只有它能塞得进96g mac,显存空间弥补了70b规模的断档

    AI硬件 本地模型 多卡部署

  • 我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?
    rock shiR rock shi

    @terry 27b目前确实太天花板了

    AI硬件 本地模型 多卡部署

  • M5 Ultra的1.2T/s高带宽有多大用处?
    rock shiR rock shi

    @张光璞 我2080峰值到过7000哈哈哈

    LLM讨论区 mac apple-m5

  • 我的显存是(8G、12G、24G、32G、48G… 512G)的话,到底能做什么?
    rock shiR rock shi

    96g还可以跑qwen3.8 Flash next 4bit量化,n-gram放在ssd

    AI硬件 本地模型 多卡部署

  • mac m5 ultra上线中国官网。1.2T显存带宽,256GB版本8.6万
    rock shiR rock shi

    @rich-king 哈哈必须的!让老特搞个社群他也不搞,这里交流起来还是慢半拍

    AI硬件 mac apple-m3 apple-m5

  • mac m5 ultra上线中国官网。1.2T显存带宽,256GB版本8.6万
    rock shiR rock shi

    @kop-wang rtx5000这个价格应该拿不到了,一个月前差不多

    AI硬件 mac apple-m3 apple-m5

  • mac m5 ultra上线中国官网。1.2T显存带宽,256GB版本8.6万
    rock shiR rock shi

    @rich-king 没事,我陪你一起sb

    AI硬件 mac apple-m3 apple-m5

  • # 双卡 RTX 2080 Ti + vLLM 跑 Qwen3.8-27B-FP8 实测分享
    rock shiR rock shi

    @lysen963 是涡轮卡。主要是满功率太吵了,再就是怕温度太高这种魔改卡也受不了

    AI硬件 rtx2080ti vllm qwen-27b

  • Qwen3.8-27B-MLX-8bit on M5 max
    rock shiR rock shi

    @zorg 这个速度感觉真能用了。就是价格还是有点美丽😢

    LLM讨论区 qwen-27b mac 量化 apple-m5

  • Qwen3.8 27b工具调用出错?一个参数解决
    rock shiR rock shi

    一、现象

    vLLM 起 Qwen3.8-27B(FP8)给 Agent 做工具调用(我这里是 Hermes)。模型明明在输出工具调用,API 侧却解析不出来,日志里反复刷:

    WARNING [qwen3xml_tool_parser.py:305] Error when parsing XML elements:
    not well-formed (invalid token): line 6, column 1
    

    一周里积了 94 条。每次工具调用作废,模型重试一次,整体体感又慢又不稳。

    二、先排除一个常见嫌疑

    第一反应:是不是我下的模型是 Coder 变体,格式对不上?

    直接翻模型目录的 config.json:

    model_type = qwen3_5
    base_model: Qwen/Qwen3.8-27B
    

    标准官方版,没有 Coder 血统。再看它自带的 chat_template.jinja:模板里教模型用的就是 <function>/<parameter> 格式——和我们实际收到的输出完全一致。模型输出没问题。

    三、真凶:parser 太"较真"

    vLLM 里 Qwen3 的工具调用 parser 有两个,认的标签完全一样(都是 <function>/<parameter>),差别在实现:

    • qwen3_xml:用真 XML 解析器(expat)做校验。标签要闭合,参数值要合法 XML——值里出现未转义的 <、&、引号,直接报错。
    • qwen3_coder:纯正则,只认标签边界,内容"合不合法"根本不管,没收尾也照收。

    Agent 场景对严格版是致命的:工具参数里全是 shell 命令、JSON、引号——恰恰是全世界最不像 XML 的内容,塞进 <parameter> 就不是合法 XML 了,expat 罢工,整条工具调用作废。

    四、解决

    vLLM 启动参数改一个:

    --tool-call-parser qwen3_coder
    

    重启。前后实测对比(同机同模型,只有 parser 这一处改动):

    修复前(约 6 天) 修复后(18.5 小时)
    请求量 — 2265 个 chat completions
    not well-formed 解析错误 94 次(日均 16 次) 0 次
    parser 相关日志行 2 万多行 0 行

    顺带一提:改完体感变快,不是基础 token 速度变了——是省掉了每次作废后的重试。

    五、注意边界

    • 修的是服务层,不是模型。权重没问题,别想着去下载什么"修复版模型"。
    • parser 的选择是"宽松 vs 严格",不是"新 vs 旧"。如果你的场景参数值都很干净、且想要严格校验,qwen3_xml 依然成立。
    • 双向坑:也有用户报告 qwen3_coder 在某些 checkpoint 上死循环输出 !!!!!!(HF Qwen3-Coder-Next 讨论 #17),换回 qwen3_xml 才好。选哪个看你的模型版本和参数值"脏"不脏,拿日志说话。
    • 适用面:vLLM 跑 Qwen3 家族 + 参数值长、含特殊字符的 Agent 工具调用场景。日志里刷同样 WARNING 的,先试这个。

    六、相关发现(不是我一个人的孤证)

    • NVIDIA NemoClaw #6457 / #6551(2026-07):DGX Spark 上 Qwen3.6-35B-A3B 用 qwen3_xml 起服务,工具调用 HTTP 400,日志同样的 not well-formed(303 行 vs 我这边 305 行,版本差几行)。NVIDIA 的修复 PR 把 recipe 改成 qwen3_coder,根因描述和本帖一致。
    • vllm-project/recipes PR #826(2026-08,未合并):Qwen3.8-27B 的官方 recipe 正把 parser 改回 qwen3_xml。按官方教程配的人,下一步大概率会踩这个坑——欢迎踩完来对答案。
    • openclaw #124284(2026-08,open):完全相同的报错行(line 6, column 1)和 3 次重试症状,归因到了流式包装 bug,parser 没动。

    七、环境

    vLLM(0.1.15 构建)、Qwen3.8-27B-FP8、Hermes Agent。

    LLM讨论区 qwen-27b vllm hermes

  • 3080 20G(魔改)实测能跑 MiniMax H3 本地生成,Turbo LoRA + SageAttention 2.2.0 双重加速
    rock shiR rock shi

    @terry 昨天看了老特的视频受到启发。两张3080,gpu0跑h3,gpu1跑zimage,实测成功。并且发现sageattention对图片生成也有效,可以直接生成1440p图片

    AI音视频画图 rtx3080 minimax 视频生成

  • 加3080 20G 还是 7900XTX 24G?
    rock shiR rock shi

    看了老特的视频,我双3080 20g都想转7900xtx了。不过一张7900的价格是两张3080的价格了。
    我属于比较菜的,买3080的时候都不知道有7900这回事

    AI硬件 rtx3080 7900xtx

  • 3080 20G(魔改)实测能跑 MiniMax H3 本地生成,Turbo LoRA + SageAttention 2.2.0 双重加速
    rock shiR rock shi

    人工备注:本次提速是hermes+DeepSeek直接改的comfyui配置,帖子是让DeepSeek写的,已经让他把坑和怎么部署都都进去了,你可以直接给你的hermes帮你部署。以下是AI总结:

    先说结论:官方标注 H3 本地跑需要 ~24G 显存,我这张魔改 3080 20G(GA102 / sm86)实测能跑,配合两个开源加速手段,768P 视频生成速度是官方 10 步基线的 2 倍以上。全部数据实测可复现。

    环境:RTX 3080 20G 魔改 / ComfyUI 0.30 portable / torch 2.9.1+cu130 / Python 3.13 / MiniMax H3 开源 FL2VA(pruned INT8 DiT + NVFP4 文本编码器)

    一、20G 能跑的关键

    • 官方最小组合 ~24GB,20G 靠三样凑出来:pruned INT8 DiT(21GB 流式加载)、NVFP4 编码器(15.7GB 按需装载)、ComfyUI 的 --disable-dynamic-vram 回退原生显存管理
    • 模型加载有 11~26s 冷启动开销,属正常,不是故障

    二、加速第一步:Turbo LoRA 4-step

    • 官方蒸馏 LoRA v1.0(fl2v_turbo_4step),采样器 euler + beta 调度 + shift 6/3
    • 采样段比 10 步基线快 ~1.5 倍,画质与 10 步接近

    三、加速第二步:SageAttention 2.2.0

    • 踩坑实录:官方 PyPI 只有 1.0.6,2.2.0 只在 GitHub 源码;Windows 无官方轮子
    • 解法:社区预编译轮子(woct0rdho/SageAttention,需匹配 torch 版本选 tag)+ triton-windows(模块名就是 triton,有 cp313 win 轮子)
    • ComfyUI 原生 --use-sage-attention 全局开关,不需要改任何工作流,出错自动回退 pytorch
    • sm86 自动走 INT8 QK + FP16 PV 路径(FP8 kernel 是 Ada/Hopper 专属,Ampere 用不了)

    四、速度对比(768P,全部实测)

    方案 5s I2V 总耗时 纯采样段 相对基线
    10 步基线(官方参数) 541~604s 473~529s 1.0x
    Turbo LoRA 4-step 349s 225~251s ~1.5x
    4-step + SageAttention 279.7s 188s ~2.1x
    时长 无 Sage + SageAttention 提速
    --- --- --- ---
    5s 349s 279.7s 20%
    10s 1012s(17min) 757.8s(12.6min) 25%
    • 越长越赚:attention 开销随序列长度二次方增长,长视频是 SageAttention 的甜区
    • 独立基准(B=1, H=56, S=8192, D=128, bf16,模拟 H3 配置):SDPA 53.8ms → sage 24.0ms,2.24x

    五、画质与稳定性

    • INT8 量化注意力最大误差 0.0039,肉眼不可见,逐镜对比确认无损
    • Windows WDDM 下曾有 H3 + sage kernel 驱动级 GPU lost 案例(Blackwell sm120 FP8 路径);sm86 FP16 路径连跑多镜无崩,另设注册表 TdrDelay=60 兜底

    六、给 Hermes / AI 助手的部署指南(玩家把下面整段丢给你的 Agent,可直接执行)

    任务:为 Windows ComfyUI portable + 3080 (sm86) 启用 SageAttention 2.2.0。先查环境再动手,全程不改工作流文件。

    Step 0 环境对齐(必须)

    # 用 ComfyUI 自带 python(portable 路径如 E:\ComfyUI_windows_portable\python_embeded\python.exe)
    python_embeded\python.exe -c "import torch; print(torch.__version__, torch.version.cuda)"
    # 目标:torch 2.9.x + cu130。轮子必须匹配此版本,别猜
    

    Step 1 装依赖(两条 wheel,免编译免 nvcc)

    # ① triton:官方无 Windows 轮子,用社区 fork(模块名就是 triton)
    python_embeded\python.exe -m pip install triton-windows==3.7.1.post27
    # ② sageattention 2.2.0:官方 PyPI 只有 1.0.6!去 GitHub 下社区预编译轮子
    #    woct0rdho/SageAttention → releases → v2.2.0-windows.post6
    #    选文件名含 cu130torch2.9.1 的那个(cp310-abi3 兼容 py3.10~3.13)
    #    ⚠️ 文件名带 + 号 pip 会报 Invalid wheel filename,先 cp 成规范名
    python_embeded\python.exe -m pip install --no-deps sageattention-2.2.0+cu130torch2.9.1.post6-cp310-abi3-win_amd64.whl
    # --no-deps 必须:防 pip 去拉 PyPI 的 linux 版 triton
    

    Step 2 启用(ComfyUI 原生全局开关)

    # 启动命令加参数(bat 或命令行都行)
    python_embeded\python.exe -s ComfyUI\main.py --windows-standalone-build --disable-dynamic-vram --use-sage-attention
    

    Step 3 验证(三关,缺一不可)

    # ① 启动日志必须出现:Using sage attention(没有 = 参数没生效)
    # ② 冒烟测试:
    python_embeded\python.exe -c "import sageattention, triton; print('ok')"
    # ③ GPU 正确性 + 加速比:
    python_embeded\python.exe - << 'EOF'
    import torch, sageattention
    torch.manual_seed(0)
    B, H, S, D = 1, 56, 8192, 128
    q = torch.randn(B, S, H, D, dtype=torch.bfloat16, device="cuda")
    k = torch.randn(B, S, H, D, dtype=torch.bfloat16, device="cuda")
    v = torch.randn(B, S, H, D, dtype=torch.bfloat16, device="cuda")
    ref = torch.nn.functional.scaled_dot_product_attention(q.transpose(1,2), k.transpose(1,2), v.transpose(1,2)).transpose(1,2)
    out = sageattention.sageattn(q, k, v, tensor_layout="NHD", is_causal=False)
    print("max_err:", (out-ref).abs().max().item())  # <0.01 正常
    EOF
    

    Step 4 提速兜底(防驱动超时)

    # 管理员 cmd 执行:GPU 超时阈值 2s→60s(Windows + sage kernel 的已知风险对冲)
    reg add "HKLM\SYSTEM\CurrentControlSet\Control\GraphicsDrivers" /v TdrDelay /t REG_DWORD /d 60 /f
    

    Step 5 速度验证(同 seed 同参数 A/B)

    • 同一工作流、同一 seed,对比开/关 --use-sage-attention 两次的 Prompt executed 日志
    • 3080 sm86 参考值:5s/768P I2V 4-step ≈280s,10s ≈758s

    回滚:pip uninstall sageattention triton-windows + 启动参数删掉,5 分钟还原。

    已知坑清单:

    1. PyPI 官方 sageattention 只有 1.0.6(旧版),2.2.0 必须社区轮子
    2. triton 官方不支持 Windows → 必须 triton-windows
    3. sm86 无 FP8 tensor core,自动走 INT8/FP16 路径;FP8 是 Ada/Hopper 专属
    4. 若启动报错提示装 sageattention → 包没装对,回去查 Step 1
    5. 出现 GPU lost(显示器闪断/驱动重启)→ 查 TdrDelay,长视频首次跑务必盯
    AI音视频画图 rtx3080 minimax 视频生成

  • AI剪辑的逻辑是什么?
    rock shiR rock shi

    老特那个应用场景用AI剪辑足够了,主要原理就是静帧看图。你要是创意片、故事片必须得用视频理解的模型,目前也就kimi2.6或者kimi 3,之前我让他看过我剪完的视频,视频理解的质量高的离谱。

    但是没测试过让kimi剪辑,成本太太太高,不敢玩

    自媒体 自媒体 视频生成
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组