跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

L

laobenxiong

@laobenxiong
德高望重 劳动模范
取消关注 关注
关于
帖子
57
主题
3
分享
0
群组
2
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • SG-Lang + Qwen3.6 27B + 4090 48G驱动Hermes完美平替在线AI,Linux/MacOS比Windows更适合跑AI服务和Agent部署!
    L laobenxiong

    @terry 说:

    SG-Lang

    7900xtx 能用上吗?

    AI Agent sg-lang qwen3.6-27b hermes

  • 求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!
    L laobenxiong

    dialog.py
    README.md

    FYI: README.md 是我安装 VoxCPM 1.5 的记录; dialog.py 是用来生成两人对话 mp3 的脚本. 主要是hermes+qwen2.6-27B帮忙试出来的. 用的是 16G 的 N 卡. 效果还行. 我刚开始弄的时候把事情想得太简单, 实际过程发现还是要了解一些细节才行. 一键生成---还是太理想了.

    AI音视频画图

  • 求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!
    L laobenxiong

    @Q-maria 嗯, 我是把文本限制在500个字符. 时间长了, 语速原来越快, 噪音也增加. 不懂为啥.

    AI音视频画图

  • 有大神在本地部署 GLM 5.2 吗?
    L laobenxiong

    Hermes 下初步使用, 感觉这个模型比 deepseek 强不少. 不知道本地部署最低什么配置,什么体验...

    LLM讨论区

  • [請益] OCUlink 小主機推薦,AMD 優先,擴充性or 可玩性優先
    L laobenxiong

    @CS6 我用 铭凡 UM880Pro 感觉还行. oculink 和 雷电都可以. 拿7900xtx试过, 我是雷电3的扩展坞, 接雷电的速度比 oculink 慢了很多. 本来打算整两个7900xtx的, 试了一下以后放弃了, 暂时一块 7900xtx 接 oculink 玩玩.

    btw, 买了一年了(pdd, rmb4819. 96G ddr + 2T ssd). 不知现在行情如何.

    AI硬件 amd

  • llama.cpp目前有重大性能BUG:checkpoint的巡回逻辑对于混合模型(比如qwen3.6-27B)无效,从而导致大概率每次对话都要prefill全文,严重拖慢速度
    L laobenxiong

    @kop-wang 我在 7900xtx 上用 llama-server (vulkan, b9553) + unsloth/Qwen3.6-27B-MTP-GGUF + hermes 配 262144 context, 问题的症状和这个不一样. 我可以一个 session 顺利到达 >200K 的上下文结束. 中间没有这里提到的 prefill 重填的问题(或者我没有注意到?). 我碰到的问题是, 任务结束以后, gpu还在运行, llama-server log 显示收到了一堆任务, 然后最后导致 ~200K 的 prefill 全部失效 且重新 prefill. 让 hermes 自己调查了一下 (让它直接监控 llama-server 的日志, 它再和自己的日志对比), 它说是 creation_nudge_interval 和 nudge_interval 导致的, 并建议我把它们置0 (disable).

    LLM讨论区 llama.cpp

  • 双AI Pro R9700 32g,Qwen 3.6 27b q4 KM q8 KV Ubuntu24 Hermes agent
    L laobenxiong

    @Brian 说:

    即使是模型和hermes都设置256k上下文,herems还会触发压缩,最终效果还是很够用的

    我现在把压缩关闭了. 首先压缩效果不一定好(我让hermes调deepseek v4 flash做压缩, 发现压缩以后好多信息都丢了), 另外, 压缩以后所有 prefill 要重建, 既花时间, 有没有啥信息含量. 所以干脆disable it. context 快到头了就 /new 一个, hermes自己记住所有的对话, 在新对话里提一下"我们以前/刚刚聊过xxx", 它自己就会从数据库里去找. 我赶脚这个比压缩还靠谱.

    f33371a2-d0b8-424a-b6cf-fb1c8f6e5deb-image.jpeg

    LLM讨论区 r9700 ai-pro-r9700 hermes

  • 双AI Pro R9700 32g,Qwen 3.6 27b q4 KM q8 KV Ubuntu24 Hermes agent
    L laobenxiong

    @Brian 如果你对"靠谱"要求高的话, 据说 reasoning on 会提高能力, 还有就是把温度调低到 0.6 左右.

    LLM讨论区 r9700 ai-pro-r9700 hermes

  • 【开箱装机】蓝宝石RX 7900 XTX + 蓝宝石1200W金牌 — 从拆机到Ubuntu跑通全记录
    L laobenxiong

    你这个机箱好像可以装两个7900xtx...一个1200w电源带两个卡+主板/cpu, 不知道能不能扛住.

    AI硬件 7900xtx ubuntu

  • 🚀 Lucebox DFlash + Huihui:7900 XTX 上真·无审查 + 极速推理完全折腾纪实
    L laobenxiong

    @abaalei 说:

    --tokenizer Qwen/Qwen3.6-27B

    大神, max_ctx 能到多少? 7900xtx. 谢谢

    LLM讨论区 7900xtx dflash

  • 🔥 Lucebox DFlash 在 7900 XTX 上跑 Qwen3.6-27B — 完整复现与实测报告
    L laobenxiong

    这里写的编译指令貌似过时了。主要差异:

    博客写的 现在的正确写法
    -DDFLASH27B_USE_HIP=ON -DDFLASH27B_GPU_BACKEND=hip(这个 flag 不存在了)
    -DCMAKE_HIP_ARCHITECTURES="gfx1100" -DDFLASH27B_HIP_ARCHITECTURES="gfx1100"
    -DROCM_PATH=/opt/rocm-7.2.0 改为环境变量 export ROCM_PATH=/opt/rocm(不是 cmake 参数)
    cd dflash cd server(目录从 dflash/ 重命名为 server/,PR #281)
    --target test_dflash 应加上 dflash_server
    删掉 src/prefix_cache.cpp 不需要手改 cmake 了
    没提 -DDFLASH27B_FA_ALL_QUANTS 新选项

    总结变化原因:PR #281 把 dflash/ 重命名为 server/,同时 CMake 选项也做了重整(DFLASH27B_USE_HIP → DFLASH27B_GPU_BACKEND=hip)。博客写的时候还是旧版本。

    LLM讨论区 7900xtx dflash

  • 技嘉Z890主板 256G DDR5内存 两张Pro6000 96G 跑cpp Qwen3.6 27B BF16与同时双ComfyUI工作流长视频之运行
    L laobenxiong

    4651c28f-d033-411f-88c0-ebe8a21036d7-image.jpeg 只怪我荷包太浅...

    AI硬件 comfyui

  • 技嘉Z890主板 256G DDR5内存 两张Pro6000 96G 跑cpp Qwen3.6 27B BF16与同时双ComfyUI工作流长视频之运行
    L laobenxiong

    @566656661 问了下 whichllm, 它也推荐 qwen3.6-27b, 这个模型真能打呀f0be4eec-bf18-4921-af94-ab32c043232f-image.jpeg

    AI硬件 comfyui

  • 技嘉Z890主板 256G DDR5内存 两张Pro6000 96G 跑cpp Qwen3.6 27B BF16与同时双ComfyUI工作流长视频之运行
    L laobenxiong

    @b9704037 有一个问题请教下: 在某一个 VRAM 尺寸限制下, 是选用参数量大的模型, 还是选用量化精度高的模型, 效果更好? 其实我的问题就是, 你的配置有足够的 vram, 为什么还停留在 27B 的模型? 谢谢

    AI硬件 comfyui

  • 实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率
    L laobenxiong

    @Colt 说:

    我让Hermes监控llama.cpp的输出日志

    这是个好主意 👍

    AI Agent hermes

  • AI生成了一个LLM GPU显存计算器
    L laobenxiong

    github上有个类似的项目: https://github.com/Andyyyy64/whichllm

    LLM讨论区

  • 笔记本上跑了一下gemma 4 12B ,还凑合
    L laobenxiong

    @张老师 嗯, 本地qwen3.6可以的. 由于是 skill 调用, 前提是跑 hermes 的机器能够访问 url 指向的网站.

    LLM讨论区

  • 笔记本上跑了一下gemma 4 12B ,还凑合
    L laobenxiong

    @张老师 Agent 的 skills 可以帮忙扒视频的字幕, 算是代替 ASR 吧. hermes 就可以, 直接把 url 贴给它, 它调用相应的 skill 获取字幕, 然后再分析...

    LLM讨论区

  • Hermes Desktop 桌面版快速上手指南
    L laobenxiong

    @5ccccc 打开 cmd 敲 hermes update 先升一下级试试? 我早上升级到了 (+32) 8df55dc5-9f45-4c65-b65a-4cf2c60f8aa1-image.jpeg 目前好像没碰到这个问题.

    AI Agent hermes

  • Hermes Desktop 桌面版快速上手指南
    L laobenxiong

    喊 deepseek-v4-pro 给 hermes 画了一个图, 和它来来回回讨论/修改了半天, 也不知对错:
    711f9c1f-fde0-458f-8b60-45411958db1c-image.jpeg

    AI Agent hermes
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组