-
SG-Lang + Qwen3.6 27B + 4090 48G驱动Hermes完美平替在线AI,Linux/MacOS比Windows更适合跑AI服务和Agent部署! -
求助帖,文字(文案、剧本)转音频,声音 AI 化太明显! -
求助帖,文字(文案、剧本)转音频,声音 AI 化太明显!@Q-maria 嗯, 我是把文本限制在500个字符. 时间长了, 语速原来越快, 噪音也增加. 不懂为啥.
-
有大神在本地部署 GLM 5.2 吗?Hermes 下初步使用, 感觉这个模型比 deepseek 强不少. 不知道本地部署最低什么配置,什么体验...
-
[請益] OCUlink 小主機推薦,AMD 優先,擴充性or 可玩性優先@CS6 我用 铭凡 UM880Pro 感觉还行. oculink 和 雷电都可以. 拿7900xtx试过, 我是雷电3的扩展坞, 接雷电的速度比 oculink 慢了很多. 本来打算整两个7900xtx的, 试了一下以后放弃了, 暂时一块 7900xtx 接 oculink 玩玩.
btw, 买了一年了(pdd, rmb4819. 96G ddr + 2T ssd). 不知现在行情如何.
-
llama.cpp目前有重大性能BUG:checkpoint的巡回逻辑对于混合模型(比如qwen3.6-27B)无效,从而导致大概率每次对话都要prefill全文,严重拖慢速度@kop-wang 我在 7900xtx 上用 llama-server (vulkan, b9553) +
unsloth/Qwen3.6-27B-MTP-GGUF+ hermes 配 262144 context, 问题的症状和这个不一样. 我可以一个 session 顺利到达 >200K 的上下文结束. 中间没有这里提到的 prefill 重填的问题(或者我没有注意到?). 我碰到的问题是, 任务结束以后, gpu还在运行, llama-server log 显示收到了一堆任务, 然后最后导致 ~200K 的 prefill 全部失效 且重新 prefill. 让 hermes 自己调查了一下 (让它直接监控 llama-server 的日志, 它再和自己的日志对比), 它说是creation_nudge_interval和nudge_interval导致的, 并建议我把它们置0 (disable). -
双AI Pro R9700 32g,Qwen 3.6 27b q4 KM q8 KV Ubuntu24 Hermes agent -
双AI Pro R9700 32g,Qwen 3.6 27b q4 KM q8 KV Ubuntu24 Hermes agent@Brian 如果你对"靠谱"要求高的话, 据说 reasoning on 会提高能力, 还有就是把温度调低到 0.6 左右.
-
【开箱装机】蓝宝石RX 7900 XTX + 蓝宝石1200W金牌 — 从拆机到Ubuntu跑通全记录你这个机箱好像可以装两个7900xtx...一个1200w电源带两个卡+主板/cpu, 不知道能不能扛住.
-
🚀 Lucebox DFlash + Huihui:7900 XTX 上真·无审查 + 极速推理完全折腾纪实 -
🔥 Lucebox DFlash 在 7900 XTX 上跑 Qwen3.6-27B — 完整复现与实测报告这里写的编译指令貌似过时了。主要差异:
博客写的 现在的正确写法 -DDFLASH27B_USE_HIP=ON-DDFLASH27B_GPU_BACKEND=hip(这个 flag 不存在了)-DCMAKE_HIP_ARCHITECTURES="gfx1100"-DDFLASH27B_HIP_ARCHITECTURES="gfx1100"-DROCM_PATH=/opt/rocm-7.2.0改为环境变量 export ROCM_PATH=/opt/rocm(不是 cmake 参数)cd dflashcd server(目录从dflash/重命名为server/,PR #281)--target test_dflash应加上 dflash_server删掉 src/prefix_cache.cpp不需要手改 cmake 了 没提 -DDFLASH27B_FA_ALL_QUANTS新选项 总结变化原因:PR #281 把
dflash/重命名为server/,同时 CMake 选项也做了重整(DFLASH27B_USE_HIP→DFLASH27B_GPU_BACKEND=hip)。博客写的时候还是旧版本。 -
技嘉Z890主板 256G DDR5内存 两张Pro6000 96G 跑cpp Qwen3.6 27B BF16与同时双ComfyUI工作流长视频之运行
只怪我荷包太浅... -
技嘉Z890主板 256G DDR5内存 两张Pro6000 96G 跑cpp Qwen3.6 27B BF16与同时双ComfyUI工作流长视频之运行@566656661 问了下 whichllm, 它也推荐 qwen3.6-27b, 这个模型真能打呀

-
技嘉Z890主板 256G DDR5内存 两张Pro6000 96G 跑cpp Qwen3.6 27B BF16与同时双ComfyUI工作流长视频之运行@b9704037 有一个问题请教下: 在某一个 VRAM 尺寸限制下, 是选用参数量大的模型, 还是选用量化精度高的模型, 效果更好? 其实我的问题就是, 你的配置有足够的 vram, 为什么还停留在 27B 的模型? 谢谢
-
实测Hermes + Qwen3.6 27B 使用Qwen-Fixed-Chat-Templates大幅提高缓存命中率 -
AI生成了一个LLM GPU显存计算器github上有个类似的项目: https://github.com/Andyyyy64/whichllm
-
笔记本上跑了一下gemma 4 12B ,还凑合@张老师 嗯, 本地qwen3.6可以的. 由于是 skill 调用, 前提是跑 hermes 的机器能够访问 url 指向的网站.
-
笔记本上跑了一下gemma 4 12B ,还凑合@张老师 Agent 的 skills 可以帮忙扒视频的字幕, 算是代替 ASR 吧. hermes 就可以, 直接把 url 贴给它, 它调用相应的 skill 获取字幕, 然后再分析...
-
Hermes Desktop 桌面版快速上手指南@5ccccc 打开 cmd 敲 hermes update 先升一下级试试? 我早上升级到了 (+32)
目前好像没碰到这个问题. -
Hermes Desktop 桌面版快速上手指南喊 deepseek-v4-pro 给 hermes 画了一个图, 和它来来回回讨论/修改了半天, 也不知对错:


