再补充一点啊! 150k 60t/s 其实是不可能的啊!超过90k以后降速,130k以后就只有几个token/s了。但是 不死机,能抗一阵子就缓过来了。
wwcd2016
-
请教一下QWEN 3.8 27B GGUF和llama.cpp框架的选择 -
二张3090通过nvlink跑大模型,有人尝试过吗?4090 +3090 最优解 (次优,4090+7900xtx) (最次2*3090 能用不好用。使用场景受限,但合理配置+折腾,也能爽玩。我准备上第二个3090 )
为什么?
2个4090 不合适太贵。 -
随手记录:Qwen3.8:27b vs Qwen3.6:27b 实测对比 🧪
唉,不知道怎么搞了我的结论以下。单卡3090 24g不适合干很重的活,而轻量的不如走api。
老特也推荐,跑图文必须自己搞。llm 买api合适。 -
缓存命中99%确实厉害- X99-R9700,Qwen-3.8-27b-越狱模型我怎么也没有解决qwen3.8容易卡循环的问题。而3.6从来没有碰到过。
-
【求助】关注论坛3个月,没有搞定3090 单卡qwen3.6/3.8 27b模型的生产力部署。求抄作业。 -
【求助】关注论坛3个月,没有搞定3090 单卡qwen3.6/3.8 27b模型的生产力部署。求抄作业。如题:3090单卡 32G ubuntu 华南金牌 硬件抄作业的。
目前干活都是deepseek 驱动hermes 。
部署过至少10个 llm ,论坛作业都抄了。
但是和deepseek完全无法比。根本无法像老特说的,可以替代。
现在qwen3.8也发布了。
希望论坛能人贴出自己的满意的启动参数。 -
开发P2P大模型的可能性我高中生的儿子都比你思维清晰。
他说:向量空间张开,理论上最终落实再显存上都是一维数组。你怎么去切数组后面的数字呢? -
7900XTX+Qwen 3.8 27B Q4 + DeepSeek Harness 实测日常改个程序,驱动hermes ,还是qwen35b的那种更丝滑。
-
7900XTX+Qwen 3.8 27B Q4 + DeepSeek Harness 实测这玩意直接下载。然后把模型名字一改。跑起来 和原来的3.6 没有感觉有变化。
-
关于克服Minimax H3远景画质崩坏等一些使用技巧@imbiplaza-ASUS 你才是做事的主。一次性能把业务固定。同样的业务就排队处理。比用hermes来回对话省心很多。能不能分享制作思路?谢谢!
-
sglang 05.16 历史性性能升级perfill 直冲3500+看来sg-lang满足了企业级别的应用,4090 有48g勉强为多人服务了。主要是填充快太多了!
-
想请问各位大神关于VRAM共用的问题,comfyUI + llamacpp 想共用一张3090@botio-kuo 你直接告诉 hermes 。我需要配置一个辅助的deepseek-falsh模型。apikey是****。 让他自己改 config.yaml 。
当然,你先的备份好
当然,你干脆把config.yaml 贴给网页 的deepseek 。让他把deppsek改为辅助模型。 它可能考虑比你 的本地模型更加细致。
总之都能改好,
万一没弄好。备份 的覆盖一下,重启,再来。直到搞好。
我的大概也是这么搞好的。
全程你只管测试 -
想请问各位大神关于VRAM共用的问题,comfyUI + llamacpp 想共用一张3090我跟你一个情况。3090 单卡,默认启动就是llama 。驱动了 hermes。 obsidian。 wiki。 把事情干完了
晚上没事想玩玩comfyui ,就对hermes 说,打开comfyui就好了。会帮你配置好的。关键配置是:你把deepseek作为辅助模型就好了。主模型随便关,随便切换。
我自己有至少5个模型常用的,也是让hermes 随意切换。让它做好脚本保存好。总之:你的业务如果不冲突:就是说大批量调用llama 的时候也必须用 comfyui。
一张卡挺好用的。 -
Qwen3.6 27b & DeepSeek V4 Flash跑Hermes 资料截图,生成网页。好吧。周末没事,让hermes 配置你说的,一模一样复刻,然后最简单的 脚本修改,都出错,当然,他会自己修复。但是:
目前最原始的,5月份的qwen 3.6 27b 4bit量化版,除了速度只有30-40之间,从来没有出这么低级错误。贴一下000
╭─
Hermes ───────────────────────────────────────────────────────────────────────────────────────────────────────────╮
等等,第17行 \\ 变成四个反斜杠了!VBS 里字符串里的 \ 才代表一个 \。现在写成了 \\,路径会变成 C:\Users\...(双反斜杠),Windows 可能找不到。让我修正:╰──────────────────────────────────────────────────────────────────────────────────────────────────────────────────────╯
┊
preparing patch…
┊
patch C:\Users\46049\AppData\Local\hermes\gateway-service\Hermes_Gateway.vbs 0.7s
┊ review diff
a/C:\Users\46049\AppData\Local\hermes\gateway-service\Hermes_Gateway.vbs → b/C:\Users\46049\AppData\Local\hermes\gateway-service\Hermes_Gateway.vbs
@@ -14,4 +14,4 @@
env.Item("PYTHONPATH") = "C:\Users\46049\AppData\Local\hermes\hermes-agent;C:\Users\46049\AppData\Local\hermes\hermes-agent\venv\Lib\site-packages"
End If
sh.CurrentDirectory = "C:\Users\46049\AppData\Local\hermes"
-sh.Run "C:\Users\46049\AppData\Local\hermes\hermes-agent\venv\Scripts\pythonw.exe -m hermes_cli.main gateway run", 0, False
+sh.Run "C:\Users\46049\AppData\Local\hermes\hermes-agent\venv\Scripts\pythonw.exe -m hermes_cli.main gateway run", 0, False
┊
preparing read_file…
┊
read Hermes_Gateway.vbs 0.4s╭─
Hermes ───────────────────────────────────────────────────────────────────────────────────────────────────────────╮
好,第17行现在是正确的 VBS 语法:sh.Run "C:\Users\46049\AppData\Local\hermes\hermes-agent\venv\Scripts\pythonw.exe -m hermes_cli.main gateway run", 0, False现在测试一下完整的启动链: -
大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?@fcme 求你的具体模型名,启动参数。麻烦你了。我是觉得35b速度快,但是编程全是乱的。我主要是用来做qmt量化。
-
大伙儿对最近Reddit LocalLLM社区中很火的Ternary Bonsai 27B怎么看?qwen 3.6 27b 稳定性好。速度还行。
跟着论坛用了3090 长上下文的。148k 稳定驱动 hermes 。没有问题。
但vison 模式 只有50k上下文,目前还没有解。 -
RTX 3090 24G 最佳 27B模型? 测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF总之。3090 24g单卡 。hermes 能用的方案我都试验过了。基本不完美。
-
26-06-22:极限压榨:RTX 3090 24G(真正中质量长上下文 168K 达成)@wwcd2016 hermes 4.3 好像是为了调度工具 特意搞的
但是我3090 在llama 跑只有20t/s prefill 只有400而且只是文字模型
所以没再尝试了希望有大佬测试
------------------||
我收回我的预测。今天没事。测试了 这个帖子的部署》
同样是用hermes 把文章给他。在deepseek的api驱动hermes把模型搞定了。
然后切换到这个本地模型,还真的能干活了。
-
26-06-22:极限压榨:RTX 3090 24G(真正中质量长上下文 168K 达成)我围观。表示int6 做了mtp头仍然会严重降低智商。出错概率大。编程别想了。
我的需求就是,找到一个本地显卡,驱动hermes干活管理系统。驱动codex 自动完成复杂任务。
但是3090 我表示放弃。
最低入门4080s魔改32g
舒适4090魔改48g
——
或者各位大佬,有没有人能推翻lcz的论点:qwen3.6 27b是当前综合第一。
我不要综合第一,我要能干活。不出错就好了。
—— -
疯了,ai能看懂半截中国字。还能读懂情绪