🚀 Lucebox DFlash + Huihui：7900 XTX 上真·无审查 + 极速推理完全折腾纪实

kos or

現在真的人人都需要特助了
本人 + AI 特助

abaalei

@kos-or 对，按遥控指挥人做事的感觉真的会上瘾的，哈哈哈。我基本上是gpt3.0？一开始的时候用过一段时间，那时候觉得就那样。然后25年我爸cancer，开始重度使用gpt/grok来分析每15天的抽血报告，开始越来越觉得ai带来的增益比一开始要多了。然后26年2月开始白嫖gemini pro，用了2 个月越来越离不开了，后面就尝试在自己的truenas上面配置了hermesagent，然后就一发不可收拾了，现在都玩起双卡流了，最可惜的是当年矿潮的时候12000买的3080ti，至今都不能改24g显存，不然7900xtx主力做LLM，3080ti跑comfyui就完美了，哎，可惜呀

williamlouis

@abaalei 回复下问题：卡默认卡在 low（516MHz），那确实需要 sudo tee 调一下。不是卡的问题。我设置了功耗墙。整机的功耗在不工作的状态卡死在75W了。所以才有默认是 516MHz。需要的人可以试试。工作的状态需要命令行调整到 high。调整命令在我的折腾帖中。手打太长，自己去看吧。

kos or

@abaalei 说:

grok

希望您父親現在一切安好

Grok 能接API嗎 ? Musk的礦機廠都出租讓Anthropic用了
之前用Grok 試了幾次性感圖蠻漂亮的但是又歪歪的

我也是雙卡流～有空可以交流一下
那天我讓Hermes 在GPU0 and GPU1 同時安裝了 Gemma-4-12B-MTP
效果不錯但是工作流還是要繼續研究
目前卡PCIe 一卡只有1GB/s的速度 , 另一卡是32GB/s 無法玩TP 張量並行

因為新的礦機架到了, 之後可能會有第三卡但好像無法3卡 TP

abaalei

@kos-or 感谢，不过他去年就走了

grok可以的，我现在是通过cliproxy api来oauth登陆了x之后，再反代出来给hermes用
因为我现在在用的主板也是矿板，现在还空出来了2根x16的全场插槽（这块板一共6槽，4x16 2x8），所以在心痒痒要不要多搞2张v100/16g 或者mi50/16g回来折腾，哈哈哈

卡1只有1GB/s是主板问题吗？

cab0d02d-034a-43ec-a90a-f00022b176a8-da48b96c858dc4624ce09d399fa014d.jpg

abaalei

@williamlouis 那就难怪拉，我现在3080ti待机35w+7900xtx待机20w，还没算外围电路、损耗、cpu、内存，加起来估计150~200w也是有的

williamlouis

@abaalei 功耗墙不能直接设置最低。容易直接灭火。你可以让 AI 给你算一个值。建议中庸一点。差不多就行了。富裕点跑最稳定的。

kos or

我就是用這一張挖礦用的 GPU 轉接卡 USB cable 通訊頻寬受限吧
上面寫著PCIe 1.0 to 16 所以才會這麼慢
不過我弄了一張主板有 6 slots x 32GB/s 應該夠應付跨卡需求了

kos or

@abaalei 说:

现在还空出来了2根x16的全场插槽（这块板一共6槽，4x16 2x8），所以在心痒痒要不要多搞2张v100/16g 或者mi50/16g回来折腾，哈哈哈

你這是標準AI Sever 主板嗎?

你先確定工作流才下手要不然不同型號的顯卡要做 PP/TP 會有一定的複雜度
快的卡會被慢的顯卡拖累

除非你每一張卡都跑一個LLM 大語言模型這倒是可行

abaalei

@kos-or 这是x1的，我手上都还有几张，现在就只有拿来当2.5g网卡延长线的作用了（我truenas的机箱太小了，塞了2张hba卡就塞不下网卡了），大佬买了啥板子？什么价格？

abaalei

@kos-or 不是，我这是矿板，对的，所以现在忍住不买，怎么想都跟我原始诉求不符合，单纯的只是想折腾而已。mi50+7900xtx跨卡跑，吐字大概只有10t/s

kos or

@abaalei 你跑什麼模型吐字10 t/s ?

我AI小白～～～我用這張網紅推薦的

技嘉MC62-G40工作站台式机电脑主板PCIE4.0六卡GPU渲染AI计算

kos or

@abaalei 说:

怎么想都跟我原始诉求不符合，单纯的只是想折腾而已。mi50+7900xtx跨卡跑，吐字大概只有10t/s

我目前的理解是
硬體儘量有一致性否則你多卡型號都不一樣
讓AI也很難設定它可能會弄錯你也會被搞混,
Drivers 版本一堆有的支持有的不支持感覺會常常撞牆或一直卡在硬體調整
會浪費很多tokens 金錢和時間

abaalei

@kos-or 哇塞，好东西！mark下来了，以后捡垃圾就搞一张！！！

abaalei

@kos-or 对的，还好我今天开始gemini的cool down结束，又可以站起来用力蹬了！！

kos or

請問真无审查 /越獄模型有什麼特色適合讓Hermes 使用嗎？
感覺像是很衝動不聽話的大語言模型？

kos or

@abaalei 你不是還有一張雙CPU主板還沒使用？這麼多機器設備～～～

AGI

@kos-or 搜索下grok2api，我就这么用的，网上有人分享sso，我导入了几百个，能用，但是不稳定，我就是推动hermes的，和deepseek flash轮流使用

abaalei

更新一下昨晚的调参

分享一下针对单卡 7900 XTX 跑 Qwen3.6-27B（DFlash 投机推理）的最新极限调优成果！昨晚经过反复压榨，成功把生成速度推上了新高峰：

7900 XTX 单卡 DFlash 实测成绩：

平均生成速度 (Decode MEAN)： 84.47 tok/s（在 HumanEval 10-prompt 串行高压测试下跑出，单题峰值突破 108.05 tok/s）
平均投机接受长度 (AL)：6.29（接受率约 40.8%）

️ 终极黄金启动参数：

bash
python3 scripts/server.py
--target '/mnt/models/Qwen3.6/Huihui-Qwen3.6-27B-abliterated.Q4_K_M.gguf'
--draft models/dflash-draft-3.6-q8_0.gguf
--budget 8
--max-ctx 32768
--fa-window 0
--cache-type-k q8_0
--cache-type-v q8_0
--no-mmap
--tensor-split 0
--tokenizer Qwen/Qwen3.6-27B

核心调优心得（无痛白嫖 4% 速度的秘密）：

压榨 KV Cache 带宽（关键！）：显式加上 --cache-type-k q8_0 和 --cache-type-v q8_0 后，虽然在 GPU 内部多了一步反量化计算，但由于量化让 KV 缓存的数据量直接减半，极大地缓解了 RDNA3 架构在投机树匹配时的显存带宽压力。实测速度从默认 F16 状态下的 81.19 tok/s 直接飙升到了 84.47 tok/s！而且在 32K 极限上下文下能省下一半的 KV 显存，极大幅度降低了 OOM 的风险！
配合 --no-mmap：在 Linux 原生 ROCm 驱动下，关闭内存映射可以避免文件 I/O 阻塞首字加载，对于首字延迟（Prefill）有可见的加载优化。
配合 --tensor-split 0：强制绑定单卡槽位算子，防止并发时发生莫名其妙的 CPU 回退（Fallback）。

abaalei

@kos-or 对的，那块双路板是拿来备用的，毕竟华强北的东西不确定能用多久。哈哈，我说捡垃圾价格是降到千元内了，目前这边还要卖3000多，等到跌到千元内估计是ddr6 ddr7的时代了

抡锤者

🚀 Lucebox DFlash + Huihui：7900 XTX 上真·无审查 + 极速推理完全折腾纪实

7900 XTX 单卡 DFlash 实测成绩：

️ 终极黄金启动参数：

核心调优心得（无痛白嫖 4% 速度的秘密）：