至少运行Q6 最好Q8 模型,找支持MTP的模型,速度翻倍
-
双AI Pro R9700 32g,Qwen 3.6 27b q4 KM q8 KV Ubuntu24 Hermes agent -
3080 20g 千问 3.6 27bq4 k m llama 跑Hermes配置 实在搞不定 折腾2天了换IQ4_xs版,可以节省显存,上下文能开到120以上 KV-Q4_0 压缩后
-
3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑换成 IQ4-XS就能开到256K上下文了,智商影响不大,个别版本跟K M 参数非常接近
-
山寨X99主板,32G DDR3内存,两张5060TI 16G llama.cpp Qwen3.6 27B NVFP4版 40-70T/S 现在够用未来会更好。模型的部署用跑在deepseek下的Hermes agent 自动安装部署的,直接把模型网页扔给他,让他学习参考抄作业。
-
山寨X99主板,32G DDR3内存,两张5060TI 16G llama.cpp Qwen3.6 27B NVFP4版 40-70T/S 现在够用未来会更好。

#!/bin/bash
export LD_LIBRARY_PATH=/home/qwe/llama.cpp/build/bin:$LD_LIBRARY_PATHMODEL=/home/qwe/models/Huihui-Qwen3.6-27B-abliterated-NVFP4-MTP.gguf
PORT=8081
LLAMA_SERVER=/home/qwe/llama.cpp/build/bin/llama-serverexec "$LLAMA_SERVER"
--n-predict 16384
--fit off
--split-mode tensor --tensor-split 1,1
--device CUDA0,CUDA1
-m "$MODEL"
--host 0.0.0.0 --port "$PORT"
-t 0 -ngl 99 -np 1
--no-mmap
--kv-unified --flash-attn on --ctx-size 160000
--spec-type draft-mtp --spec-draft-n-max 2
--repeat-penalty 1.1
--min-p 0.02
--temp 0.6 --top-k 20 --top-p 0.95 -
7900xtx到底怎麼搞?搞四個小時了最省心的方案,就是先装一个hermes agent用在线的deepseek flash即可,让agent给你部署,省心省事,告诉他服务器地址,用户名,密码,他自己就能搞定。你现在的困境大部分困在科学上网上。
-
一台迷你主机+几台服务器配置两片5060TI 16G 跑QWEN3.6 27B ,在你闲置服务器上能跑50-70T/S,费用7000以下,未来的趋势,NVFP4支持会越来越多,不可挡的趋势。现在能用,未来更好。另一台如果跑COMFYUI,可以买3080魔改20G 过度,或7900XTX 24G有点超预算。也可以3080魔改跑大模型,用IQ4_XS模型,开MTP能跑50T/S左右,再加一个7900XTX跑ComfyUI也行。
-
(双卡指南) 最丐 Qwen3.6-27b - 3000 元双 RTX 3060 - 50t/s抄作业,两张5060TI-16G,稳定在57t/s,缺点上下文不能压缩,Q4的大模型只能跑200K上下文,加上上下文压缩不能正常启动大模型!
。


-
下单 7900xtx, 开始折腾 llama.cpp说人家贵的大哥好好看看,人家带电源的,一个1200W的金牌电源多钱
-
分享自己的經驗 # 7900 XTX 本地 LLM 優化實測報告(Qwen3.6-27B)
7900xtx 32G X99 大概40-50t/s -
跑27b模型购买设备请教iq4-xs 可以跑128K上下文 KV8压缩
-
3080 20g 購買問題我刚在淘宝买的3100左右带延保4年,搬的新板,涡轮卡提,40系列几乎全新的散热器,热量控制非常好,长沙那帮人干的,正在烤机