-
Ubuntu + X99 雙 PCIe 3.0 x16,想上 2× AMD Radeon AI PRO R9700 32GB 跑 ComfyUI / MiniMax H3(Ref2VA),請教可行性與坑位 -
大型纪录片:Qwen 3.8 27B 优化思考-> 拯救工具调用 【欢迎指正】@iamvirus 我已经在在抄大佬的作业,准备在我本机尝试了。
等我当前的任务跑完,我验证以下结果,来交作业

-
Qwen3.8-27B 量化全格式橫評:從 IQ2_XXS 到 Q6_K,14 種格式誰才是甜點? -
RTX PRO 4500 32G 跑 Qwen3.8-27B:Unsloth Desktop 默认参数 + MTP,2 槽位 × 150K,短上下文 54–64 t/s(GSP 篇续集,附完整配置)请教大神,为什么选择Qwen3.8-27B/Qwen3.8-27B-UD-Q4_K_XL.gguf,而不是Qwen3.8-27B-UD-Q4_K_M.gguf?
我问了Deepseek,都是推荐用Qwen3.8-27B-UD-Q4_K_M.gguf -
llama.cpp应该及时更新版本和调整参数了😄
有哪位大神可以指点一下,就改这么一个小bug,结果跑了49分5s。
webui前端已经设置成medium了
-
llama.cpp应该及时更新版本和调整参数了😄上午一个长任务直接卡死了,很郁闷,然后开始研究怎么搞。
最后决定升级
llama.cpp的版本,使用官方编译版本:llama-b10534-bin-win-cuda-13.3-x64同时重新调整
llama-server的启动参数。llama-server 启动参数
--reasoning off ^ --n-gpu-layers -1 ^ --ctx-size 196608 ^ --flash-attn on ^ --cache-type-k q4_0 ^ --cache-type-v q4_0 ^ --spec-type draft-mtp ^ --spec-draft-n-max 2 ^ --spec-draft-n-min 1 ^ --temp 0.7 ^ --parallel 1 ^ --kv-unified ^ --load-mode mlock ^ --jinja ^ --no-warmup先上效果截图

与之前的配置比较
这次主要做了三个调整:
-
上下文长度从 128K 增加到 192K。
-
移除了
--batch-size 4096和--ubatch-size 2048两个参数,直接交给llama-server自己处理。不删除它们的话,跑推理时会加载 CPU 和内存,速度暴跌。 -
--spec-draft-n-max从 3 改成 2,实际使用下来,命中率和推理速度都有稍许增加。
-
-
【求助】关注论坛3个月,没有搞定3090 单卡qwen3.6/3.8 27b模型的生产力部署。求抄作业。说3090+qwen3.8-27b_q4_k_m成不了生产力的,我不想吐槽了、反正我是够用了。
想吐槽的是,qwen3.8-27b的thinking真的是默认太高了,我是在Hermes中设置成medium后,才感觉速度上能和qwen3.6-27b持平。
-
【求助】关注论坛3个月,没有搞定3090 单卡qwen3.6/3.8 27b模型的生产力部署。求抄作业。启动脚本【
REM 仅使用第一张 GPU (RTX 3090 Ti)
set CUDA_VISIBLE_DEVICES=0set SERVER_PATH=.\llama-server.exe
REM 设置模型路径:若提供了第一个参数则使用该参数,否则使用默认路径
if "%~1"=="" (
set MODEL_PATH=D:\MyModels\Qwen3.8-27B\Qwen3.8-27B-Q4_K_M.gguf
echo 未提供模型路径,使用默认路径: %MODEL_PATH%
) else (
set MODEL_PATH=%~1
echo 使用指定的模型路径: %MODEL_PATH%
)"%SERVER_PATH%" ^
-m "%MODEL_PATH%" ^
--host 0.0.0.0 ^
--port 3527 ^
--reasoning off ^
--n-gpu-layers -1 ^
--ctx-size 131072 ^
--batch-size 4096^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
--spec-type draft-mtp ^
--spec-draft-n-max 5 ^
--spec-draft-n-min 1 ^
--temp 0.7 ^
--parallel 1 ^
--kv-unified ^
--mlock ^
--jinja ^
--threads 16 ^
--threads-batch 16 ^
--no-warmuppause
】

-
AMD R 9700 32G到货了。一顿操作。整成无头算力卡了。经实测这卡更适合工作在X99主板。家用老机器升级慎重考虑。@williamlouis
请问华南金牌X99-CD4的板U洋垃圾与这张A卡兼容吗? -
4090 48g 维修经历@applejuice 5090也一样的没有保修,只能去京东自营
-
Qwen3.8-27B-FP8吃上了,接入Deepseek Harness使用补充下llama-server的启动参数:
--reasoning off ^
--n-gpu-layers -1 ^
--ctx-size 143360 ^
--batch-size 4096^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
--spec-type draft-mtp ^
--spec-draft-n-max 3 ^
--spec-draft-n-min 1 ^
--temp 0.7 ^
--parallel 1 ^
--kv-unified ^
--mlock ^
--jinja ^
--threads 16 ^
--threads-batch 16 ^
--no-warmup显卡占用:

-
Qwen3.8-27B-FP8吃上了,接入Deepseek Harness使用单卡3090Ti,windows10操作系统llama-server加载unsloth的Qwen3.8-27B-Q4_K_M.gguf,
今天早上开始执行一些长任务,感觉速度有下降:

但是在llama-server自带的对话框中,速度还是不错的:

-
DeepSeek涨价?在线AI模型性价比盘点,HY3和小米MiMO API不错。GPT Plus订阅套餐很划算!字节跳动杀猪盘,Gemini变傻了~@rock-shi 对于我来说,本地的qwen3.6-27b勉强够用了,但是架不住本地搞不定的时候不得不走在线API。
还是穷,舍不得花钱,从投入产出比来说,我现在是纯亏状态。
周一开始搞了一个nvidia api免费掉Minimax M3,限制调用频率,能力还是很不错的。
第一天用的时候搞太猛了,结果到下午429了

-
DeepSeek涨价?在线AI模型性价比盘点,HY3和小米MiMO API不错。GPT Plus订阅套餐很划算!字节跳动杀猪盘,Gemini变傻了~@rock-shi 小参数模型替代全尺寸模型基本上是不现实的。
我觉得能在自己的应用场景下,成功完成任务才是关键。 -
DeepSeek涨价?在线AI模型性价比盘点,HY3和小米MiMO API不错。GPT Plus订阅套餐很划算!字节跳动杀猪盘,Gemini变傻了~锤哥,Deepseek涨价幅度已经落地:

您作为深度用户聊聊呗?
我是暂时转到走nvidia api调用minimax m3了。
对了还有这次开源的Deepseek harness是否也能做做测评呢

-
RTX3090单卡 24G继续狂奔,测一个9天前发布的2比特 12G 千问3.6-35B模型(160K,F16 KV CACHE?) -
QWEN 3.8 27B 暂定 今晚(8-14) 23点已经是周三下午的16:30了,不知道是否已经开源
-
CMP 170HX显卡到底怎么样? -
求教,4080super魔改32gb显卡,只能用NVIDIA Studio 581.42驱动吗?不能用新驱动?@king 我24G是不够用的,勉强塞下qwen3.6-27B-Q4,多模态只能丢给另外的卡。现在有微调模型的需求,还在纠结怎么选……
建议先捋一捋应用场景在估算显存需求
-
CMP 170HX显卡到底怎么样?看到不少帖子退CMP 170HX这张卡,说8G可以解锁到64g、10g可以解锁到80g
咸鱼上CMP 170HX已经解锁80g的卡卖8000人民币。
有大神了解这张卡吗?我想用来微调模型,不知道是否可用……