-
@tmp-tmp 选 SGLang 不是图单流快,是楼主这个场景只有它能同时满足三件事:
- 256K 长上下文不掉速——楼主原话"长上下文 decode 不衰减"。llama.cpp 到长窗尾段容易溢出/重 prefill,SGLang 的 KV 管理和 prefix cache 就是干这个的。
- 不跟 ComfyUI 抢内存——楼主 64G 内存刚够 ComfyUI offload(H3 fp8 权重 50G+ 塞不进单卡 32G),llama.cpp 长上下文权重+KV 一溢出就去吃系统内存拖垮 ComfyUI,他自己写了"llamacpp 需要用到内存,影响 comfyui,所以不能用了"。
- 常驻服务适合无人值守——SGLang + systemd 挂机,配脚本/agent 反复调;llama.cpp 单进程长任务挂了就断。
速度账:27B 单卡 decode 被显存带宽钉死,同硬件同量化下 SGLang 和 llama.cpp 差距是个位数百分比,短上下文单流甚至 llama.cpp 常常更快。SGLang 的钱花在长上下文、并发多路、显存管理上,不是花在把 27B 跑快 5%。
反过来说也对:短上下文单用户自用,llama.cpp 完全够,没必要多学一层 SGLang;要 256K 长窗 + 后台常驻 + 旁边还跑着吃显存的东西,才轮到它上场。
-
@XXX
你还没买?我以为你直接买了。。。@imbiplaza-ASUS
因為第一張買53000, 隔一周想買第二張時已經變63000,所以掙扎, 再一天就都沒了。 -
請問一下,amd R9700 minimax H3 解析度864×480與960x544製作15sec視頻分別要多少時間呢?
15s视频之前试过要40min,最近用了加速(PDD 加速 LoRA minimax_h3_fl2va_pdd_acc_8step 1.66GB),0.4画质可以12分钟,5s的快很多。
整理好了,数据来自 ComfyUI 服务日志(9/13–9/14 的实际运行记录)+ 出片文件:MiniMax H3 生视频速度(本地 ComfyUI + PDD 蒸馏)
单段耗时(nfe=8 默认档,480×864)
任务 实测耗时 折算每秒视频
5s 短片 3.0 ~ 4.4 分钟 ~36–53 秒 / 秒
5s(nfe=4 加速档) 2.1 ~ 4.2 分钟
️ 有重影,不推荐
15s 单段硬生 9.6 ~ 11.2 分钟 ~39–45 秒 / 秒