

M5 Max 128g 短会话MTP 38 token/s, claude code 长会话28 token/s,整体效果还可以啊。
I
im17me
@im17me
-
对 M5 MAX 跑本地大模型有点失望 -
3080 20G*2的有没有,来交流啊兄弟们你主板有我主板烂?Z390 ,我双卡3090 vLLM跑62token/s,单卡36token/s
-
RTX3080 20g,qwen3.6 27B 60-40T/S 本地爽玩配置@applejuice 你的3090加nvlink 有效果吗?能不能说一下提升情况
-
5090 + vLLM + Qwen3.6-27B 成功分享实测效果,模型Qwen3.6-27B-AWQ-INT4,5090还没有双卡3090跑的快。双卡3090稳定在60token/s
-
【求助】vLLM 单卡 3090 部署 Qwen3.6-27B-INT4,开启 MTP 投机采样触发无限复读(死循环)3090单卡跑llama.cpp,比vllm强。显存不够。3090单卡vllm极限配置。
vllm serve /home/ubuntu/models/Qwen3.6-27B-AWQ-INT4
--served-model-name Qwen3.6-27B-AWQ-INT4
--host 0.0.0.0
--port 8080
--gpu-memory-utilization 0.98
--max-model-len 40960
--max-num-seqs 4
--max-num-batched-tokens 4096
--kv-cache-dtype fp8
--quantization compressed-tensors -
求助各位大佬:3090 24G 显卡想搭一台稳定优先的单 U 服务器,麻烦帮忙看看配置方案要啥服务器主板,普通家用主板游戏都行。我用的8700K + Z390主板跑的,挺稳定的,7*24 小时运行。
-
软路由及内网穿透 - 请教各位老大国内有公网IP的只有电信了,但是需要加100元买动态公网IP地址,其他运营商都是内网,也不能买。
-
用3090如果只跑llm, 平均一个月用多少kwh 的电?好像比订阅的费用还要贵按350w算,大概一天5度电左右