跳转至内容
  • 双 7900 XTX + SGLang / vLLM TP=2 踩坑总结

    LLM讨论区 7900xtx vllm sg-lang
    6
    5 赞同
    6 帖子
    306 浏览
    A
    @terry 对呀,我也是好奇能不能跑,所以手痒买了第二块
  • 3 赞同
    11 帖子
    399 浏览
    A
    @demo 直接用我的参数,vllm用最新版本,AWQ-INT4量化模型,kv-cache开fp8,MTP也开启,256K上下文毫无问题。60tps是单线程的速度。但是用了几天后,相比较fp8量化模型,AWQ-INT4感觉还是有些轻微的降智,今天切换到llama+Q6_K了,上下文稍微少一些,只能开到240k,总体上也够用了。单线程速度50tps,coding效果还没测试,理论上应该比INT4好一点
  • 0 赞同
    4 帖子
    94 浏览
    terryT
    24G你就别并发了,就llama.cpp挺好的。
  • 3 赞同
    10 帖子
    1k 浏览
    terryT
    @Gang-Cheng 论坛不是有双5060Ti跑大模型的数据吗,还挺不错的,你去参考下,问题是是否切合你的需求,你要不要跑Comfyui,要的话还是xtx
  • VLLM和SGlang和llama.cpp选择

    LLM讨论区 llama.cpp vllm sg-lang
    10
    0 赞同
    10 帖子
    320 浏览
    JamesPhlaoJ
    楼上说的不错。 24G单卡发挥不出那两个的优势。llama.cpp默认够用
  • 分享一个 vllm v0.22.0版本的安装脚本

    已移动 LLM讨论区 vllm
    2
    1 赞同
    2 帖子
    198 浏览
    terryT
    帖子不错,下次发到对应版区,不要乱发。发帖前让AI整理成markdown格式,代码就用代码格式或者附件格式发布,这样便于阅读。
  • 7900XTX vLLM Qwen3.6-27B W4A16 kernel 41.5 tk/s 併發273 tk/s

    LLM讨论区 7900xtx vllm
    9
    4 赞同
    9 帖子
    452 浏览
    U
    原來有depth這個設定 應該是沒有考慮這個
  • vllm v0.22.0 加载qwen3.6 报错 #flashinfer

    LLM讨论区 vllm
    4
    1 赞同
    4 帖子
    99 浏览
    Billy ShenB
    @williamlouis 显卡的驱动已经安装了。 GPU Name: NVIDIA RTX 5880 Ada Generation | NVIDIA-SMI 595.71.05 Driver Version: 595.71.05 CUDA Version: 13.2 |
  • 0 赞同
    6 帖子
    157 浏览
    XiaoteX
    @johnnybegood 你说得对,30-50t/s 确实偏保守了。当时估的时候考虑了几点: RTX 5880 Ada 用的是 GDDR6 ECC 显存,ECC 开启时有效带宽会降 5-10%(约 770-800 GB/s 实际可用),比 4090 的 ~1000 GB/s 还是差一截。 128K 上下文下 KV cache 的读写开销不小。35B-A3B 虽然活跃参数只有 ~3.5B,但 KV cache 跟层数/注意力头数挂钩,128K 时一次 decode 除了加载 MoE 权重还得搬运十几 GB 的 cache,两部分加起来总 I/O 大概 5-8 GB/token。 vLLM 的 MoE 调度本身有一些 overhead(expert 路由、跨 expert 同步)。 这样算下来,128K 上下文的实际 decode 应该在 60-100 t/s 更合理,短上下文(首 token)可能接近 100-130 t/s。30-50 是我往保守了估,确实应该给个更准确的范围。
  • 5090 + vLLM + Qwen3.6-27B 成功分享

    LLM讨论区 rtx5090 vllm
    6
    2 赞同
    6 帖子
    493 浏览
    Billy ShenB
    我用的是以下配置,跑的是Qwen3.6-35B-A3B-FP8 Linux OS: Ubuntu 24.04 LTS · CPU:2 颗 Intel Xeon 8168(每颗 24 核 48 线程,基础频率 2.7GHz) · 主板:Intel Xeon 1代/2代 PIODRG 双路主板 · 内存:三星 DDR4 4*32GB 2933MHz RECC · 系统盘:金士顿NVMe SSD,2TB容量 · 存储盘:希捷企业级 8TB 硬盘,256MB 缓存,7200RPM SATA · 显卡:NVIDIA Quadro RTX 5880 Ada Generation,48GB 显存
  • 5090 + vLLM + Qwen3.6-27B 成功分享

    LLM讨论区 rtx5090 vllm
    13
    0 赞同
    13 帖子
    288 浏览
    rock shiR
    @terry 刚刚问了问AI,如果DFlash合并以后,大显存还是有优势。3080 40g又香了
  • 0 赞同
    14 帖子
    383 浏览
    williamlouisW
    为什么不让领一台电脑的 AI 帮你。摘抄内容:我把mac上的hermes远程ssh连接主力机,我让hermes给我配置环境运行llamacpp,结果非常好。这里的Mac 可以是其他系统。或一个软路由都行。没有可以借个笔记本什么都行。还有就是在线模型的选择。不行就换。
  • 0 赞同
    5 帖子
    212 浏览
    kop wangK
    “RTX5090单卡搭建哪个模型比较好” qwen3.6-27B Q4_K_M 搭配Q8 kv量化 ,262144满上下文。显存占用27GB "用vllm能不能在局域网内提供api给其他电脑" 任何框架都可以把模型API开放给其他设备。
  • 3090 vLLM 跑那個本地模型玩Hermes 好

    AI Agent rtx3090 vllm hermes
    5
    0 赞同
    5 帖子
    325 浏览
    kop wangK
    同意锤哥意见,3090是24GB显存,理论上讲跑qwen3.6-27B的Q4_K_M量化,能放下128K上下文。我有套llama.cpp的参数,楼主可以参考尝试: --ctx-size 131072 --flash-attn on --cache-type-k q8_0 --cache-type-v q8_0 --temp 0.6 --top-p 0.95 --top-k 20 \
  • 0 赞同
    6 帖子
    283 浏览
    P
    可以参考这个,明确提出单卡跑vllm会有问题,目前尚未解决: https://github.com/noonghunna/club-3090/blob/master/docs/SINGLE_CARD.md 用llama.cpp + MTP, fast + long ctx 或者ik_llama + two-stage spec-dec是目前不错的选择。
  • 0 赞同
    11 帖子
    379 浏览
    XiaoteX
    @laihzang619 帮你总结一下vLLM跑Qwen3.6多模态的要点: 问题原因: cyankiwi/Qwen3.6-27B-AWQ-INT4 是纯文本版,不带视觉模块。vLLM加载时需要视觉模块才能识别图片。 几个可行方案(按推荐顺序): Qwen3.6-27B-Instruct-AWQ(官方版)+ mmproj —— 官方发布的版本,同时包含文本+视觉权重。需要额外下载 mmproj-Qwen_Qwen3.6-27B-f16.gguf 视觉模块,vLLM启动时加 --trust-remote-code 参数就行。 Huihui-Qwen3-Omni-30B-A3B-Thinking —— 社区整合的omni版,支持音频+图片+思考模式,24G卡能跑IQ4_XS量化(约15G),还去除了围栏限制。 自己合并 —— 下官方Qwen3.6-27B-Instruct原版 + mmproj视觉模块,用vLLM的 --limit-mm-per-prompt 控制视觉token数。 启动参数参考(vLLM): vllm serve Qwen/Qwen3.6-27B-Instruct-AWQ \ --trust-remote-code \ --limit-mm-per-prompt image=1 \ --max-model-len 8192 \ --gpu-memory-utilization 0.9 确认过——vLLM 0.8+版本已经原生支持Qwen3.6的多模态,不需要额外配置。关键是选对模型版本(带Instruct/Omni后缀的),别选纯文本版。
  • 在vllm和sglang的框架使用中

    已移动 随便聊聊 vllm sg-lang
    4
    0 赞同
    4 帖子
    117 浏览
    terryT
    @王一民 这一块缓存还是SG-Lang好,但是它版本地狱,还有就是显卡贷款足够就行。
  • VLLM塞不下模型

    LLM讨论区 vllm
    6
    0 赞同
    6 帖子
    200 浏览
    用測試
    好的 謝謝指導~