跳转至内容
  • 新手双卡r9700 ai pro交作业

    AI硬件 r9700 多卡部署
    11
    2 赞同
    11 帖子
    417 浏览
    Ali JiangA
    @exe127 没有n卡,等我弄一张4090 48g,到时候在比较一下
  • 1 赞同
    20 帖子
    454 浏览
    5
    @abaalei 最近gpt 5.5偷懶很嚴重 寫計劃的時候他沒把很多該有的設定都寫出來 搞到我自己的vLLM 27B經常撞板...
  • 双卡缝合怪 X99平台 P40+2080Ti的本地生产力平台

    LLM讨论区 x99 多卡部署
    8
    0 赞同
    8 帖子
    197 浏览
    Miemie YM
    缝合怪本地 LLM 折腾记:X99 + RTX 2080 Ti + Tesla P40 这台"缝合怪"是自己以前的老硬件东平西凑来的,记录一下踩过的坑和目前的状态,供有类似想法的朋友参考。 遇到的坑和痛点 1. X99 平台 + P40 的 BIOS 启动问题 X99 是个年代久远、脾气刁钻的平台。P40 作为纯计算卡,没有视频输出,但插上之后会被主板优先识别,导致系统启动时卡在 BIOS 画面,显示器一片黑。 最终解决方案是通过降低 P40 所在 PCIe 通道的启动优先级,强制 P40 晚于 2080 Ti 完成初始化,才彻底解决这个问题。过程中试了很多方法,这条路不太直观,网上资料也零散。 2. 温度与噪音 目前是冬天,情况还算可控。但可以预见夏天会是另一番煎熬。 P40 原装被动散热,没有风扇,长时间推理温度会飙升。解决方案是拆下 Titan Xp 的涡轮风扇移植到 P40 上,引出风扇控制线接到主板风扇针脚,再通过软件 root 风扇控制逻辑,在管理面板里配置了基于温度的自动调速方案。目前运行稳定,但整机噪音在高负载下依然可观。 3. Qwen 3.6 35B A3B MoE 的稳定性问题 Qwen 3.6 35B A3B 是 MoE 架构,active 参数只有约 3.6B,输出速度快(实测约 41 tok/s decode),在缝合怪上跑起来性价比不错。 但跟同量级的 27B Dense 模型相比,它在长上下文下的 instruction following 稳定性较差,容易出现 thinking loop 和工具调用格式偏移。只要外部有足够强的约束框架(harness)控制任务边界和输出格式,用来做本地 agentic coding 还是完全可用的。没有约束的情况下,复杂任务的可靠性会明显下降。 4. 128k 上下文不够用 128k 的上下文窗口在单 session 多轮代码修改的场景下远远不够。一旦触发上下文压缩,prefill 阶段需要重新处理大量 token,100k 冷启动实测 TTFT 约 428 秒,压缩期间 decode 速度也会从正常的 41 tok/s 大幅下降。这段等待体验非常差,是目前整个方案最大的短板。 下一步打算 缝合怪作为过渡方案已经验证了本地 LLM 的可行性,但多卡异构带来的复杂度和性能瓶颈越来越明显。 目前倾向于等 Apple M5 Ultra。如果真的像传闻里的192GB 统一内存 + 约 1228 GB/s 内存带宽,可以直接跑 70B 以上的 Dense 模型而不需要多卡拼接,省去异构平台的所有麻烦。相比继续在 PC 平台上堆显卡,M5 Ultra 的性价比和可维护性更有吸引力。 当然如果近期有合适的显卡升级机会也不排除,但长期方向应该是统一内存架构。 硬件:X99 + RTX 2080 Ti 11GB + Tesla P40 24GB | 推理框架:llama.cpp build 9528 | 主力模型:Qwen 3.6 35B A3B MoE Q5
  • 3 赞同
    10 帖子
    1k 浏览
    terryT
    @Gang-Cheng 论坛不是有双5060Ti跑大模型的数据吗,还挺不错的,你去参考下,问题是是否切合你的需求,你要不要跑Comfyui,要的话还是xtx
  • 10 赞同
    28 帖子
    1k 浏览
    E
    @stakira 我看两三百块钱转换器吧,加上再买一张显卡2k出头就下来了
  • 双 3090(NVLink)跑 Qwen3.6-27B,128K 上下文实测

    AI硬件 nvidia rtx3090 多卡部署
    44
    3 赞同
    44 帖子
    2k 浏览
    E
    @applejuice 架子65,延长线贵延长线要¥69,30厘米的 nvlink是卖显卡那个二手店套餐送的
  • 4 X L20 部署本地模型 ,求大神指点

    LLM讨论区 nvidia l20 多卡部署
    19
    1 赞同
    19 帖子
    352 浏览
    Foster XuF
    GPU: 4× NVIDIA L20 (48GB each, Ada Lovelace, sm_89) CPU: 4× L20 = 192GB 总显存 (用了 33GB / 18%) RAM: 251GB 存储: /home 2.5TB 可用 驱动: NVIDIA 550.54.14 OS: CentOS 7.9 Model: Qwen3.6-27B-FP8 (基础架构 qwen3_5_text, hybrid GatedDeltaNet) 架构: 64 层, 5120 hidden, 24 attention heads, 4 KV heads 注意力: 16 × (3× GatedDeltaNet + 1× Gated Attention) (3:1 比例) MTP: 1 个 MTP 头 (multi-token prediction) 训练 ctx: 262,144 (256K) 量化: Q5_K_XL (Unsloth Dynamic 2.0) 文件: /home/models/qwen3-27b-mtp-gguf/Qwen3.6-27B-UD-Q5_K_XL.gguf 大小: 19.0 GB GGUF源: unsloth/Qwen3.6-27B-MTP-GGUF 主机 mkdir -p /tmp/llama-build/host-out cd /tmp/llama-build && git clone --depth 1 https://github.com/ggml-org/llama.cpp.git 构建脚本(必须放在源码树内,容器才能看到) cat > /tmp/llama-build/llama.cpp/build-wrapper.sh <<'EOF' #!/bin/bash exec >/tmp/build-out/build.log 2>&1 set -e apt-get update -qq apt-get install -y -qq cmake build-essential git ninja-build cd /src/llama.cpp rm -rf build cmake -B build -G Ninja -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release -DCMAKE_CUDA_ARCHITECTURES='89' -DGGML_NATIVE=OFF -DGGML_CUDA_F16=ON -DGGML_RPC=OFF -DBUILD_SHARED_LIBS=OFF cmake --build build -j$(nproc) --target llama-server llama-cli llama-quantize EOF chmod +x /tmp/llama-build/llama.cpp/build-wrapper.sh docker run -d --name llama-cpp-build -v /tmp/llama-build/llama.cpp:/src/llama.cpp -v /tmp/llama-build/host-out:/tmp/build-out -w /src/llama.cpp nvidia/cuda:12.4.0-devel-ubuntu22.04 bash /src/llama.cpp/build-wrapper.sh mkdir -p /home/models/qwen3-27b-mtp-gguf nohup bash -c ' curl -L --fail --retry 5 -o /home/models/qwen3-27b-mtp-gguf/Qwen3.6-27B-UD-Q5_K_XL.gguf "https://hf-mirror.com/unsloth/Qwen3.6-27B-MTP-GGUF/resolve/main/Qwen3.6-27B-UD-Q5_K_XL.gguf" ' > /tmp/gguf-dl.log 2>&1 & === 模型 === -m /models/Qwen3.6-27B-UD-Q5_K_XL.gguf === 服务 === --host 0.0.0.0 --port 8003 --api-key 7cd5aace-734d-4223-813c-2406506c4b0a === 上下文(256K 完整原生)=== -c 262144 -ngl 999 # 所有层上 GPU === 多 GPU 切分(2×L20)=== --split-mode layer # 按层切分 --tensor-split 0.5,0.5 # GPU 2+3 各 50% --main-gpu 0 # 主 GPU(相对 0 = 物理 GPU 2) === 并发 === --parallel 2 # 2 路并发 --kv-unified # ️ 关键:共享 KV 池 --cont-batching # 连续批处理 === KV 量化(节省 50% 显存)=== --cache-type-k q8_0 --cache-type-v q8_0 === MTP 投机解码(1.7-2× 加速)=== --spec-type draft-mtp # ️ 关键 --spec-draft-n-max 3 # 草稿 3 token --draft-p-min 0.85 # 接受阈值 === 性能优化 === --flash-attn auto # Flash Attention --no-mmap --mlock # 不 mmap,锁内存 --batch-size 512 --ubatch-size 128 === 采样 === --top-p 0.95 --top-k 20 --temp 0.7 --repeat-penalty 1.0 === 模板 === --jinja --chat-template-kwargs '{"enable_thinking":false}' --reasoning off 结论 vLLM 7.5 TPS 是 L20 + Qwen3-27B-FP8 物理上限(之前我们认为无法突破)。 llama.cpp + MTP 投机解码 在相同硬件上达到 50 TPS(平均)/ 80 TPS(峰值),6.7-10.7× 加速,且能跑 256K 完整原生上下文 + 2 路并发,显存只用 33GB。 关键启示:vLLM 框架本身在 hybrid Mamba/GDN 模型上有性能瓶颈(vLLM 0.5.x 测速 7.5 TPS,0.20.1 测速 7.45 TPS,几乎一样)。要突破必须换底层框架 — llama.cpp + MTP speculative decoding 是当前唯一现实路径。
  • 0 赞同
    4 帖子
    151 浏览
    XiaoteX
    @大胖肚肚 说点实际的经验,希望能帮到你。 关于4GB内存能不能跑ComfyUI: ComfyUI本身主要吃的是显卡显存(VRAM),不是系统内存。但4GB系统内存确实会非常痛苦——加载模型文件、处理图片输出、切换工作流的时候都会卡死或报OOM。建议至少加到32GB,DDR3很便宜,几十块钱搞定。 关于多卡+转接卡: 用x1转接卡或者USB转接确实会严重影响性能——PCIe通道带宽不够,多卡之间数据传输会成瓶颈。但如果是x16槽直插的槽位(比如你的DDR3主板如果有2个x16槽),那是可以的。关键看你的主板有几个真正的PCIe x16插槽。 给新手的建议顺序: 先把内存加到32-64GB(必须,这个不改什么都干不了) 只插一张显卡先跑起来,不用急着搞多卡 ComfyUI起步看刘悦大神的Windows整合包,开箱即用最省心 跑图的话你用一张卡(比如3060 12G或4060 16G),文生图和简单的视频工作流完全够用 总结:硬件底子弱了点但能折腾出来。先加内存,单卡启动,跟着教程走。量力而行就好。
  • 2 赞同
    26 帖子
    1k 浏览
    qw erQ
    3090插在X99的第几个卡槽啊,插在第1个的话第二个还能插显卡吗?第二个是X4还是X16的?我还没动手想抄作业
  • 3080ti这速度不错啊

    AI硬件 nvidia rtx3080ti 多卡部署
    14
    1 赞同
    14 帖子
    395 浏览
    rock shiR
    @coin1860 我是两张3080 20g,一共5800好像。hermes跑27b多模态,子代理最高飙到70t/s就极限了。平时就是40-55t/s,主要看MTP猜不猜的中
  • x99 cd3双卡配置

    已移动 随便聊聊 x99 多卡部署
    13
    0 赞同
    13 帖子
    322 浏览
    TideT
    我这次新买的1200W利民才421块钱,你这是二手的还要这个价啊?