跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
alex wang 0A

alex wang 0

@alex wang 0
取消关注 关注
关于
帖子
25
主题
2
分享
0
群组
0
粉丝
0
关注
2

帖子

最新 最佳 有争议的

  • 这个配置,大神帮忙建议一下,本地化部署什么大模型最合适,需要5个人同时并发?
    alex wang 0A alex wang 0

    Qwen3.8-27B 本地部署验收报告

    • 验收日期:2026-09-04(llama.cpp b10621 / CUDA 13.3 构建)
    • 机器:Windows Server 2019 · AMD EPYC 7663 ×2(112 线程)· 576GB RAM · 3× NVIDIA RTX 5090(32GB),驱动 591.44
    • 运行环境(一次性成功安装):llama.cpp llama-server v0.3.0-dev (b10621) → D:\DeepSeek\llama.cpp\bin(CUDA 13.3 运行库由 NVIDIA 官方 redist 补齐:cudart/cublas/cublasLt)
    • 模型:unsloth/Qwen3.8-27B-GGUF Q8_0(27.05GB,字节数与上游一致 29,047,086,048)→ D:\DeepSeek\models\Qwen3.8-27B-Q8_0.gguf(hf-mirror 分段下载)
    • 服务形态:1 个 llama-server,--parallel 5(5 个并发槽位),每槽 32K 上下文(总 163,840),三卡 layer 切分全量卸载(-ngl 999,flash-attn on,KV q8_0),OpenAI 兼容 API @ http://0.0.0.0:8080

    一、性能实测(thinking 关闭,纯生成)

    项目 结果
    单路解码(256 tokens,3 次) 39.7 / 42.9 / 42.5 ≈ 42 tok/s
    单路流式解码(512 tokens,3 次) 43.0 / 43.3 / 42.7 ≈ 43 tok/s
    TTFT 首 token 延迟(~1k prompt) 0.14–0.18 s
    冷启动预填充(31,212 tokens prompt) ≈3,850 tok/s(3.1s 后同 prompt 重复请求命中 prefix 缓存,78–85k tok/s 为缓存命中非算力)
    长上下文检索(9,454 tokens 中找标记词) 3.26 s,命中正确(32K 槽位实证可用)

    二、5 个活跃并发会话(同服务端 5 槽位)

    • 5 个独立人格/历史的会话同时各做 2 轮多轮对话,全程 /slots 采样 52/52 次均为 5 槽全部忙碌(max_simultaneously_busy_slots = 5)
    • 总耗时 26.9 s,共生成 1,506 tokens,聚合吞吐 ≈56 tok/s;单会话在 5 路并发下 ~14–15 tok/s(10 轮请求零失败、零串话,各会话保持自身身份与连续性)
    • 结论:5 个活跃会话全部可用、互不阻塞(单路独占 ~43 tok/s → 5 路并发聚合 ~56 tok/s,GPU 以 batch 方式共享)

    三、能力小样本(思考默认开启)

    11 项 → 10 PASS / 0 FAIL / 1 人工判定(翻译项实际正确)

    类别 题目 判定
    数学 472 × 318 ✅ =150096
    数学 3x+7=22 ✅ x=5
    数学推理 鸡羊 30 头 88 腿几只羊 ✅ 14(附完整推导)
    逻辑 9.11 vs 9.9 ✅ 9.9
    代码 print(sum(range(1,101))) ✅ 5050
    代码 写并运行 quicksort([3,1,4,1,5,9,2,6]) ✅ 真实执行 [1,1,2,3,4,5,6,9] rc=0
    中文 解释「塞翁失马,焉知非福」+例子 ✅
    中文 「画蛇添足」比喻 ✅
    翻译 EN→中文 ✅(人工复核为正确译文)
    指令遵循 只输出「好的」 ✅
    知识 四大发明 ✅

    另验证:思考模式默认开启(输出 reasoning_content),可通过 chat_template_kwargs:{"enable_thinking":false} 关闭;工具调用模板就绪。

    四、结论与备注

    1. 安装一次成功:llama.cpp + CUDA13.3(含 RTX 5090 sm_120 架构,日志确认 CUDA: ARCHS = …1200,1210)+ 官方 redist 运行库,三卡均识别参与(每卡显存占用约 12.3GB,余量充足)。
    2. 混合线性注意力架构(64 层中 16 层全注意力)→ 长上下文成本极低,256K 官方窗口可支撑;本部署开 5×32K。
    3. 单流 42–43 tok/s 为该架构 + layer 切分 + Q8_0 的实测值;row/tensor 并行本 build 对 qwen3.5 混合架构不支持("does not support split buffers")。如需更高单流吞吐可后续:启用 MTP(仓库自带 mtp-Qwen3.8-27B-Q4_0.gguf)、或降档 Q4_K_M、或换 vLLM(FP8/BF16)。
    4. 视觉(多模态)未纳入本次验收;仓库含 mmproj-BF16.gguf(888MB),可后续挂载验证图像理解。
    5. 结果 JSON:D:\DeepSeek\results\perf_single.json / concurrent5.json / capability_probe.json;服务日志:D:\DeepSeek\llama.cpp\logs\。

    五、复现命令

    # 启动 / 停止
    powershell -ExecutionPolicy Bypass -File D:\DeepSeek\scripts\start_qwen.ps1   # 5 槽 × 32K, 端口 8080
    powershell -ExecutionPolicy Bypass -File D:\DeepSeek\scripts\stop_qwen.ps1
    # 基准 / 并发 / 能力
    python D:\DeepSeek\scripts\bench_tokens.py
    python D:\DeepSeek\scripts\concurrent5.py
    python D:\DeepSeek\scripts\capability_probe.py
    # 聊天
    curl http://127.0.0.1:8080/v1/chat/completions -d '{"model":"qwen3.8-27b","messages":[{"role":"user","content":"你好"}]}'
    
    AI硬件 本地模型 多卡部署
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组