跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
木生火木

木生火

@木生火
取消关注 关注
关于
帖子
7
主题
2
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 求助:Codex接本地Qwen3.8-27B配置
    木生火木 木生火

    Codex接本地Qwen3.8-27B配置怎么配置的?都是用CC Switch和Codex++吗?有没有什么方便直接的配置方式?

    AI Agent codex qwen-27b

  • 有几块RTX8000显卡48G显存,有什么好意见?
    木生火木 木生火

    @坤坤 谢谢反馈,我自己测试:
    Ornith-1.0-35B 大概也是90tps。可能网络或者我这段时间调整原因。
    enchmark Results Summary
    Model: Ornith-1.0-35B-128K Average Throughput: ~204 tokens/second Range: 185-218 tokens/second

    Per-Test Breakdown
    Test Type Avg Tok/s Min Tok/s Max Tok/s
    Short (~20 tokens) 199 197 201
    Medium (~100 tokens) 207 205 208
    Long (~150 tokens) 207 185 218

    LLM讨论区 llama.cpp 多卡部署 qwen-27b

  • 有几块RTX8000显卡48G显存,有什么好意见?
    木生火木 木生火

    @coolstar 低调测试,所以随缘。测试金额没了,我会添加。

    LLM讨论区 llama.cpp 多卡部署 qwen-27b

  • 有几块RTX8000显卡48G显存,有什么好意见?
    木生火木 木生火

    @坤坤 已经添加300$

    LLM讨论区 llama.cpp 多卡部署 qwen-27b

  • 有几块RTX8000显卡48G显存,有什么好意见?
    木生火木 木生火

    招本论坛5个用户帮我做压力测试。
    注册地址http://123.125.174.5:3000 ,注册时用户名前缀加lcz,我好管理。
    注册后,发账号到该帖下。然后我给前5个充值300$测试。测试有什么意见跟帖。

    LLM讨论区 llama.cpp 多卡部署 qwen-27b

  • 有几块RTX8000显卡48G显存,有什么好意见?
    木生火木 木生火

    @Xiaote 我都是单卡部署,现在跑qwen3.8-27B Q8 27ms/token左右。单负载256K上下文,双负载128K上下,双负载下能到总36 t/s 左右。
    • 模型: Qwen3.8-27B
    • 架构: Dense
    • 长输入并发2: 32 tok/s

    • 模型: Qwen3.6-35B-A3B
    • 架构: MoE
    • 长输入并发2: 202 tok/s

    • 模型: Ornith-1.0-35B
    • 架构: MoE
    • 长输入并发2: 181 tok/s
    这是一次长并发2的测试速度,基本2并发能榨干出实际最高单显卡能力。
    好在这些资源都是免费用的,就像怎么最大化用起来它们的价值。

    LLM讨论区 llama.cpp 多卡部署 qwen-27b

  • 有几块RTX8000显卡48G显存,有什么好意见?
    木生火木 木生火

    有几块RTX8000显卡48G显存,老显卡折腾不起vllm和sglang,最后还是老老实实用llama.cpp。
    现在有2块跑qwen3.8-27B,两块跑ornith1.0-35B,两块跑qwen3.6-35B。
    有什么好的使用建议给我?目前公网搭建了一套new API,目前放出qwen3.8-27B和ornith1.0-35B两个模型。打算找5个专家帮我测试给建议。有兴趣测试的联系。

    LLM讨论区 llama.cpp 多卡部署 qwen-27b
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组