Codex接本地Qwen3.8-27B配置怎么配置的?都是用CC Switch和Codex++吗?有没有什么方便直接的配置方式?
木生火
-
求助:Codex接本地Qwen3.8-27B配置 -
有几块RTX8000显卡48G显存,有什么好意见?@坤坤 谢谢反馈,我自己测试:
Ornith-1.0-35B 大概也是90tps。可能网络或者我这段时间调整原因。
enchmark Results Summary
Model: Ornith-1.0-35B-128K Average Throughput: ~204 tokens/second Range: 185-218 tokens/secondPer-Test Breakdown
Test Type Avg Tok/s Min Tok/s Max Tok/s
Short (~20 tokens) 199 197 201
Medium (~100 tokens) 207 205 208
Long (~150 tokens) 207 185 218 -
有几块RTX8000显卡48G显存,有什么好意见?@coolstar 低调测试,所以随缘。测试金额没了,我会添加。
-
有几块RTX8000显卡48G显存,有什么好意见?@坤坤 已经添加300$
-
有几块RTX8000显卡48G显存,有什么好意见?招本论坛5个用户帮我做压力测试。
注册地址http://123.125.174.5:3000 ,注册时用户名前缀加lcz,我好管理。
注册后,发账号到该帖下。然后我给前5个充值300$测试。测试有什么意见跟帖。 -
有几块RTX8000显卡48G显存,有什么好意见?@Xiaote 我都是单卡部署,现在跑qwen3.8-27B Q8 27ms/token左右。单负载256K上下文,双负载128K上下,双负载下能到总36 t/s 左右。
• 模型: Qwen3.8-27B
• 架构: Dense
• 长输入并发2: 32 tok/s• 模型: Qwen3.6-35B-A3B
• 架构: MoE
• 长输入并发2: 202 tok/s• 模型: Ornith-1.0-35B
• 架构: MoE
• 长输入并发2: 181 tok/s
这是一次长并发2的测试速度,基本2并发能榨干出实际最高单显卡能力。
好在这些资源都是免费用的,就像怎么最大化用起来它们的价值。 -
有几块RTX8000显卡48G显存,有什么好意见?有几块RTX8000显卡48G显存,老显卡折腾不起vllm和sglang,最后还是老老实实用llama.cpp。
现在有2块跑qwen3.8-27B,两块跑ornith1.0-35B,两块跑qwen3.6-35B。
有什么好的使用建议给我?目前公网搭建了一套new API,目前放出qwen3.8-27B和ornith1.0-35B两个模型。打算找5个专家帮我测试给建议。有兴趣测试的联系。