27B 1M上下文支持?
fly86
-
QWEN 3.8 27B 暂定 今晚(8-14) 23点 -
这可能是目前本地部署GLM5.2 的最佳方案了2年后10w的硬件搞定,2年后回来看看,希望论坛还在
-
rtx pro 5000 真实算力真实任务,230K上下文,还可以维持50多t/s

-
rtx pro 5000 真实算力unsloth qwen3.6 27b nvfp4 编写代码分析文档时可以到150左右,但干活儿有点飘了,生成的数据质量不高。

-
rtx pro 5000 真实算力@terry 有道理,性能就这样了。个人用已经足够了
-
rtx pro 5000 真实算力到最后写文档时,可以达到125t/s. 这个卡差在bf16算力只有rtx 6000 ada的一半
-
rtx pro 5000 真实算力vllm serve ./Qwen3.6-27B-FP8 --kv-cache-dtype fp8_e4m3 --block-size 32 --tokenizer Qwen/Qwen3.6-27B --speculative-config '{"method": "mtp", "num_speculative_tokens": 4}' --enable-prefix-caching --trust-remote-code --max-num-seqs 8 --max-num-batched-tokens 16384 --served-model-name qwen3.6-27b --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --language-model-only
23K吞吐达到了100t/s

-
两块5070TI 16G 能部署什么样的本地模型,分别提供给2个人使用,相互不影响?5080 *2 27b能跑到40t/s
-
rtx pro 5000 真实算力涨价真快,京东5.9w了
-
# 🎬 用ESP32-S3实施廉价KVM-over-IP — 完整折腾报告@abaalei 很利害了
-
# 🎬 用ESP32-S3实施廉价KVM-over-IP — 完整折腾报告牛逼,S3这么强
-
618梭哈一把硬件配置,探索一下。保守了哈,直接上pro5000 72g
-
技嘉Z890主板 256G DDR5内存 两张Pro6000 96G 跑cpp Qwen3.6 27B BF16与同时双ComfyUI工作流长视频之运行@terry 是的,能撑过显存饥荒年代了
-
技嘉Z890主板 256G DDR5内存 两张Pro6000 96G 跑cpp Qwen3.6 27B BF16与同时双ComfyUI工作流长视频之运行我估计守着rtx pro 5000 72G终老了。谁又说得好呢,几年之后个人pc统一内存达到TB级别
-
rtx pro 5000 真实算力qwen3.6 27b fp8都30G了。懒得跑评测数据。实际体验,单路70t/s足够个人用,cc跑稍微大一点的的代码仓库也比较可以了。京东丽台5.0w拿下的72G版本,砸锅卖铁。
-
rtx pro 5000 真实算力pro 5000实战代码分析任务
vllm启动参数
vllm serve ./Qwen3.6-27B-FP8 --kv-cache-dtype fp8 --tokenizer Qwen/Qwen3.6-27B \ --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}' \ --enable-prefix-caching --trust-remote-code --max-num-seqs 32 --max-num-batched-tokens 32768 \ --served-model-name local-llm --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
大概7分钟生成一个代码文档
a521415a-50c1-4351-9528-3fd18adbbaaa.txt -
来自RTX PRO 5000的碎碎念vllm qwen3.6 27b fp8跑着还行,代码分析任务,当然了,这个图是最后生成文档时截的

-
84gb的6000d和72gb的pro5000 差不多价格@Rocky-Law 很明显,这是个错误的结论。比pro 5000还是要强30%