用过了,低频噪音,个人能接受的范围
F
fly86
@fly86
-
这个新发布的RTX Pro 5000感觉是个坑啊 -
rtx pro 5000 真实算力pro 5000实战代码分析任务
vllm启动参数
vllm serve ./Qwen3.6-27B-FP8 --kv-cache-dtype fp8 --tokenizer Qwen/Qwen3.6-27B \ --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}' \ --enable-prefix-caching --trust-remote-code --max-num-seqs 32 --max-num-batched-tokens 32768 \ --served-model-name local-llm --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
大概7分钟生成一个代码文档
a521415a-50c1-4351-9528-3fd18adbbaaa.txt -
618梭哈一把硬件配置,探索一下。保守了哈,直接上pro5000 72g
-
rtx pro 5000 真实算力unsloth qwen3.6 27b nvfp4 编写代码分析文档时可以到150左右,但干活儿有点飘了,生成的数据质量不高。

-
rtx pro 5000 真实算力vllm serve ./Qwen3.6-27B-FP8 --kv-cache-dtype fp8_e4m3 --block-size 32 --tokenizer Qwen/Qwen3.6-27B --speculative-config '{"method": "mtp", "num_speculative_tokens": 4}' --enable-prefix-caching --trust-remote-code --max-num-seqs 8 --max-num-batched-tokens 16384 --served-model-name qwen3.6-27b --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --language-model-only
23K吞吐达到了100t/s
