source ~/sglang_env/bin/activate
export MASTER_ADDR=127.0.0.1
export MASTER_PORT=29500
export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
SGLANG_USE_CUDA_IPC_TRANSPORT=0
SGLANG_VLM_CACHE_SIZE_MB=0
python -m sglang.launch_server
--model-path /home/jhhotel/models/Qwen3-VL-32B-Instruct-AWQ-4bit
--served-model-name Qwen3.8-27B
--kv-cache-dtype fp8_e4m3
--tp-size 2
--host 0.0.0.0
--port 30000
--trust-remote-code
--enable-cache-report
--log-level info
--max-running-requests 8
--mem-fraction-static 0.65
--chunked-prefill-size 4096
--attention-backend flashinfer
--mm-attention-backend sdpa
--enable-metrics
--cuda-graph-backend-prefill disabled
--cuda-graph-backend-decode disabled
--enable-multimodal
先上启动配置 费半天劲才配通
华南金牌 华南金牌H12D-8D 搭EPYC 7452处理器 128G 三星 PRO990 2T



所有风扇散热进行改造


模型太老了 没有MTP 没有任何加速 也就是 16token/s了 预填充600到900左右

laihzang619
-
双卡TP 3090 跑 Qwen3-VL-32B-Instruct-AWQ-4bit 做视觉分析 -
RTX PRO 5000 72G SgLang 跑 Qwen3.8-27B FP8source ~/sglang_env/bin/activate
SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server
--model-path /home/jhhotel/models/models/Qwen--Qwen3.8-27B-FP8/snapshots/master
--served-model-name Qwen3.8-27B-FP8
--attention-backend flashinfer
--kv-cache-dtype fp8_e4m3
--chunked-prefill-size 2048
--context-length 262144
--mem-fraction-static 0.90
--reasoning-parser qwen3
--tool-call-parser qwen3_coder
--speculative-algo NEXTN
--speculative-num-steps 3
--speculative-eagle-topk 1
--speculative-num-draft-tokens 4
--host 0.0.0.0
--port 30000
--enable-cache-report \Ubuntu24.04







生产速度在55-80t/s 预填充6000左右 延时0.336 这些数据都是在单会话情况下的测试
-
3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF@applejuice
是这样测试吗 -
求配置 4090 还是 RTX PRO 5000 谁有实际数据 -
求配置 4090 还是 RTX PRO 5000 谁有实际数据
价格差不多 我留哪个 -
3090双卡【无nvlink pcie 3.0 x8+x8拆分 P2P驱动】测试llama-cpp 跑27B Q6K GGUF
pcie 4.0 16X 全速 没有nvlink的基准 -
求配置 4090 还是 RTX PRO 5000 谁有实际数据我想跑 qwen3.8 27B 用 2张 4090 48G 做张量并行 跑 FP8 精度 或者 用 1张 RTX PRO 5000 72G 跑 NVFP4 都开MTP 这两个方案 哪个速度更快
-
大热的3090风冷改造方案 大幅降温稳定AI大脑@williamlouis 我也想横着放 但是主板的散热甲,还有内存 都不允许我横过来 我也是找了半天对了半天 才把散热片怼上的
-
大热的3090风冷改造方案 大幅降温稳定AI大脑@九龙杨生 HD9000也用过太软了 已经有化了的了 感觉也就那么回事 。利民是硬 但是温度比原装垫子要好得多,就因为硬 没有化了的情况
-
大热的3090风冷改造方案 大幅降温稳定AI大脑温度只要能压住 限制功耗干啥 限制功耗都是为了压温度用啊 反正放在机房里用
-
大热的3090风冷改造方案 大幅降温稳定AI大脑@九龙杨生 弄好就给它扔到机房里 就没打算盖盖子
-
大热的3090风冷改造方案 大幅降温稳定AI大脑@九龙杨生 换导热垫是以前弄的 目前就是利民的那款14.5W的导热垫
-
大热的3090风冷改造方案 大幅降温稳定AI大脑
毕竟是想让他好好干活 先把硬件搞一搞 温度下来了 稳定才有保障 ! -
大热的3090风冷改造方案 大幅降温稳定AI大脑我用的微星 魔龙 3090 用过的都懂 核心80度以上 热点100度以上 显存100度 都是太正常的温度了
第一版改造方案

导热贴 贴在显卡背面 辅助背面显存散热 ,测试下来几乎没有效果 ,导热贴的面积太小 制约了导热效率第二版改造方案



改用导热膏直接堆在显卡背板上,大幅度提升了散热效率,显存温度可以降低18度 ,只有84度,但是核心温度还是无法被压制 导致核心降频,热点温度还在100度徘徊。第三版改造方案



拆掉原装风扇和外壳,正面利用9CM暴力风扇进行强制散热,背面利用14CM风扇对背面的显存辅助散热,目前拷机30多分钟 全程不掉频,热点不到80度 ,核心和显存都在70以下 这次算是比较完美的解决了3090太热的问题 。 -
双 3090(NVLink)跑 Qwen3.6-27B,128K 上下文实测@applejuice 投影层的名字 或者下载地址 能麻烦给一个吗
-
双 3090(NVLink)跑 Qwen3.6-27B,128K 上下文实测@applejuice 大佬 这个模型是默认就有视觉吗 还需要向别的模型一样需要下载一个投影层吗
-
VLLM下能跑的多模态Qwen3.6有哪个版本 可以识别图片视频的?目前使用的是cyankiwi/Qwen3.6-27B-AWQ-INT4 这个模型 他只有文本权重 无法对图片及视频进行识别 请大佬指点下 哪个版本是可以多模态的
-
我尝试了mtp和tuboquant我测试了vllm 3090 24G 开启MTP就爆显存了 没法用 llama有45t/s不错了 我的vllm只有34t/s