两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。
-
昨天晚上用了两个复杂任务,去跑了整夜的任务。 上边的参数设置的还是有些保守 ,于是修改了参数:
增加上下文大小,调整预留显存比例,指定同时处理的图片的个数。这个模型我也不知道这算聪明还是傻,我发给它张图片,它直接调取了我的上下文然后发现我还有另一台带视频解析的模型,直接去调用了另一台机器做了图片OCR... 于是又调整了这个参数。
这个二货模型整的我哭笑不得~~~ZE_AFFINITY_MASK="1,2" vllm serve \ --port 8989 \ --host 0.0.0.0 \ --gpu-memory-utilization **0.95** \ --max-num-batched-tokens 8192 \ --max-model-len **98304** \ --block-size 64 \ --dtype float16 \ --model models/LLM/Qwen3.8-27B-Uncensored-FP8 \ --served-model-name Qwen3.8-27B-FP8 \ --tensor-parallel-size 2 \ --quantization fp8 \ --enforce-eager \ --trust-remote-code \ --enable-prefix-caching \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen3 \ **--limit-mm-per-prompt image=4,video=1** -
容易崩溃,现在调整一下。 我不知道是不是我限制了卡的功率问题?...费解中。
ZE_AFFINITY_MASK="1,2" vllm serve \ --port 8989 \ --host 0.0.0.0 \ --gpu-memory-utilization 0.95 \ --max-num-batched-tokens 8192 \ --max-model-len 81920 \ --block-size 64 \ --dtype float16 \ --model models/LLM/Qwen3.8-27B-Uncensored-FP8 \ --served-model-name Qwen3.8-27B-FP8 \ --tensor-parallel-size 2 \ --quantization fp8 \ --enforce-eager \ --trust-remote-code \ --enable-prefix-caching \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen3 \ --limit-mm-per-prompt image=4,video=1 -
我把评测的信息发给他们, 过了不到2分钟,大牛给了我新的代码, 直接FP8下边128K的上下文。3条线也可以满128K的上下文了....
技术好,果然可以为所欲为.....
export VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 export VLLM_WORKER_MULTIPROC_METHOD=spawn export VLLM_OFFLOAD_WEIGHTS_BEFORE_QUANT=1 vllm serve \ --port 8000 \ --host 0.0.0.0 \ --gpu-memory-utilization 0.90 \ --max-num-batched-tokens 8192 \ --max-model-len 131072 \ --block-size 64 \ --dtype float16 \ --api-key "ww@lw" \ --model models/LLM/Qwen3.8-27B-Uncensored-FP8/ \ --served-model-name Qwen3.8-27B-FP8 \ --tensor-parallel-size 2 \ --quantization fp8 \ --enforce-eager \ --trust-remote-code \ --enable-prefix-caching \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen3 \ --limit-mm-per-prompt image=4,video=1 \ > vllm-qwen3.8-27b.log 2>&1 & -
@张光璞 主要是这张卡也不便宜啊
-
@张光璞 主要是这张卡也不便宜啊
-
对已经 intel上车的同志。这是一个 灯塔。
-
分享一下我的结果 TP=2 PCIe4.0x8 虽然是一个月前测试的了但或许能帮上忙
docker run -d --name vllmb70 --ipc=host --shm-size=32g --dns 192.168.1.242 --device=/dev/dri:/dev/dri --privileged -p 1234:8000 \ -e VLLM_WORKER_MULTIPROC_METHOD=spawn \ -e ZE_FLAT_DEVICE_HIERARCHY=COMPOSITE \ -e ZE_AFFINITY_MASK=0,1 \ -e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \ -e PYTORCH_ALLOC_CONF=expandable_segments:True \ -e VLLM_XPU_ENABLE_XPU_GRAPH=1 \ -e CCL_SYCL_ALLREDUCE_SIMPLE_THRESHOLD=4294967296 \ -e CCL_SYCL_REDUCE_SCATTER_SIMPLE_THRESHOLD=4294967296 \ -e CCL_SYCL_ALLGATHERV_SIMPLE_THRESHOLD=4294967296 \ -e CCL_SYCL_ALLTOALL_TMP_BUF=1 \ -e http_proxy= \ -e https_proxy= \ -e no_proxy= \ --entrypoint /bin/bash intel/llm-scaler-vllm:0.21.0-b2 -c " python3 -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3.8-27B-FP8 \ --tokenizer Qwen/Qwen3.8-27B-FP8 \ --gpu-memory-utilization 0.97 \ --max-model-len 262144 \ --kv-cache-dtype auto \ --enable-prefix-caching \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --default-chat-template-kwargs '{\"enable_thinking\": false}' \ --trust-remote-code \ --port 8000 \ --tensor-parallel-size 2 \ --pipeline-parallel-size 1 \ --cudagraph-capture-sizes 1 2 4 \ --dtype half \ "测试结果来自3.6-27b
单请求:- pp16384: ~2400tps
- tg512: 33.3tps
共享上下文大概480k at FP16 KV Cache,fp8的kv cache能上1M
在我的agent swarm 真实使用 16并行峰值能到吐字300tps
···
(APIServer pid=1) INFO 08-03 09:00:52 [loggers.py:273] Engine 000: Avg prompt throughput: 31.9 tokens/s, Avg generation throughput: 294.1 tokens/S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 50.6%, Prefix cache hit rate: 88.0%
(APIServer pid=1) INFO 08-03 09:01:02 loggers py:273] Engine 000: Avg prompt throughput: 60.7 tokens/s, Avg generation throughput: 280.0 tokens /S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 52.0%, Prefix cache hit rate: 88.0%
···XPU Graph 有时不太稳定但大致上能接受,但是不能接受intel摆烂的态度 https://github.com/intel/llm-scaler/issues/641
-
,系统 取消固定了此主题
-
分享一下我的结果 TP=2 PCIe4.0x8 虽然是一个月前测试的了但或许能帮上忙
docker run -d --name vllmb70 --ipc=host --shm-size=32g --dns 192.168.1.242 --device=/dev/dri:/dev/dri --privileged -p 1234:8000 \ -e VLLM_WORKER_MULTIPROC_METHOD=spawn \ -e ZE_FLAT_DEVICE_HIERARCHY=COMPOSITE \ -e ZE_AFFINITY_MASK=0,1 \ -e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \ -e PYTORCH_ALLOC_CONF=expandable_segments:True \ -e VLLM_XPU_ENABLE_XPU_GRAPH=1 \ -e CCL_SYCL_ALLREDUCE_SIMPLE_THRESHOLD=4294967296 \ -e CCL_SYCL_REDUCE_SCATTER_SIMPLE_THRESHOLD=4294967296 \ -e CCL_SYCL_ALLGATHERV_SIMPLE_THRESHOLD=4294967296 \ -e CCL_SYCL_ALLTOALL_TMP_BUF=1 \ -e http_proxy= \ -e https_proxy= \ -e no_proxy= \ --entrypoint /bin/bash intel/llm-scaler-vllm:0.21.0-b2 -c " python3 -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3.8-27B-FP8 \ --tokenizer Qwen/Qwen3.8-27B-FP8 \ --gpu-memory-utilization 0.97 \ --max-model-len 262144 \ --kv-cache-dtype auto \ --enable-prefix-caching \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --default-chat-template-kwargs '{\"enable_thinking\": false}' \ --trust-remote-code \ --port 8000 \ --tensor-parallel-size 2 \ --pipeline-parallel-size 1 \ --cudagraph-capture-sizes 1 2 4 \ --dtype half \ "测试结果来自3.6-27b
单请求:- pp16384: ~2400tps
- tg512: 33.3tps
共享上下文大概480k at FP16 KV Cache,fp8的kv cache能上1M
在我的agent swarm 真实使用 16并行峰值能到吐字300tps
···
(APIServer pid=1) INFO 08-03 09:00:52 [loggers.py:273] Engine 000: Avg prompt throughput: 31.9 tokens/s, Avg generation throughput: 294.1 tokens/S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 50.6%, Prefix cache hit rate: 88.0%
(APIServer pid=1) INFO 08-03 09:01:02 loggers py:273] Engine 000: Avg prompt throughput: 60.7 tokens/s, Avg generation throughput: 280.0 tokens /S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 52.0%, Prefix cache hit rate: 88.0%
···XPU Graph 有时不太稳定但大致上能接受,但是不能接受intel摆烂的态度 https://github.com/intel/llm-scaler/issues/641
-
分享一下我的结果 TP=2 PCIe4.0x8 虽然是一个月前测试的了但或许能帮上忙
docker run -d --name vllmb70 --ipc=host --shm-size=32g --dns 192.168.1.242 --device=/dev/dri:/dev/dri --privileged -p 1234:8000 \ -e VLLM_WORKER_MULTIPROC_METHOD=spawn \ -e ZE_FLAT_DEVICE_HIERARCHY=COMPOSITE \ -e ZE_AFFINITY_MASK=0,1 \ -e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \ -e PYTORCH_ALLOC_CONF=expandable_segments:True \ -e VLLM_XPU_ENABLE_XPU_GRAPH=1 \ -e CCL_SYCL_ALLREDUCE_SIMPLE_THRESHOLD=4294967296 \ -e CCL_SYCL_REDUCE_SCATTER_SIMPLE_THRESHOLD=4294967296 \ -e CCL_SYCL_ALLGATHERV_SIMPLE_THRESHOLD=4294967296 \ -e CCL_SYCL_ALLTOALL_TMP_BUF=1 \ -e http_proxy= \ -e https_proxy= \ -e no_proxy= \ --entrypoint /bin/bash intel/llm-scaler-vllm:0.21.0-b2 -c " python3 -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3.8-27B-FP8 \ --tokenizer Qwen/Qwen3.8-27B-FP8 \ --gpu-memory-utilization 0.97 \ --max-model-len 262144 \ --kv-cache-dtype auto \ --enable-prefix-caching \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --default-chat-template-kwargs '{\"enable_thinking\": false}' \ --trust-remote-code \ --port 8000 \ --tensor-parallel-size 2 \ --pipeline-parallel-size 1 \ --cudagraph-capture-sizes 1 2 4 \ --dtype half \ "测试结果来自3.6-27b
单请求:- pp16384: ~2400tps
- tg512: 33.3tps
共享上下文大概480k at FP16 KV Cache,fp8的kv cache能上1M
在我的agent swarm 真实使用 16并行峰值能到吐字300tps
···
(APIServer pid=1) INFO 08-03 09:00:52 [loggers.py:273] Engine 000: Avg prompt throughput: 31.9 tokens/s, Avg generation throughput: 294.1 tokens/S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 50.6%, Prefix cache hit rate: 88.0%
(APIServer pid=1) INFO 08-03 09:01:02 loggers py:273] Engine 000: Avg prompt throughput: 60.7 tokens/s, Avg generation throughput: 280.0 tokens /S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 52.0%, Prefix cache hit rate: 88.0%
···XPU Graph 有时不太稳定但大致上能接受,但是不能接受intel摆烂的态度 https://github.com/intel/llm-scaler/issues/641
