跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。

两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。

已定时 已固定 已锁定 已移动 LLM讨论区
b70provllmqwen-27b
20 帖子 8 发布者 631 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • terryT terry

    我没限制频率,我的xtx是系统限制的303w功耗,性能影响微乎其微😂

    sirwangS 离线
    sirwangS 离线
    sirwang
    超级版主
    编写于 最后由 编辑
    #4

    @terry 我限制了频率。 因为是涡轮扇,还是声音不小的。虽然是原厂的卡,但还是听着不舒服,尤其是多卡的时候.....

    1 条回复 最后回复
    1
    • sirwangS 离线
      sirwangS 离线
      sirwang
      超级版主
      编写于 最后由 编辑
      #5

      昨天晚上用了两个复杂任务,去跑了整夜的任务。 上边的参数设置的还是有些保守 ,于是修改了参数:
      增加上下文大小,调整预留显存比例,指定同时处理的图片的个数。这个模型我也不知道这算聪明还是傻,我发给它张图片,它直接调取了我的上下文然后发现我还有另一台带视频解析的模型,直接去调用了另一台机器做了图片OCR... 于是又调整了这个参数。

      14c9ce46-8400-4a7e-a4fe-d9f7aad12bfc-image.jpeg
      这个二货模型整的我哭笑不得~~~

      ZE_AFFINITY_MASK="1,2" vllm serve \
          --port 8989 \
          --host 0.0.0.0 \
          --gpu-memory-utilization **0.95** \
          --max-num-batched-tokens 8192 \
          --max-model-len **98304** \
          --block-size 64 \
          --dtype float16 \
          --model models/LLM/Qwen3.8-27B-Uncensored-FP8 \
          --served-model-name Qwen3.8-27B-FP8 \
          --tensor-parallel-size 2 \
          --quantization fp8 \
          --enforce-eager \
          --trust-remote-code \
          --enable-prefix-caching \
          --enable-auto-tool-choice \
          --tool-call-parser qwen3_coder \
          --reasoning-parser qwen3 \
          **--limit-mm-per-prompt image=4,video=1**
      
      
      1 条回复 最后回复
      1
      • sirwangS 离线
        sirwangS 离线
        sirwang
        超级版主
        编写于 最后由 编辑
        #6

        容易崩溃,现在调整一下。 我不知道是不是我限制了卡的功率问题?...费解中。

        ZE_AFFINITY_MASK="1,2" vllm serve \
            --port 8989 \
            --host 0.0.0.0 \
            --gpu-memory-utilization 0.95 \
            --max-num-batched-tokens 8192 \
            --max-model-len 81920 \
            --block-size 64 \
            --dtype float16 \
            --model models/LLM/Qwen3.8-27B-Uncensored-FP8 \
            --served-model-name Qwen3.8-27B-FP8 \
            --tensor-parallel-size 2 \
            --quantization fp8 \
            --enforce-eager \
            --trust-remote-code \
            --enable-prefix-caching \
            --enable-auto-tool-choice \
            --tool-call-parser qwen3_coder \
            --reasoning-parser qwen3 \
            --limit-mm-per-prompt image=4,video=1
        
        1 条回复 最后回复
        0
        • sirwangS 离线
          sirwangS 离线
          sirwang
          超级版主
          编写于 最后由 编辑
          #7

          我把评测的信息发给他们, 过了不到2分钟,大牛给了我新的代码, 直接FP8下边128K的上下文。3条线也可以满128K的上下文了....

          技术好,果然可以为所欲为.....

          export VLLM_ALLOW_LONG_MAX_MODEL_LEN=1
          export VLLM_WORKER_MULTIPROC_METHOD=spawn
          export VLLM_OFFLOAD_WEIGHTS_BEFORE_QUANT=1
          
          vllm serve \
              --port 8000 \
              --host 0.0.0.0 \
              --gpu-memory-utilization 0.90 \
              --max-num-batched-tokens 8192 \
              --max-model-len 131072 \
              --block-size 64 \
              --dtype float16 \
              --api-key "ww@lw" \
              --model models/LLM/Qwen3.8-27B-Uncensored-FP8/ \
              --served-model-name Qwen3.8-27B-FP8 \
              --tensor-parallel-size 2 \
              --quantization fp8 \
              --enforce-eager \
              --trust-remote-code \
              --enable-prefix-caching \
              --enable-auto-tool-choice \
              --tool-call-parser qwen3_coder \
              --reasoning-parser qwen3 \
              --limit-mm-per-prompt image=4,video=1 \
              > vllm-qwen3.8-27b.log 2>&1 &
          
          
          1 条回复 最后回复
          0
          • 张光璞张 离线
            张光璞张 离线
            张光璞
            劳动模范 德高望重
            编写于 最后由 编辑
            #8

            Intel 也要雄起了吗?

            A sirwangS 2 条回复 最后回复
            0
            • 张光璞张 张光璞

              Intel 也要雄起了吗?

              A 离线
              A 离线
              applejuice
              技术大牛 劳动模范
              编写于 最后由 编辑
              #9

              @张光璞 主要是这张卡也不便宜啊

              terryT sirwangS 2 条回复 最后回复
              0
              • A applejuice

                @张光璞 主要是这张卡也不便宜啊

                terryT 离线
                terryT 离线
                terry
                超级版主
                编写于 最后由 编辑
                #10

                @applejuice 雄起个锤子😂

                油管:https://www.youtube.com/@抡锤者

                1 条回复 最后回复
                0
                • 张光璞张 张光璞

                  Intel 也要雄起了吗?

                  sirwangS 离线
                  sirwangS 离线
                  sirwang
                  超级版主
                  编写于 最后由 编辑
                  #11

                  @张光璞 想多了。

                  张光璞张 1 条回复 最后回复
                  0
                  • A applejuice

                    @张光璞 主要是这张卡也不便宜啊

                    sirwangS 离线
                    sirwangS 离线
                    sirwang
                    超级版主
                    编写于 最后由 编辑
                    #12

                    @applejuice 小黄鱼渠道。基本全新。不到8000,带保修。不香?~

                    1 条回复 最后回复
                    0
                    • sirwangS sirwang

                      @张光璞 想多了。

                      张光璞张 离线
                      张光璞张 离线
                      张光璞
                      劳动模范 德高望重
                      编写于 最后由 编辑
                      #13

                      @sirwang 说:

                      @张光璞 想多了。

                      哈哈。蓝厂依旧扶不起,CPU再也不见i3 默秒全

                      1 条回复 最后回复
                      0
                      • Fei YanF 离线
                        Fei YanF 离线
                        Fei Yan
                        编写于 最后由 编辑
                        #14

                        所以说这个双卡究竟带来了什么提高?是推理速度还是上下文大小?能在windows docker desktop跑吗?

                        张光璞张 1 条回复 最后回复
                        0
                        • Fei YanF Fei Yan

                          所以说这个双卡究竟带来了什么提高?是推理速度还是上下文大小?能在windows docker desktop跑吗?

                          张光璞张 离线
                          张光璞张 离线
                          张光璞
                          劳动模范 德高望重
                          编写于 最后由 编辑
                          #15

                          @Fei-Yan 说:

                          所以说这个双卡究竟带来了什么提高?是推理速度还是上下文大小?能在windows docker desktop跑吗?

                          跑起来了!

                          1 条回复 最后回复
                          0
                          • williamlouisW 离线
                            williamlouisW 离线
                            williamlouis
                            超级版主
                            编写于 最后由 编辑
                            #16

                            对已经 intel上车的同志。这是一个 灯塔。

                            个人主页:xlkj.org Telegram https://t.me/xlkjorg

                            1 条回复 最后回复
                            0
                            • K 离线
                              K 离线
                              kaifan
                              编写于 最后由 kaifan 编辑
                              #17

                              分享一下我的结果 TP=2 PCIe4.0x8 虽然是一个月前测试的了但或许能帮上忙

                              docker run -d --name vllmb70 --ipc=host --shm-size=32g --dns 192.168.1.242 --device=/dev/dri:/dev/dri --privileged -p 1234:8000 \
                                -e VLLM_WORKER_MULTIPROC_METHOD=spawn \
                                -e ZE_FLAT_DEVICE_HIERARCHY=COMPOSITE \
                                -e ZE_AFFINITY_MASK=0,1 \
                                -e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \
                                -e PYTORCH_ALLOC_CONF=expandable_segments:True \
                                -e VLLM_XPU_ENABLE_XPU_GRAPH=1 \
                                -e CCL_SYCL_ALLREDUCE_SIMPLE_THRESHOLD=4294967296 \
                                -e CCL_SYCL_REDUCE_SCATTER_SIMPLE_THRESHOLD=4294967296 \
                                -e CCL_SYCL_ALLGATHERV_SIMPLE_THRESHOLD=4294967296 \
                                -e CCL_SYCL_ALLTOALL_TMP_BUF=1 \
                                -e http_proxy= \
                                -e https_proxy= \
                                -e no_proxy= \
                                --entrypoint /bin/bash intel/llm-scaler-vllm:0.21.0-b2 -c "
                                  python3 -m vllm.entrypoints.openai.api_server \
                                    --model Qwen/Qwen3.8-27B-FP8 \
                                    --tokenizer Qwen/Qwen3.8-27B-FP8 \
                                    --gpu-memory-utilization 0.97 \
                                    --max-model-len 262144 \
                                    --kv-cache-dtype auto \
                                    --enable-prefix-caching \
                                    --enable-auto-tool-choice \
                                    --tool-call-parser qwen3_coder \
                                    --default-chat-template-kwargs '{\"enable_thinking\": false}' \
                                    --trust-remote-code \
                                    --port 8000 \
                                    --tensor-parallel-size 2 \
                                    --pipeline-parallel-size 1 \
                                    --cudagraph-capture-sizes 1 2 4 \
                                    --dtype half \
                                "
                              

                              测试结果来自3.6-27b
                              单请求:

                              • pp16384: ~2400tps
                              • tg512: 33.3tps

                              共享上下文大概480k at FP16 KV Cache,fp8的kv cache能上1M
                              在我的agent swarm 真实使用 16并行峰值能到吐字300tps
                              ···
                              (APIServer pid=1) INFO 08-03 09:00:52 [loggers.py:273] Engine 000: Avg prompt throughput: 31.9 tokens/s, Avg generation throughput: 294.1 tokens/S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 50.6%, Prefix cache hit rate: 88.0%
                              (APIServer pid=1) INFO 08-03 09:01:02 loggers py:273] Engine 000: Avg prompt throughput: 60.7 tokens/s, Avg generation throughput: 280.0 tokens /S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 52.0%, Prefix cache hit rate: 88.0%
                              ···

                              XPU Graph 有时不太稳定但大致上能接受,但是不能接受intel摆烂的态度 https://github.com/intel/llm-scaler/issues/641

                              terryT sirwangS 2 条回复 最后回复
                              1
                              • ,系统 取消固定了此主题
                              • K kaifan

                                分享一下我的结果 TP=2 PCIe4.0x8 虽然是一个月前测试的了但或许能帮上忙

                                docker run -d --name vllmb70 --ipc=host --shm-size=32g --dns 192.168.1.242 --device=/dev/dri:/dev/dri --privileged -p 1234:8000 \
                                  -e VLLM_WORKER_MULTIPROC_METHOD=spawn \
                                  -e ZE_FLAT_DEVICE_HIERARCHY=COMPOSITE \
                                  -e ZE_AFFINITY_MASK=0,1 \
                                  -e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \
                                  -e PYTORCH_ALLOC_CONF=expandable_segments:True \
                                  -e VLLM_XPU_ENABLE_XPU_GRAPH=1 \
                                  -e CCL_SYCL_ALLREDUCE_SIMPLE_THRESHOLD=4294967296 \
                                  -e CCL_SYCL_REDUCE_SCATTER_SIMPLE_THRESHOLD=4294967296 \
                                  -e CCL_SYCL_ALLGATHERV_SIMPLE_THRESHOLD=4294967296 \
                                  -e CCL_SYCL_ALLTOALL_TMP_BUF=1 \
                                  -e http_proxy= \
                                  -e https_proxy= \
                                  -e no_proxy= \
                                  --entrypoint /bin/bash intel/llm-scaler-vllm:0.21.0-b2 -c "
                                    python3 -m vllm.entrypoints.openai.api_server \
                                      --model Qwen/Qwen3.8-27B-FP8 \
                                      --tokenizer Qwen/Qwen3.8-27B-FP8 \
                                      --gpu-memory-utilization 0.97 \
                                      --max-model-len 262144 \
                                      --kv-cache-dtype auto \
                                      --enable-prefix-caching \
                                      --enable-auto-tool-choice \
                                      --tool-call-parser qwen3_coder \
                                      --default-chat-template-kwargs '{\"enable_thinking\": false}' \
                                      --trust-remote-code \
                                      --port 8000 \
                                      --tensor-parallel-size 2 \
                                      --pipeline-parallel-size 1 \
                                      --cudagraph-capture-sizes 1 2 4 \
                                      --dtype half \
                                  "
                                

                                测试结果来自3.6-27b
                                单请求:

                                • pp16384: ~2400tps
                                • tg512: 33.3tps

                                共享上下文大概480k at FP16 KV Cache,fp8的kv cache能上1M
                                在我的agent swarm 真实使用 16并行峰值能到吐字300tps
                                ···
                                (APIServer pid=1) INFO 08-03 09:00:52 [loggers.py:273] Engine 000: Avg prompt throughput: 31.9 tokens/s, Avg generation throughput: 294.1 tokens/S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 50.6%, Prefix cache hit rate: 88.0%
                                (APIServer pid=1) INFO 08-03 09:01:02 loggers py:273] Engine 000: Avg prompt throughput: 60.7 tokens/s, Avg generation throughput: 280.0 tokens /S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 52.0%, Prefix cache hit rate: 88.0%
                                ···

                                XPU Graph 有时不太稳定但大致上能接受,但是不能接受intel摆烂的态度 https://github.com/intel/llm-scaler/issues/641

                                terryT 离线
                                terryT 离线
                                terry
                                超级版主
                                编写于 最后由 编辑
                                #18

                                @kaifan 我擦,这玩意还能凑到第二个人,佩服。你的帖子再次增加了主贴的含金量,英特尔用户可以来抄作业。

                                油管:https://www.youtube.com/@抡锤者

                                1 条回复 最后回复
                                0
                                • K kaifan

                                  分享一下我的结果 TP=2 PCIe4.0x8 虽然是一个月前测试的了但或许能帮上忙

                                  docker run -d --name vllmb70 --ipc=host --shm-size=32g --dns 192.168.1.242 --device=/dev/dri:/dev/dri --privileged -p 1234:8000 \
                                    -e VLLM_WORKER_MULTIPROC_METHOD=spawn \
                                    -e ZE_FLAT_DEVICE_HIERARCHY=COMPOSITE \
                                    -e ZE_AFFINITY_MASK=0,1 \
                                    -e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \
                                    -e PYTORCH_ALLOC_CONF=expandable_segments:True \
                                    -e VLLM_XPU_ENABLE_XPU_GRAPH=1 \
                                    -e CCL_SYCL_ALLREDUCE_SIMPLE_THRESHOLD=4294967296 \
                                    -e CCL_SYCL_REDUCE_SCATTER_SIMPLE_THRESHOLD=4294967296 \
                                    -e CCL_SYCL_ALLGATHERV_SIMPLE_THRESHOLD=4294967296 \
                                    -e CCL_SYCL_ALLTOALL_TMP_BUF=1 \
                                    -e http_proxy= \
                                    -e https_proxy= \
                                    -e no_proxy= \
                                    --entrypoint /bin/bash intel/llm-scaler-vllm:0.21.0-b2 -c "
                                      python3 -m vllm.entrypoints.openai.api_server \
                                        --model Qwen/Qwen3.8-27B-FP8 \
                                        --tokenizer Qwen/Qwen3.8-27B-FP8 \
                                        --gpu-memory-utilization 0.97 \
                                        --max-model-len 262144 \
                                        --kv-cache-dtype auto \
                                        --enable-prefix-caching \
                                        --enable-auto-tool-choice \
                                        --tool-call-parser qwen3_coder \
                                        --default-chat-template-kwargs '{\"enable_thinking\": false}' \
                                        --trust-remote-code \
                                        --port 8000 \
                                        --tensor-parallel-size 2 \
                                        --pipeline-parallel-size 1 \
                                        --cudagraph-capture-sizes 1 2 4 \
                                        --dtype half \
                                    "
                                  

                                  测试结果来自3.6-27b
                                  单请求:

                                  • pp16384: ~2400tps
                                  • tg512: 33.3tps

                                  共享上下文大概480k at FP16 KV Cache,fp8的kv cache能上1M
                                  在我的agent swarm 真实使用 16并行峰值能到吐字300tps
                                  ···
                                  (APIServer pid=1) INFO 08-03 09:00:52 [loggers.py:273] Engine 000: Avg prompt throughput: 31.9 tokens/s, Avg generation throughput: 294.1 tokens/S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 50.6%, Prefix cache hit rate: 88.0%
                                  (APIServer pid=1) INFO 08-03 09:01:02 loggers py:273] Engine 000: Avg prompt throughput: 60.7 tokens/s, Avg generation throughput: 280.0 tokens /S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 52.0%, Prefix cache hit rate: 88.0%
                                  ···

                                  XPU Graph 有时不太稳定但大致上能接受,但是不能接受intel摆烂的态度 https://github.com/intel/llm-scaler/issues/641

                                  sirwangS 离线
                                  sirwangS 离线
                                  sirwang
                                  超级版主
                                  编写于 最后由 编辑
                                  #19

                                  @kaifan 可以试试qwen3.8-flash-next-fp8了。 对这个有些期待,虽然暂时这个3.8-27b还是相当香的。

                                  K 1 条回复 最后回复
                                  0
                                  • sirwangS sirwang

                                    @kaifan 可以试试qwen3.8-flash-next-fp8了。 对这个有些期待,虽然暂时这个3.8-27b还是相当香的。

                                    K 离线
                                    K 离线
                                    kaifan
                                    编写于 最后由 编辑
                                    #20

                                    @sirwang 双卡放不下125B-FP8的模型了,四卡也跑不起来吧,看repo有186G,去掉ngram的50G还有136G呢

                                    倒是在我主机跑了Q4起来,不过大部分都offload到系统内存了,大概pp 320tps tg 13tps 还不太到能用的程度

                                    1 条回复 最后回复
                                    0

                                    你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                                    厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                                    有了你的建议,这篇帖子会更精彩哦 💗

                                    注册 登录
                                    回复
                                    • 在新帖中回复
                                    登录后回复
                                    • 从旧到新
                                    • 从新到旧
                                    • 最多赞同


                                    • 登录

                                    • 登录或注册以进行搜索。
                                    • 第一个帖子
                                      最后一个帖子
                                    0
                                    • 版块
                                    • 最新
                                    • 标签
                                    • 热门
                                    • 用户
                                    • 群组