跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。

两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。

已定时 已固定 已锁定 已移动 LLM讨论区
b70provllmqwen-27b
20 帖子 8 发布者 628 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • 张光璞张 离线
    张光璞张 离线
    张光璞
    劳动模范 德高望重
    编写于 最后由 编辑
    #8

    Intel 也要雄起了吗?

    A sirwangS 2 条回复 最后回复
    0
    • 张光璞张 张光璞

      Intel 也要雄起了吗?

      A 离线
      A 离线
      applejuice
      技术大牛 劳动模范
      编写于 最后由 编辑
      #9

      @张光璞 主要是这张卡也不便宜啊

      terryT sirwangS 2 条回复 最后回复
      0
      • A applejuice

        @张光璞 主要是这张卡也不便宜啊

        terryT 离线
        terryT 离线
        terry
        超级版主
        编写于 最后由 编辑
        #10

        @applejuice 雄起个锤子😂

        油管:https://www.youtube.com/@抡锤者

        1 条回复 最后回复
        0
        • 张光璞张 张光璞

          Intel 也要雄起了吗?

          sirwangS 离线
          sirwangS 离线
          sirwang
          超级版主
          编写于 最后由 编辑
          #11

          @张光璞 想多了。

          张光璞张 1 条回复 最后回复
          0
          • A applejuice

            @张光璞 主要是这张卡也不便宜啊

            sirwangS 离线
            sirwangS 离线
            sirwang
            超级版主
            编写于 最后由 编辑
            #12

            @applejuice 小黄鱼渠道。基本全新。不到8000,带保修。不香?~

            1 条回复 最后回复
            0
            • sirwangS sirwang

              @张光璞 想多了。

              张光璞张 离线
              张光璞张 离线
              张光璞
              劳动模范 德高望重
              编写于 最后由 编辑
              #13

              @sirwang 说:

              @张光璞 想多了。

              哈哈。蓝厂依旧扶不起,CPU再也不见i3 默秒全

              1 条回复 最后回复
              0
              • Fei YanF 离线
                Fei YanF 离线
                Fei Yan
                编写于 最后由 编辑
                #14

                所以说这个双卡究竟带来了什么提高?是推理速度还是上下文大小?能在windows docker desktop跑吗?

                张光璞张 1 条回复 最后回复
                0
                • Fei YanF Fei Yan

                  所以说这个双卡究竟带来了什么提高?是推理速度还是上下文大小?能在windows docker desktop跑吗?

                  张光璞张 离线
                  张光璞张 离线
                  张光璞
                  劳动模范 德高望重
                  编写于 最后由 编辑
                  #15

                  @Fei-Yan 说:

                  所以说这个双卡究竟带来了什么提高?是推理速度还是上下文大小?能在windows docker desktop跑吗?

                  跑起来了!

                  1 条回复 最后回复
                  0
                  • williamlouisW 在线
                    williamlouisW 在线
                    williamlouis
                    超级版主
                    编写于 最后由 编辑
                    #16

                    对已经 intel上车的同志。这是一个 灯塔。

                    个人主页:xlkj.org Telegram https://t.me/xlkjorg

                    1 条回复 最后回复
                    0
                    • K 离线
                      K 离线
                      kaifan
                      编写于 最后由 kaifan 编辑
                      #17

                      分享一下我的结果 TP=2 PCIe4.0x8 虽然是一个月前测试的了但或许能帮上忙

                      docker run -d --name vllmb70 --ipc=host --shm-size=32g --dns 192.168.1.242 --device=/dev/dri:/dev/dri --privileged -p 1234:8000 \
                        -e VLLM_WORKER_MULTIPROC_METHOD=spawn \
                        -e ZE_FLAT_DEVICE_HIERARCHY=COMPOSITE \
                        -e ZE_AFFINITY_MASK=0,1 \
                        -e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \
                        -e PYTORCH_ALLOC_CONF=expandable_segments:True \
                        -e VLLM_XPU_ENABLE_XPU_GRAPH=1 \
                        -e CCL_SYCL_ALLREDUCE_SIMPLE_THRESHOLD=4294967296 \
                        -e CCL_SYCL_REDUCE_SCATTER_SIMPLE_THRESHOLD=4294967296 \
                        -e CCL_SYCL_ALLGATHERV_SIMPLE_THRESHOLD=4294967296 \
                        -e CCL_SYCL_ALLTOALL_TMP_BUF=1 \
                        -e http_proxy= \
                        -e https_proxy= \
                        -e no_proxy= \
                        --entrypoint /bin/bash intel/llm-scaler-vllm:0.21.0-b2 -c "
                          python3 -m vllm.entrypoints.openai.api_server \
                            --model Qwen/Qwen3.8-27B-FP8 \
                            --tokenizer Qwen/Qwen3.8-27B-FP8 \
                            --gpu-memory-utilization 0.97 \
                            --max-model-len 262144 \
                            --kv-cache-dtype auto \
                            --enable-prefix-caching \
                            --enable-auto-tool-choice \
                            --tool-call-parser qwen3_coder \
                            --default-chat-template-kwargs '{\"enable_thinking\": false}' \
                            --trust-remote-code \
                            --port 8000 \
                            --tensor-parallel-size 2 \
                            --pipeline-parallel-size 1 \
                            --cudagraph-capture-sizes 1 2 4 \
                            --dtype half \
                        "
                      

                      测试结果来自3.6-27b
                      单请求:

                      • pp16384: ~2400tps
                      • tg512: 33.3tps

                      共享上下文大概480k at FP16 KV Cache,fp8的kv cache能上1M
                      在我的agent swarm 真实使用 16并行峰值能到吐字300tps
                      ···
                      (APIServer pid=1) INFO 08-03 09:00:52 [loggers.py:273] Engine 000: Avg prompt throughput: 31.9 tokens/s, Avg generation throughput: 294.1 tokens/S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 50.6%, Prefix cache hit rate: 88.0%
                      (APIServer pid=1) INFO 08-03 09:01:02 loggers py:273] Engine 000: Avg prompt throughput: 60.7 tokens/s, Avg generation throughput: 280.0 tokens /S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 52.0%, Prefix cache hit rate: 88.0%
                      ···

                      XPU Graph 有时不太稳定但大致上能接受,但是不能接受intel摆烂的态度 https://github.com/intel/llm-scaler/issues/641

                      terryT sirwangS 2 条回复 最后回复
                      1
                      • ,系统 取消固定了此主题
                      • K kaifan

                        分享一下我的结果 TP=2 PCIe4.0x8 虽然是一个月前测试的了但或许能帮上忙

                        docker run -d --name vllmb70 --ipc=host --shm-size=32g --dns 192.168.1.242 --device=/dev/dri:/dev/dri --privileged -p 1234:8000 \
                          -e VLLM_WORKER_MULTIPROC_METHOD=spawn \
                          -e ZE_FLAT_DEVICE_HIERARCHY=COMPOSITE \
                          -e ZE_AFFINITY_MASK=0,1 \
                          -e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \
                          -e PYTORCH_ALLOC_CONF=expandable_segments:True \
                          -e VLLM_XPU_ENABLE_XPU_GRAPH=1 \
                          -e CCL_SYCL_ALLREDUCE_SIMPLE_THRESHOLD=4294967296 \
                          -e CCL_SYCL_REDUCE_SCATTER_SIMPLE_THRESHOLD=4294967296 \
                          -e CCL_SYCL_ALLGATHERV_SIMPLE_THRESHOLD=4294967296 \
                          -e CCL_SYCL_ALLTOALL_TMP_BUF=1 \
                          -e http_proxy= \
                          -e https_proxy= \
                          -e no_proxy= \
                          --entrypoint /bin/bash intel/llm-scaler-vllm:0.21.0-b2 -c "
                            python3 -m vllm.entrypoints.openai.api_server \
                              --model Qwen/Qwen3.8-27B-FP8 \
                              --tokenizer Qwen/Qwen3.8-27B-FP8 \
                              --gpu-memory-utilization 0.97 \
                              --max-model-len 262144 \
                              --kv-cache-dtype auto \
                              --enable-prefix-caching \
                              --enable-auto-tool-choice \
                              --tool-call-parser qwen3_coder \
                              --default-chat-template-kwargs '{\"enable_thinking\": false}' \
                              --trust-remote-code \
                              --port 8000 \
                              --tensor-parallel-size 2 \
                              --pipeline-parallel-size 1 \
                              --cudagraph-capture-sizes 1 2 4 \
                              --dtype half \
                          "
                        

                        测试结果来自3.6-27b
                        单请求:

                        • pp16384: ~2400tps
                        • tg512: 33.3tps

                        共享上下文大概480k at FP16 KV Cache,fp8的kv cache能上1M
                        在我的agent swarm 真实使用 16并行峰值能到吐字300tps
                        ···
                        (APIServer pid=1) INFO 08-03 09:00:52 [loggers.py:273] Engine 000: Avg prompt throughput: 31.9 tokens/s, Avg generation throughput: 294.1 tokens/S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 50.6%, Prefix cache hit rate: 88.0%
                        (APIServer pid=1) INFO 08-03 09:01:02 loggers py:273] Engine 000: Avg prompt throughput: 60.7 tokens/s, Avg generation throughput: 280.0 tokens /S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 52.0%, Prefix cache hit rate: 88.0%
                        ···

                        XPU Graph 有时不太稳定但大致上能接受,但是不能接受intel摆烂的态度 https://github.com/intel/llm-scaler/issues/641

                        terryT 离线
                        terryT 离线
                        terry
                        超级版主
                        编写于 最后由 编辑
                        #18

                        @kaifan 我擦,这玩意还能凑到第二个人,佩服。你的帖子再次增加了主贴的含金量,英特尔用户可以来抄作业。

                        油管:https://www.youtube.com/@抡锤者

                        1 条回复 最后回复
                        0
                        • K kaifan

                          分享一下我的结果 TP=2 PCIe4.0x8 虽然是一个月前测试的了但或许能帮上忙

                          docker run -d --name vllmb70 --ipc=host --shm-size=32g --dns 192.168.1.242 --device=/dev/dri:/dev/dri --privileged -p 1234:8000 \
                            -e VLLM_WORKER_MULTIPROC_METHOD=spawn \
                            -e ZE_FLAT_DEVICE_HIERARCHY=COMPOSITE \
                            -e ZE_AFFINITY_MASK=0,1 \
                            -e VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 \
                            -e PYTORCH_ALLOC_CONF=expandable_segments:True \
                            -e VLLM_XPU_ENABLE_XPU_GRAPH=1 \
                            -e CCL_SYCL_ALLREDUCE_SIMPLE_THRESHOLD=4294967296 \
                            -e CCL_SYCL_REDUCE_SCATTER_SIMPLE_THRESHOLD=4294967296 \
                            -e CCL_SYCL_ALLGATHERV_SIMPLE_THRESHOLD=4294967296 \
                            -e CCL_SYCL_ALLTOALL_TMP_BUF=1 \
                            -e http_proxy= \
                            -e https_proxy= \
                            -e no_proxy= \
                            --entrypoint /bin/bash intel/llm-scaler-vllm:0.21.0-b2 -c "
                              python3 -m vllm.entrypoints.openai.api_server \
                                --model Qwen/Qwen3.8-27B-FP8 \
                                --tokenizer Qwen/Qwen3.8-27B-FP8 \
                                --gpu-memory-utilization 0.97 \
                                --max-model-len 262144 \
                                --kv-cache-dtype auto \
                                --enable-prefix-caching \
                                --enable-auto-tool-choice \
                                --tool-call-parser qwen3_coder \
                                --default-chat-template-kwargs '{\"enable_thinking\": false}' \
                                --trust-remote-code \
                                --port 8000 \
                                --tensor-parallel-size 2 \
                                --pipeline-parallel-size 1 \
                                --cudagraph-capture-sizes 1 2 4 \
                                --dtype half \
                            "
                          

                          测试结果来自3.6-27b
                          单请求:

                          • pp16384: ~2400tps
                          • tg512: 33.3tps

                          共享上下文大概480k at FP16 KV Cache,fp8的kv cache能上1M
                          在我的agent swarm 真实使用 16并行峰值能到吐字300tps
                          ···
                          (APIServer pid=1) INFO 08-03 09:00:52 [loggers.py:273] Engine 000: Avg prompt throughput: 31.9 tokens/s, Avg generation throughput: 294.1 tokens/S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 50.6%, Prefix cache hit rate: 88.0%
                          (APIServer pid=1) INFO 08-03 09:01:02 loggers py:273] Engine 000: Avg prompt throughput: 60.7 tokens/s, Avg generation throughput: 280.0 tokens /S, Running: 17 reqs, Waiting: 0 reqs, GPU KV cache usage: 52.0%, Prefix cache hit rate: 88.0%
                          ···

                          XPU Graph 有时不太稳定但大致上能接受,但是不能接受intel摆烂的态度 https://github.com/intel/llm-scaler/issues/641

                          sirwangS 离线
                          sirwangS 离线
                          sirwang
                          超级版主
                          编写于 最后由 编辑
                          #19

                          @kaifan 可以试试qwen3.8-flash-next-fp8了。 对这个有些期待,虽然暂时这个3.8-27b还是相当香的。

                          K 1 条回复 最后回复
                          0
                          • sirwangS sirwang

                            @kaifan 可以试试qwen3.8-flash-next-fp8了。 对这个有些期待,虽然暂时这个3.8-27b还是相当香的。

                            K 离线
                            K 离线
                            kaifan
                            编写于 最后由 编辑
                            #20

                            @sirwang 双卡放不下125B-FP8的模型了,四卡也跑不起来吧,看repo有186G,去掉ngram的50G还有136G呢

                            倒是在我主机跑了Q4起来,不过大部分都offload到系统内存了,大概pp 320tps tg 13tps 还不太到能用的程度

                            1 条回复 最后回复
                            0

                            你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                            厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                            有了你的建议,这篇帖子会更精彩哦 💗

                            注册 登录
                            回复
                            • 在新帖中回复
                            登录后回复
                            • 从旧到新
                            • 从新到旧
                            • 最多赞同


                            • 登录

                            • 登录或注册以进行搜索。
                            • 第一个帖子
                              最后一个帖子
                            0
                            • 版块
                            • 最新
                            • 标签
                            • 热门
                            • 用户
                            • 群组