跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
chrestkoo devC

chrestkoo dev

@chrestkoo dev
取消关注 关注
关于
帖子
4
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • DGX Spark - MSI Edgexpert
    chrestkoo devC chrestkoo dev

    @Rex-Fan

    谢谢你的建议。不过是怎么知道 dgx spark 不适合跑稠密模型?还请大神赐点高建。

    AI硬件 dgxspark

  • DGX Spark - MSI Edgexpert
    chrestkoo devC chrestkoo dev

    @imbiplaza-ASUS 是的。就是他的架构关系。导致现在这样

    AI硬件 dgxspark

  • DGX Spark - MSI Edgexpert
    chrestkoo devC chrestkoo dev

    @kos-or 我还没使用这个 qwen 3.8 之前是使用 Qwen3.6-35B-A3B。用的很好。很顺。
    我个人觉得普通用还可以。复杂一点的话就要用到 skill, script 强制做对。

    这是我的 podman 配置:

    name: edgeexpert-reasoning
    
    services:
      reasoning-vlm:
        image: ${REASONING_VLLM_IMAGE:-vllm/vllm-openai:latest}
        container_name: edgeexpert-reasoning-vlm
        restart: unless-stopped
        gpus: all
        ipc: host
        ports:
          - "${BIND_ADDRESS:-0.0.0.0}:8000:8000"
        environment:
          HF_TOKEN: ${HF_TOKEN:?Set HF_TOKEN in the .env file}
          VLLM_API_KEY: ${VLLM_API_KEY:?Set VLLM_API_KEY in the .env file}
        volumes:
          - ${HF_CACHE_DIR:-/home/koo/.cache/huggingface}:/root/.cache/huggingface
        command:
          - ${REASONING_MODEL:-nvidia/Qwen3.6-35B-A3B-NVFP4}
          - --served-model-name
          - ${REASONING_SERVED_MODEL_NAME:-nvidia/Qwen3.6-35B-A3B-NVFP4}
          - --host
          - "0.0.0.0"
          - --port
          - "8000"
          - --tensor-parallel-size
          - "1"
          - --trust-remote-code
          - --kv-cache-dtype
          - fp8
          - --attention-backend
          - flashinfer
          - --moe-backend
          - marlin
          - --gpu-memory-utilization
          - ${REASONING_GPU_MEMORY_UTILIZATION:-0.4}
          - --max-model-len
          - "262144"
          - --max-num-seqs
          - ${REASONING_MAX_NUM_SEQS:-8}
          - --max-num-batched-tokens
          - "8192"
          - --enable-chunked-prefill
          - --async-scheduling
          - --enable-prefix-caching
          - --speculative-config
          - '{"method":"mtp","num_speculative_tokens":3,"moe_backend":"triton"}'
          - --load-format
          - fastsafetensors
          - --reasoning-parser
          - qwen3
          - --tool-call-parser
          - qwen3_xml
          - --enable-auto-tool-choice
    
        healthcheck:
          test:
            - CMD-SHELL
            - >-
              python3 -c "import urllib.request;
              urllib.request.urlopen('http://127.0.0.1:8000/health', timeout=5)"
    
          interval: 30m
          timeout: 10s
          retries: 3
          start_period: 30m
    
    

    还没用过 ornith-ai/Ornith-1.5-35B-A3B。请问有谁用过这个吗?

    AI硬件 dgxspark

  • DGX Spark - MSI Edgexpert
    chrestkoo devC chrestkoo dev

    DGX Spark - MSI Edgexpert

    • 打算使用单机跑 Qwen3.8。可以参考配置如下:

    https://lmsysorg.mintlify.app/cookbook/autoregressive/Qwen/Qwen3.8-27B#hw=dgx-spark&variant=default&quant=nvfp4-fp4-head&nodes=single&spec=dflash&tier=low-latency&ssmDtype=bfloat16

    之前试过了 vllm 配置。不行。太慢了。不现实。

    主要用意是在Hermes agent 使用。可是我试跑后不是很理想。我相信是我的配置问题?

    请求🙏有哪位大神可以帮帮忙。

    AI硬件 dgxspark
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组