谢谢你的建议。不过是怎么知道 dgx spark 不适合跑稠密模型?还请大神赐点高建。
chrestkoo dev
@chrestkoo dev
-
DGX Spark - MSI Edgexpert -
DGX Spark - MSI Edgexpert@imbiplaza-ASUS 是的。就是他的架构关系。导致现在这样
-
DGX Spark - MSI Edgexpert@kos-or 我还没使用这个 qwen 3.8 之前是使用 Qwen3.6-35B-A3B。用的很好。很顺。
我个人觉得普通用还可以。复杂一点的话就要用到 skill, script 强制做对。这是我的 podman 配置:
name: edgeexpert-reasoning services: reasoning-vlm: image: ${REASONING_VLLM_IMAGE:-vllm/vllm-openai:latest} container_name: edgeexpert-reasoning-vlm restart: unless-stopped gpus: all ipc: host ports: - "${BIND_ADDRESS:-0.0.0.0}:8000:8000" environment: HF_TOKEN: ${HF_TOKEN:?Set HF_TOKEN in the .env file} VLLM_API_KEY: ${VLLM_API_KEY:?Set VLLM_API_KEY in the .env file} volumes: - ${HF_CACHE_DIR:-/home/koo/.cache/huggingface}:/root/.cache/huggingface command: - ${REASONING_MODEL:-nvidia/Qwen3.6-35B-A3B-NVFP4} - --served-model-name - ${REASONING_SERVED_MODEL_NAME:-nvidia/Qwen3.6-35B-A3B-NVFP4} - --host - "0.0.0.0" - --port - "8000" - --tensor-parallel-size - "1" - --trust-remote-code - --kv-cache-dtype - fp8 - --attention-backend - flashinfer - --moe-backend - marlin - --gpu-memory-utilization - ${REASONING_GPU_MEMORY_UTILIZATION:-0.4} - --max-model-len - "262144" - --max-num-seqs - ${REASONING_MAX_NUM_SEQS:-8} - --max-num-batched-tokens - "8192" - --enable-chunked-prefill - --async-scheduling - --enable-prefix-caching - --speculative-config - '{"method":"mtp","num_speculative_tokens":3,"moe_backend":"triton"}' - --load-format - fastsafetensors - --reasoning-parser - qwen3 - --tool-call-parser - qwen3_xml - --enable-auto-tool-choice healthcheck: test: - CMD-SHELL - >- python3 -c "import urllib.request; urllib.request.urlopen('http://127.0.0.1:8000/health', timeout=5)" interval: 30m timeout: 10s retries: 3 start_period: 30m还没用过 ornith-ai/Ornith-1.5-35B-A3B。请问有谁用过这个吗?
-
DGX Spark - MSI EdgexpertDGX Spark - MSI Edgexpert
- 打算使用单机跑 Qwen3.8。可以参考配置如下:
之前试过了 vllm 配置。不行。太慢了。不现实。
主要用意是在Hermes agent 使用。可是我试跑后不是很理想。我相信是我的配置问题?
请求
有哪位大神可以帮帮忙。