跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

用户名违规用

用户名违规

@用户名违规
取消关注 关注
关于
帖子
22
主题
1
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 交作业:X99 CD3+E5 2666 +128G DDR3 + AMD AI Pro 9700,成功安装ubuntu,等不及跟大家分享。后续再更新
    用户名违规用 用户名违规

    @Chungen-Jiang

    R9700 很奇葩的设计,峰值会100°,,然后还不oom。神奇吧。。只要开任务核心就100°。。

    AI硬件 amd r9700

  • SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置
    用户名违规用 用户名违规

    @applejuice 你是啥显卡。两张3090?

    LLM讨论区 sg-lang qwen3.6-27b

  • SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置
    用户名违规用 用户名违规

    @terry

    #!/bin/bash
    # Qwen3.6-27B-Fable Q6_K — llama.cpp 启动配置(优化版)
    # GPU: RTX 4090D (48G) | 模型: 64 层混合 (16 Full Attention + 48 SSM)
    # 目标:全 GPU 卸载,0 层在 CPU
    # 优化:Q8_0→Q6_K + KV q4_0 + 线程调优,目标 25-28 t/s
    
    set -e
    
    # ═══════════════════════════════════════════
    # 参数说明(每个都加注释)
    # ═══════════════════════════════════════════
    
    MODEL="/mnt/dataM4/models/Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-Q8_0.gguf"
    
    # --gpu-layers 64: 全部 64 层都加载到 GPU 显存(不卸载到 CPU)
    # 如果设 32 就只有前 32 层在 GPU,后 32 层在 CPU,速度减半
    GPU_LAYERS=64
    
    # --ctx-size 262144: 上下文窗口 262K tokens(模型原生支持 262144)
    # 显存开销:KV Cache ~8GB(q8_0 量化)
    CTX_SIZE=262144
    
    # --batch-size 8192: 逻辑 batch(prefill 阶段一次处理多少 token)
    # 决定 prompt 阶段的速度,越大 prefilled 越快
    BATCH_SIZE=8192
    
    # --ubatch-size 4096: 物理 batch(GPU 计算缓冲大小)
    # GPU 内存里同时计算的 token 数,不超过显存
    UBATCH_SIZE=4096
    
    # --threads 6: 生成阶段 CPU 线程数(每生成 1 个 token)
    # 纯 GPU 时影响不大,设小点省 CPU,避免线程调度开销
    THREADS=6
    
    # --threads-batch 8: Prefill 阶段 CPU 线程数(处理 prompt)
    # 降低到 8,减少 CPU 竞争,GPU 是瓶颈不是 CPU
    THREADS_BATCH=8
    
    # --temp 0.7: 采样温度(0=确定性强,1.0=随机性强)
    TEMP=0.6
    
    # --top-p 0.95: Nucleus 采样,累积概率到 0.95 截断
    TOP_P=0.95
    
    # --top-k 20: 只选概率最高的 20 个 token 参与采样
    TOP_K=20
    
    # --flash-attn on: 开启 Flash Attention(RTX 4090D SM89 原生支持)
    # 对 Qwen3.5 混合架构的 Full Attention 层有显著加速
    FLASH_ATTN=on
    
    # --cache-type-k/v q4_0: KV Cache 用 Q4_0 量化(大幅降低带宽压力)
    # 实测:q4_0 KV cache 对生成质量影响<1%,但 decode 速度提升 10-15%
    # bf16=16bit(大精度), q8_0=8bit, q4_0=4bit(最佳性价比)
    CACHE_TYPE=q8_0
    
    # --port 11434: 默认 Ollama 兼容端口
    PORT=11434
    
    # ═══════════════════════════════════════════
    # 启动命令 — 全 GPU,无 CPU offload
    # ═══════════════════════════════════════════
    
    exec llama-server \
      --model "$MODEL" \
      --port "$PORT" \
      --ctx-size "$CTX_SIZE" \
      --batch-size "$BATCH_SIZE" \
      --ubatch-size "$UBATCH_SIZE" \
      --gpu-layers "$GPU_LAYERS" \
      --threads "$THREADS" \
      --threads-batch "$THREADS_BATCH" \
      --temp "$TEMP" \
      --top-p "$TOP_P" \
      --top-k "$TOP_K" \
      --flash-attn "$FLASH_ATTN" \
      --cache-type-k "$CACHE_TYPE" \
      --cache-type-v "$CACHE_TYPE" \
      --no-mmap \
      --mlock
      -ngl 99
    

    ,你llamacpp 跑45t/s?贴一下参数呗,有点夸张啊,我怎么设置都上不去。我是按照sglang的思路设置的。不开MTP45t/s 很顶啊。prefill cpp确实不快。我用sglang显存很容易到47G。你这个占用只有41.5g,咋配置的。?sglang 频繁上下文 prefill 也解决了。基本上随便浪了。命中率99%

    LLM讨论区 sg-lang qwen3.6-27b

  • SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置
    用户名违规用 用户名违规

    @566656661 这个不知道,我起手就用的sglang。vllm和llamacpp速度太慢了,用了sglang回不去了。

    LLM讨论区 sg-lang qwen3.6-27b

  • SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置
    用户名违规用 用户名违规

    @fcme 基本上没找到。。没有可信信息。

    LLM讨论区 sg-lang qwen3.6-27b

  • SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置
    用户名违规用 用户名违规

    @fcme 其实我想知道,别人的4090最顶的能跑多少,不知道是不是我的参数不太对。

    LLM讨论区 sg-lang qwen3.6-27b

  • SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置
    用户名违规用 用户名违规

    @terry prefill 1800-1400平均值。但是这个值我就是不清楚在4090D上面属于什么水平。cpp跑只有几百,vllm好像也不太行。

    LLM讨论区 sg-lang qwen3.6-27b

  • 8g的HBM矿卡170hx解封了
    用户名违规用 用户名违规

    不是很理解是,是板载只有8G,还是有32-80G,只能使用8G?

    AI硬件

  • 超微7049 塔式服务器,搭配什么显卡稳定+运算能力出众呢?
    用户名违规用 用户名违规

    跑大模型核心问题的显存墙,买显卡直接看那个显存速度快买那个,什么算力都都是浮云。算力都不是问题,问题再显存速率上。

    AI硬件

  • SGLANG跑RTX4090D-48G-QWEN3.6-27B-FP8配置
    用户名违规用 用户名违规

    硬件环境:
    CPU:2667v2x2
    RAM:DDR3 128G(1066)
    GF:RTX4090D-48G
    SGlang 上下文:500K,上下文内容100-200k也能保持28t/s的推理速度
    模型:Qwen3.6-27B-FP8
    SGLANG顶峰值解码速度32/s,平均值28t/s,Prefill速度:1400-1600t/s。
    和VLLM、llamacpp对比,快大概百分之30-50%。
    吐槽一下llamacpp,15t/s的解码速率,gguf得多差啊!还是只有我这样配置问题?
    vllm还在测试中。。

    #!/bin/bash
    # SGLang 0.5.15 — sglang serve
    # Qwen3.6-27B-MTP | RTX 4090D 48G
    set -euo pipefail
    
    readonly SGLANG_VENV="/mnt/dataM4/venv_sglang"
    readonly MODEL_PATH="/mnt/dataM4/models/Qwen3.6-27B-AEON-Ultimate-Uncensored-FP8-MTP"
    
    export HF_HOME="/root/.cache/huggingface"
    export TRITON_CACHE_DIR="/root/sglang_cache/triton/cache"
    export TORCHINDUCTOR_CACHE_DIR="/root/sglang_cache/torch_compile"
    export FLASH_ATTENTION_CUTE_CACHE_DIR="/root/sglang_cache/flash_attn_cute_cache"
    
    export CUDA_HOME=/usr/local/cuda-12.8
    export PATH="$CUDA_HOME/bin:$PATH"
    export LD_LIBRARY_PATH="$CUDA_HOME/lib64"
    export LD_LIBRARY_PATH="/mnt/dataM4/venv_sglang/lib/python3.11/site-packages/nvidia/cusparselt/lib:$LD_LIBRARY_PATH"
    export CUDAHOSTCXX=/usr/bin/gcc-12
    export CC=/usr/bin/gcc-12
    export CXX=/usr/bin/g++-12
    
    # 🔴 修正拼写
    export PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True"
    export CUDA_DEVICE_ORDER="PCI_BUS_ID"
    export CUDA_VISIBLE_DEVICES="0"
    export FLASHINFER_DISABLE_VERSION_CHECK=1
    export FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1
    
    source "${SGLANG_VENV}/bin/activate"
    
    SGLANG_ARGS=(
      --model-path "${MODEL_PATH}"
      --host 0.0.0.0
      --port 30000
      --trust-remote-code
      --tp-size 1
      --attention-backend flashinfer
      --mamba-backend flashinfer
      --kv-cache-dtype fp8_e4m3
      --page-size 8
      --mem-fraction-static 0.94
      --max-running-requests 2
      --prefill-max-requests 1
      --schedule-policy lpm
      --schedule-conservativeness 1
      --mamba-radix-cache-strategy extra_buffer
      --mamba-ssm-dtype bfloat16
      --mamba-full-memory-ratio 0.08
      --tool-call-parser qwen3_coder
      --reasoning-parser qwen3
      --preferred-sampling-params '{"temperature": 0.6, "repetition_penalty": 1.2, "frequency_penalty": 0.5, "presence_penalty": 0.3}'
      --chunked-prefill-size 4096
      --max-prefill-tokens 8192
      --context-length 262144
      --radix-eviction-policy lru
      --cuda-graph-max-bs-decode 2
      --cuda-graph-bs-decode 1 2
      #--enable-metrics
      #--enable-streaming-session
      #--enable-request-time-stats-logging
      #--log-requests
      --log-requests-level 0
      --decode-log-interval 300  # 🟡 降低日志频率
      # 🟢 關閉 Uvicorn Access Log (排除所有路徑)
      --uvicorn-access-log-exclude-prefixes /
    )
    
    # 🟡 日志改到磁盘,避免占用系统内存
    readonly SGLOG="/dev/shm/sglang/sglang.log"
    mkdir -p "$(dirname "$SGLOG")"
    
    # 日志轮转
    if ! pgrep -f sglang_log_rotate > /dev/null 2>&1; then
        nohup bash /root/sglang_log_rotate.sh >/dev/null 2>&1 &
    fi
    
    exec sglang serve "${SGLANG_ARGS[@]}" >>"$SGLOG" 2>&1
    
    
    LLM讨论区 sg-lang qwen3.6-27b

  • 双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功
    用户名违规用 用户名违规

    @terry 你不打算开的个电报群嘛,

    LLM讨论区 r9700 ai-pro-r9700 sg-lang

  • 双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功
    用户名违规用 用户名违规

    @smax 用越狱的FP8的都还不错,MTP真不能开,模型的原理是概率推测,TMP开启后会导致幻觉增加的风险,原因很简单,在模型推理里面错一个字后面的内容就往错的方向发展了。只有一个一个字的推,才能保证幻觉最低。

    LLM讨论区 r9700 ai-pro-r9700 sg-lang

  • 4080&4090不同模型token性能测试
    用户名违规用 用户名违规

    4090-FP8-无MTP能跑37token?这不科学呀。是不是我看错了?我顶天就32t/s,是不是我哪里设置不对呀。

    LLM讨论区

  • AMD AI Pro R9700 LLM调教
    用户名违规用 用户名违规

    @fcme 我意思是你指的PP具体是什么,是那个PP512 1024 2048吗?

    LLM讨论区 r9700 ai-pro-r9700 amd

  • 双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功
    用户名违规用 用户名违规

    R97002双卡,太拉夸了。我sglang R97002,第二天就退了。直入了4090D-48G,不开加速SGLANG 32t/s,开了MTP60-80t/s,chunk 4K\8K\16K速度在1400-1500t/s的样子。。不过sglang的mtp开启后命中降低得不偿失。现在考虑关闭MTP。。

    LLM讨论区 r9700 ai-pro-r9700 sg-lang

  • AMD AI Pro R9700 LLM调教
    用户名违规用 用户名违规

    @fcme PP怎么测试,sglang ,prefill每次16K或者8K,prefill beth在1000-1400t/s,说的是这个吗?

    LLM讨论区 r9700 ai-pro-r9700 amd

  • AMD AI Pro R9700 LLM调教
    用户名违规用 用户名违规

    @fcme PP不知道150K上下文速度能打50t/s,200k的上下文时候大概也是在50t/s,这个有mtp。如果不开MTP稳定100K内31t/s,超过150k 27t/s的样子。速度不能和云API对比

    LLM讨论区 r9700 ai-pro-r9700 amd

  • AMD AI Pro R9700 LLM调教
    用户名违规用 用户名违规

    这个是我调了一周的sglang配置。
    主要目的是单线程,没有MTP,速度30t/s,有500K上下文。
    上了MTP,速度有60t/s,有300k上下文。最主要的是QWEN3.6-27B-FP8也不聪明。。但是又觉得有时候比云API聪明。
    主要是我的soul。md 明确了,所有问题优先社区找到答案。。处理问题的能力提升了一些。

    #!/bin/bash
    # SGLang 0.5.15 — sglang serve (官方推荐方式)
    # Qwen3.6-27B-MTP | RTX 4090D 48G
    set -euo pipefail
    
    # 路径与环境
    readonly SGLANG_VENV="/mnt/dataM4/venv_sglang"
    readonly MODEL_PATH="/mnt/dataM4/models/Qwen3.6-27B-AEON-Ultimate-Uncensored-FP8-MTP"
    
    export HF_HOME="/root/.cache/huggingface"
    export TRITON_CACHE_DIR="/root/sglang_cache/triton/cache"
    export TORCHINDUCTOR_CACHE_DIR="/root/sglang_cache/torch_compile"
    export FLASH_ATTENTION_CUTE_CACHE_DIR="/root/sglang_cache/flash_attn_cute_cache"
    
    export CUDA_HOME=/usr/local/cuda-12.8
    export PATH="$CUDA_HOME/bin:$PATH"
    export LD_LIBRARY_PATH="$CUDA_HOME/lib64"
    export LD_LIBRARY_PATH="/mnt/dataM4/venv_sglang/lib/python3.11/site-packages/nvidia/cusparselt/lib:$LD_LIBRARY_PATH"
    export CUDAHOSTCXX=/usr/bin/gcc-12
    export CC=/usr/bin/gcc-12
    export CXX=/usr/bin/g++-12
    
    export PYTORCH_ALLOC_CONF="expandable_segments:True"
    export CUDA_DEVICE_ORDER="PCI_BUS_ID"
    export CUDA_VISIBLE_DEVICES="0"
    export FLASHINFER_DISABLE_VERSION_CHECK=1
    export FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1
    
    source "${SGLANG_VENV}/bin/activate"
    
    SGLANG_ARGS=(
      --model-path "${MODEL_PATH}"
      --host 0.0.0.0
      --port 30000
      --trust-remote-code
      --tp-size 1
      --attention-backend flashinfer
      --mamba-backend flashinfer
      --kv-cache-dtype fp8_e4m3
      --page-size 16
      --mem-fraction-static 0.93
      --max-running-requests 1
      --prefill-max-requests 1
      --schedule-policy lpm
      --schedule-conservativeness 1.0
      --mamba-radix-cache-strategy extra_buffer
      --mamba-ssm-dtype bfloat16
      --mamba-full-memory-ratio 0.08
      --speculative-algorithm nextn
      --speculative-num-steps 2
      --speculative-eagle-topk 1
      --speculative-num-draft-tokens 2
      --tool-call-parser qwen3_coder
      --reasoning-parser qwen3
      --preferred-sampling-params '{"temperature": 0.7, "repetition_penalty": 1.2, "frequency_penalty": 0.5, "presence_penalty": 0.3}'
      --enable-dynamic-chunking
      --chunked-prefill-size 16384
      --radix-eviction-policy lru
      --enable-metrics
      --enable-streaming-session
      --enable-request-time-stats-logging
      --log-requests
      --log-requests-level 0
      --decode-log-interval 60
    )
    
    # 启动
    readonly SGLOG="/dev/shm/sglang/sglang.log"
    mkdir -p "$(dirname "$SGLOG")"
    
    # 日志轮转
    if ! pgrep -f sglang_log_rotate > /dev/null 2>&1; then
        nohup bash /root/sglang_log_rotate.sh >/dev/null 2>&1 &
    fi
    
    exec sglang serve "${SGLANG_ARGS[@]}" >>"$SGLOG" 2>&1
    
    
    LLM讨论区 r9700 ai-pro-r9700 amd

  • AMD AI Pro R9700 LLM调教
    用户名违规用 用户名违规

    京东自营买的的这个卡,到手一天后,自己退货了。奇葩的是,32g,是真的到高不下的。。最后换了48g。

    LLM讨论区 r9700 ai-pro-r9700 amd

  • hermes还真的有个DeepSeek
    用户名违规用 用户名违规

    现在的用法是,hermes main跑deepseek v4 flash 1m缓存调用。所有的执行全是本地QWEN3.6 27B执行,v4只需要大脑拆分任务和调用,hermes main直接禁用所有工具只允许调度。。速度上天了。在也不担心上下文了。最主要的是,解放了本地模型的上下文焦虑。v4召回准确度又很无解。7个小时任务跑下来不到1毛钱。。

    LLM讨论区 hermes deepseek
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组