跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
_折騰__

_折騰_

@_折騰_
取消关注 关注
关于
帖子
10
主题
2
分享
0
群组
0
粉丝
1
关注
0

帖子

最新 最佳 有争议的

  • qwen3.8-27b-w4a16-awq 已经持续跑了15个小时了
    _折騰__ _折騰_

    从dflash2换到dspark,代码的质量感觉上了一个台阶。
    速度从110 t/s 掉到平均 85 t/s 还是可以的,任务量不小,一直在跟踪进度,react 转 react native web。
    b47f239a-ed58-4e22-ac8c-843b32a73417-image.jpeg

    AI Agent qwen-27b 量化 本地模型

  • Qwen releases Qwen3.8-Flash-Next! 來了
    _折騰__ _折騰_

    RTX PRO 6000 跑起来都累,27B养老吧!

    LLM讨论区 qwen

  • 4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ
    _折騰__ _折騰_

    llama.app Qwen3.8 27B Q6K DFlash2 实测速度也还可以,持续写入平均在96 tok/s 上下浮动,Q6模型比W4A16-AWQ的精度高出1%-2%(理论值,实际感知不大),但模型大小多出8个G左右。 两个模型目前基本达到理想配置了,已经没有能力再提升了。

    AI Agent rtx4090 sg-lang dflash

  • M5 Max/Ultral AI性能强悍?苹果、AMD、英伟达AI小主机AI性能全面分析,潜力很大但统一内存并非万能!
    _折騰__ _折騰_

    朋友M5 MACBOOK 128G 跑27B都非常拉夸,不是硬件不行,而是目前配套框架还不给力,看着我的4090的速度,他直掉眼泪。。。

    AI硬件 mac amd nvidia

  • 4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ
    _折騰__ _折騰_

    @xiaote 正常编码没问题,效果很好。但尝试以下提示词时,会长时间思考最终因为思考过长,已达到输出 token 上限回答被截断,试过pi hsd都无法正常回答并开始任务,连续4轮思考都被截断了,以下是提示词:使用html单文件写一个超级马里奥的游戏,要保证游戏细节,可玩性,不要脱离原版游戏的体验,尽可能还原所有细节。
    有没有成功的?

    实测开启 HiCache 输出速度会砍掉一半!

    AI Agent rtx4090 sg-lang dflash

  • 4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ
    _折騰__ _折騰_

    根据 xiaote 的建议,这是目前测试下来我认为最优的启动参数了,目前实际测下来 11 轮 · 373 步 首 token 平均 1.9s · 112 tok/s

    #!/usr/bin/env bash

    SGLang + DFlash2 投机解码

    set -euo pipefail

    ROOT_DIR="$(cd "$(dirname "${BASH_SOURCE[0]}")/.." && pwd)"
    VENV_DIR="${ROOT_DIR}/venv"
    MODEL_DIR="${ROOT_DIR}/models"

    MODEL_PATH="${MODEL_PATH:-${MODEL_DIR}/Qwen3.8-27B-W4A16-AWQ}"

    DFlash2 草稿模型

    DRAFT_MODEL_PATH="${DRAFT_MODEL_PATH:-${MODEL_DIR}/Qwen3.8-27B-DFlash2-FP8-tcclaviger}"
    DRAFT_QUANTIZATION="${DRAFT_QUANTIZATION:-fp8}"

    SERVED_MODEL_NAME="${SERVED_MODEL_NAME:-qwen3.8-27b-w4a16-awq-dflash2}"
    CONTEXT_LENGTH="${CONTEXT_LENGTH:-163840}"
    KV_CACHE_DTYPE="${KV_CACHE_DTYPE:-bfloat16}"
    MEM_FRACTION_STATIC="${MEM_FRACTION_STATIC:-0.91}"
    MAX_TOTAL_TOKENS="${MAX_TOTAL_TOKENS:-163840}"
    DRAFT_TOKENS="${DRAFT_TOKENS:-8}"
    CHUNKED_PREFILL_SIZE="${CHUNKED_PREFILL_SIZE:-4096}"
    MAX_PREFILL_TOKENS="${MAX_PREFILL_TOKENS:-16384}"
    RANDOM_SEED="${RANDOM_SEED:-123456789}"
    HOST="${HOST:-0.0.0.0}"
    PORT="${PORT:-8199}"
    API_KEY="${API_KEY:-dummy}"
    LOG_FILE="${LOG_FILE:-${ROOT_DIR}/logs/sglang-dflash2.log}"

    CUDA 13.3

    export CUDA_HOME="${CUDA_HOME:-/home/root1/code/llm/cuda-toolkit}"
    export PATH="${CUDA_HOME}/bin:${PATH}"
    export LD_LIBRARY_PATH="${CUDA_HOME}/lib:${LD_LIBRARY_PATH:-}"

    for p in "${MODEL_PATH}" "${DRAFT_MODEL_PATH}"; do
    if [[ ! -e "${p}" ]]; then
    echo "模型文件缺失: ${p}" >&2
    exit 1
    fi
    done

    if ss -ltn "sport = :${PORT}" | tail -n +2 | grep -q .; then
    echo "端口 ${PORT} 已被占用" >&2
    exit 2
    fi

    mkdir -p "$(dirname "${LOG_FILE}")"

    echo "启动 ${SERVED_MODEL_NAME} @ ${HOST}:${PORT} (ctx=${CONTEXT_LENGTH}, DFLASH2, kv=${KV_CACHE_DTYPE})"
    exec "${VENV_DIR}/bin/python" -m sglang.launch_server
    --model-path "${MODEL_PATH}"
    --served-model-name "${SERVED_MODEL_NAME}"
    --speculative-algorithm DFLASH
    --speculative-draft-model-path "${DRAFT_MODEL_PATH}"
    --speculative-num-draft-tokens "${DRAFT_TOKENS}"
    --speculative-draft-model-quantization "${DRAFT_QUANTIZATION}"
    --tool-call-parser qwen3_coder
    --reasoning-parser qwen3
    --default-chat-template-kwargs '{"reasoning_effort":"medium"}'
    --attention-backend flashinfer
    --speculative-draft-attention-backend triton
    --linear-attn-backend triton
    --chunked-prefill-size "${CHUNKED_PREFILL_SIZE}"
    --max-prefill-tokens "${MAX_PREFILL_TOKENS}"
    --mamba-radix-cache-strategy extra_buffer_lazy
    --max-mamba-cache-size 12
    --cuda-graph-max-bs-decode 8
    --context-length "${CONTEXT_LENGTH}"
    --kv-cache-dtype "${KV_CACHE_DTYPE}"
    --mem-fraction-static "${MEM_FRACTION_STATIC}"
    --max-total-tokens "${MAX_TOTAL_TOKENS}"
    --random-seed "${RANDOM_SEED}"
    --host "${HOST}"
    --port "${PORT}"
    --api-key "${API_KEY}"
    --sleep-on-idle
    --enable-cache-report
    --enable-metrics
    --log-level info > "${LOG_FILE}" 2>&1

    AI Agent rtx4090 sg-lang dflash

  • 4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ
    _折騰__ _折騰_

    @terry 就是想再压榨一下4090的性能吧,肯定想越快越好,稍后我再测试几组参数,晚些把完整启动脚本贴出来。

    AI Agent rtx4090 sg-lang dflash

  • 4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ
    _折騰__ _折騰_

    @Xiaote 我使用的是https://huggingface.co/philbert440/Qwen3.8-27B-W4A16-AWQ/tree/main 模型,大小18.7 GB,感觉质量上与Q6感觉不出大的区别。我会按你的建议进行实测一下。非常感谢!

    AI Agent rtx4090 sg-lang dflash

  • SGLang HiCache实测:KV缓存放进内存和SSD,多开Agent终于舒服了,5090/RTX Pro5000/4080S 32G/4090 48G等显卡福音!
    _折騰__ _折騰_

    实测开启--hicache-size tok/s 掉的太厉害,直接打折。。。

    AI Agent sg-lang rtx5090 rtxpro5000

  • 4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ
    _折騰__ _折騰_

    这个速度还有没有提升空间了?同配置同模型下,还有更高的token速度吗?请晒出参数,学习一下。

    配置:4090 魔改48GB 64GB内存
    SGlang版本:0.5.19.dev20260825+g1fa32d50e1
    实测DSH,长时间多轮写码 平均 110 tok/s
    参数:
    │ --model-path /home/root1/code/llm/sglang/models/Qwen3.8-27B-W4A16-AWQ
    │ --served-model-name qwen3.8-27b-w4a16-awq-dflash2
    │ --speculative-algorithm DFLASH
    │ --speculative-draft-model-path /home/root1/code/llm/sglang/models/Qwen3.8-27B-DFlash2
    │ --speculative-num-draft-tokens 8
    │ --speculative-draft-model-quantization unquant
    │ --default-chat-template-kwargs {"reasoning_effort":"medium"}
    │ --attention-backend flashinfer(主模型)
    │ --speculative-draft-attention-backend triton(草稿,滑窗)
    │ --linear-attn-backend triton(GDN/mamba 层)
    │ --context-length 250000
    │ --kv-cache-dtype fp8_e4m3
    │ --mem-fraction-static 0.75
    │ --max-total-tokens 240000

    ScreenShot_2026-08-26_223757_815.png

    AI Agent rtx4090 sg-lang dflash
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组