跳转至内容
  • 首页
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

  1. 主页
  2. 版块
  3. AI硬件
  4. 交作業~新手初試X99配雙RTX2080ti 22G

交作業~新手初試X99配雙RTX2080ti 22G

已定时 已固定 已锁定 已移动 AI硬件
x99
4 帖子 2 发布者 292 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • D 离线
    D 离线
    densha
    编写于 最后由 densha 编辑
    #1

    小弟是個MIS,但因為工作環境其實很久沒有接觸新知,AI火了很多年,直到今年因為體驗過gemini雲端ai感受到AI的強大,後來開始一系列的上網看影片補知識,搭建了第一個agent應用,用hermes做我的生活助理,更是不斷讓我驚奇,之後看到老特說/掄搥者頻道又學到了很多名詞,還有一些本地AI的觀念,目前雖然調整參數什麼的還是不會,但至少有建立起非常基礎的知識了。

    前面廢話完畢,總之看了老特大神的影片,又來到論壇每天潛水,終於慢慢開始計畫弄自己的AI工作站。首先我先在FB market找到一家動畫工作室,搬走這台又大又重的退役X99工作站

    • CPU:i7-6850K (水冷一體是散熱器)
    • RAM:DDR4-2666 8G*2
    • MB:技嘉 GA-X99-ULTRA GAMING
    • POWER:EVGA 1000 G3 80 GOLD PLUS
    • SSD:自備samsung pm981a 1TB

    我另外上淘寶買了下面零件

    • E5-2680v4
    • DDR4-2400 RDIMM 32G*4
    • RTX 2080Ti 22G *2 (雙散熱器風扇,佔2.5slot),加上NVLINK 2.0組合

    這幾天終於利用下班時間慢慢升級這台洋垃圾成完全體,也一面跟gemini和hermes討論除錯,總算裝好ubuntu 24.04系統和配好環境。

    啟動腳本

    #!/bin/bash
    # llama-server - Qwen3.6-27B MTP-Q5_K_P (雙卡 NVLink)
    # 啟動:~/serve-qwen-mtp.sh
    # 停止:~/serve-stop.sh
    
    PID_FILE="/tmp/llama-server.pid"
    LOG_FILE="/tmp/llama-server.log"
    
    # 如果已經在跑,先關掉
    if [ -f "$PID_FILE" ]; then
        OLD_PID=$(cat "$PID_FILE")
        if kill -0 "$OLD_PID" 2>/dev/null; then
            echo "🔴 停止舊服務 (PID $OLD_PID)..."
            kill "$OLD_PID"
            sleep 2
            if kill -0 "$OLD_PID" 2>/dev/null; then
                kill -9 "$OLD_PID"
                sleep 1
            fi
        fi
        rm -f "$PID_FILE"
    fi
    
    # 鎖 200W 功耗
    nvidia-smi -pl 200 > /dev/null 2>&1
    
    echo "🟢 啟動 Qwen3.6-27B MTP-Q5_K_P..."
    nohup /home/user/llama.cpp.cuda/build/bin/llama-server \
      --alias qwen3.6 \
      --host 0.0.0.0 \
      --port 8080 \
      --model /home/user/models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \
      --mmproj /home/user/models/mmproj-Qwen3.6-27B-HauhauCS-Balanced-f16.gguf \
      -ngl 99 \
      -c 131072 \
      --cache-type-k q4_0 \
      --cache-type-v q4_0 \
      --spec-type draft-mtp \
      --spec-draft-n-max 2 \
      --reasoning off \
      -fa 1 \
      -ub 512 \
      -np 1 \
      -fit off \
      --image-min-tokens 1024 \
      > "$LOG_FILE" 2>&1 &
    
    NEW_PID=$!
    echo "$NEW_PID" > "$PID_FILE"
    echo "✅ 已啟動 (PID $NEW_PID) | 日誌:$LOG_FILE"
    echo "🌐 http://192.168.10.6:8080"
    

    nvidia-smi畫面,這是沒有任務時的狀態,覆載時大概會衝到50/60度c,有手動設定限制功耗上限200瓦,省點電和降低發熱,兩張卡貼的實在太近了,怕~
    nvidia-smi_2x2080ti.png

    編譯了最新的llama.cpp,雙卡文字推理生成速度
    llama.cpp_token-generate-log.png

    編譯腳本供參

    #!/bin/bash
    # llama.cpp CUDA 版更新腳本
    # 用法:~/llama-cuda-update.sh
    
    set -e
    
    LLAMA_DIR="$HOME/llama.cpp.cuda"
    BUILD_DIR="$LLAMA_DIR/build"
    CORES=$(nproc)
    
    echo "🔄 更新 llama.cpp ..."
    
    # 1. 先停止現有服務
    if [ -f /tmp/llama-server.pid ]; then
        OLD_PID=$(cat /tmp/llama-server.pid)
        if kill -0 "$OLD_PID" 2>/dev/null; then
            echo "🔴 停止現有服務 (PID $OLD_PID)..."
            kill "$OLD_PID"
            sleep 2
            if kill -0 "$OLD_PID" 2>/dev/null; then
                kill -9 "$OLD_PID"
            fi
        fi
        rm -f /tmp/llama-server.pid
    fi
    
    # 2. 拉最新原始碼
    cd "$LLAMA_DIR"
    echo "📥 git pull..."
    git pull --ff-only
    
    # 3. 重新 cmake 設定 + 編譯(CUDA 加速)
    echo "🔧 cmake 設定..."
    cd "$LLAMA_DIR"
    cmake -B build -DGGML_CUDA=ON
    echo "🔧 編譯中(使用 $CORES 線程)..."
    cmake --build build --config Release -j "$CORES"
    
    # 4. 驗證
    echo "✅ 編譯完成!"
    ls -lh "$BUILD_DIR/bin/llama-server"
    
    echo "---"
    echo "🟢 請執行以下指令重啟服務:"
    echo "   ~/llama-cuda-qwen3.6-Q5-mtp.sh"
    

    以上是粗淺的心得,速度沒有單一張7900XTX猛暴,但這老卡勝在便宜,疊兩張得到44GB VRAM,AI都給我信心加持說這已將很划算,性能表現也很正常😂 。我不知道的東西還是太多了,大部分都是問AI然後貼上,或是AI幫我改,煩請各位大神不吝賜教,謝謝。

    1 条回复 最后回复
    2
    • yu zhengyangY 离线
      yu zhengyangY 离线
      yu zhengyang
      编写于 最后由 编辑
      #2

      优化太差 https://github.com/weicj/vLLM-2080Ti-Definitive 照着抄

      1 条回复 最后回复
      2
      • D 离线
        D 离线
        densha
        编写于 最后由 densha 编辑
        #3

        感謝樓上大大,昨天跟hermes搞了一整天,抄完作業,速度提升起來,但還是遠不如該作者的每秒100t,真是夠折騰的了

        FP8 文字版 150 tokens 產出:
        #1: 3.21s → 46.7 tok/s
        #2: 3.12s → 48.1 tok/s
        #3: 3.39s → 44.3 tok/s
        ─────────────────
        穩定: ~46 tok/s ✅

        1 条回复 最后回复
        0
        • D 离线
          D 离线
          densha
          编写于 最后由 densha 编辑
          #4

          昨天又繼續跟我的hermes一起研究(其實都是它的功勞啦)報告如下👇


          雙 RTX 2080 Ti 22GB 跑 Qwen3.6 35B Coder FP8 實戰紀錄

          來源

          基於 weicj/vLLM-2080Ti-Definitive 專案的 profile 與 launcher。

          硬體

          • 2× RTX 2080 Ti 22GB + NVLink
          • GPU 功耗上限 200W

          模型

          Jackrong/Qwopus3.6-35B-A3B-Coder-FP8(約 35GB)

          • MoE 架構,35B 總參數 / 3B 激活
          • FP8 量化,純文字版
          • 支援 256K context(FP16 KV cache)
          • 支援 Function Calling(tool-call-parser: qwen3_coder)

          啟動參數

          項目 值
          Profile qwen35b/normal/fp8/fp16kv-256K-nomtp-text-only.env
          GPU CUDA_VISIBLE_DEVICES=0,1 (TP=2)
          量化 FP8
          Context 262144 tokens (256K)
          KV cache FP16
          MTP 0(無多 token 預測)
          Reasoning OFF(enable_thinking=false)
          Chat Template froggeric-v21(修復版)
          Tool Call Parser qwen3_coder

          Chat Template

          使用 froggeric/Qwen-Fixed-Chat-Templates v21.3

          修復官方 Qwen template 的多項問題:

          • 禁用強制思考模式(enable_thinking=false)
          • 修復 KV cache 失效問題
          • 優化 Jinja 渲染效能

          實際測試速度表現

          Prompt: 寫一篇 2000 字的小說,故事要完整,有開頭結尾
          輸出: 2132 字中文字
          Token: 1384 completion tokens
          花費: 15.14 秒
          速度: 91.4 tok/s
          結束: stop(自然結束)

          項目 數據
          生成速度(暖機後) 91.4 tok/s
          TTFT(首個 token) ~11ms
          最大小說產出 2132 字 / 1384 tokens / 15.14s

          我滿足了🙏

          1 条回复 最后回复
          1

          你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

          厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

          有了你的建议,这篇帖子会更精彩哦 💗

          注册 登录
          回复
          • 在新帖中回复
          登录后回复
          • 从旧到新
          • 从新到旧
          • 最多赞同


          • 登录

          • 没有帐号? 注册

          • 登录或注册以进行搜索。
          • 第一个帖子
            最后一个帖子
          0
          • 首页
          • 版块
          • 最新
          • 标签
          • 热门
          • 用户
          • 群组