跳转至内容
  • 首页
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

D

densha

@densha
取消关注 关注
关于
帖子
16
主题
3
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 交作業~新手初試X99配雙RTX2080ti 22G
    D densha

    小弟是個MIS,但因為工作環境其實很久沒有接觸新知,AI火了很多年,直到今年因為體驗過gemini雲端ai感受到AI的強大,後來開始一系列的上網看影片補知識,搭建了第一個agent應用,用hermes做我的生活助理,更是不斷讓我驚奇,之後看到老特說/掄搥者頻道又學到了很多名詞,還有一些本地AI的觀念,目前雖然調整參數什麼的還是不會,但至少有建立起非常基礎的知識了。

    前面廢話完畢,總之看了老特大神的影片,又來到論壇每天潛水,終於慢慢開始計畫弄自己的AI工作站。首先我先在FB market找到一家動畫工作室,搬走這台又大又重的退役X99工作站

    • CPU:i7-6850K (水冷一體是散熱器)
    • RAM:DDR4-2666 8G*2
    • MB:技嘉 GA-X99-ULTRA GAMING
    • POWER:EVGA 1000 G3 80 GOLD PLUS
    • SSD:自備samsung pm981a 1TB

    我另外上淘寶買了下面零件

    • E5-2680v4
    • DDR4-2400 RDIMM 32G*4
    • RTX 2080Ti 22G *2 (雙散熱器風扇,佔2.5slot),加上NVLINK 2.0組合

    這幾天終於利用下班時間慢慢升級這台洋垃圾成完全體,也一面跟gemini和hermes討論除錯,總算裝好ubuntu 24.04系統和配好環境。

    啟動腳本

    #!/bin/bash
    # llama-server - Qwen3.6-27B MTP-Q5_K_P (雙卡 NVLink)
    # 啟動:~/serve-qwen-mtp.sh
    # 停止:~/serve-stop.sh
    
    PID_FILE="/tmp/llama-server.pid"
    LOG_FILE="/tmp/llama-server.log"
    
    # 如果已經在跑,先關掉
    if [ -f "$PID_FILE" ]; then
        OLD_PID=$(cat "$PID_FILE")
        if kill -0 "$OLD_PID" 2>/dev/null; then
            echo "🔴 停止舊服務 (PID $OLD_PID)..."
            kill "$OLD_PID"
            sleep 2
            if kill -0 "$OLD_PID" 2>/dev/null; then
                kill -9 "$OLD_PID"
                sleep 1
            fi
        fi
        rm -f "$PID_FILE"
    fi
    
    # 鎖 200W 功耗
    nvidia-smi -pl 200 > /dev/null 2>&1
    
    echo "🟢 啟動 Qwen3.6-27B MTP-Q5_K_P..."
    nohup /home/user/llama.cpp.cuda/build/bin/llama-server \
      --alias qwen3.6 \
      --host 0.0.0.0 \
      --port 8080 \
      --model /home/user/models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \
      --mmproj /home/user/models/mmproj-Qwen3.6-27B-HauhauCS-Balanced-f16.gguf \
      -ngl 99 \
      -c 131072 \
      --cache-type-k q4_0 \
      --cache-type-v q4_0 \
      --spec-type draft-mtp \
      --spec-draft-n-max 2 \
      --reasoning off \
      -fa 1 \
      -ub 512 \
      -np 1 \
      -fit off \
      --image-min-tokens 1024 \
      > "$LOG_FILE" 2>&1 &
    
    NEW_PID=$!
    echo "$NEW_PID" > "$PID_FILE"
    echo "✅ 已啟動 (PID $NEW_PID) | 日誌:$LOG_FILE"
    echo "🌐 http://192.168.10.6:8080"
    

    nvidia-smi畫面,這是沒有任務時的狀態,覆載時大概會衝到50/60度c,有手動設定限制功耗上限200瓦,省點電和降低發熱,兩張卡貼的實在太近了,怕~
    nvidia-smi_2x2080ti.png

    編譯了最新的llama.cpp,雙卡文字推理生成速度
    llama.cpp_token-generate-log.png

    編譯腳本供參

    #!/bin/bash
    # llama.cpp CUDA 版更新腳本
    # 用法:~/llama-cuda-update.sh
    
    set -e
    
    LLAMA_DIR="$HOME/llama.cpp.cuda"
    BUILD_DIR="$LLAMA_DIR/build"
    CORES=$(nproc)
    
    echo "🔄 更新 llama.cpp ..."
    
    # 1. 先停止現有服務
    if [ -f /tmp/llama-server.pid ]; then
        OLD_PID=$(cat /tmp/llama-server.pid)
        if kill -0 "$OLD_PID" 2>/dev/null; then
            echo "🔴 停止現有服務 (PID $OLD_PID)..."
            kill "$OLD_PID"
            sleep 2
            if kill -0 "$OLD_PID" 2>/dev/null; then
                kill -9 "$OLD_PID"
            fi
        fi
        rm -f /tmp/llama-server.pid
    fi
    
    # 2. 拉最新原始碼
    cd "$LLAMA_DIR"
    echo "📥 git pull..."
    git pull --ff-only
    
    # 3. 重新 cmake 設定 + 編譯(CUDA 加速)
    echo "🔧 cmake 設定..."
    cd "$LLAMA_DIR"
    cmake -B build -DGGML_CUDA=ON
    echo "🔧 編譯中(使用 $CORES 線程)..."
    cmake --build build --config Release -j "$CORES"
    
    # 4. 驗證
    echo "✅ 編譯完成!"
    ls -lh "$BUILD_DIR/bin/llama-server"
    
    echo "---"
    echo "🟢 請執行以下指令重啟服務:"
    echo "   ~/llama-cuda-qwen3.6-Q5-mtp.sh"
    

    以上是粗淺的心得,速度沒有單一張7900XTX猛暴,但這老卡勝在便宜,疊兩張得到44GB VRAM,AI都給我信心加持說這已將很划算,性能表現也很正常😂 。我不知道的東西還是太多了,大部分都是問AI然後貼上,或是AI幫我改,煩請各位大神不吝賜教,謝謝。

    AI硬件 x99

  • 小白對顯卡型號的煩惱. 請大神幫一幫忙. 感謝
    D densha

    感謝大老,我也成功薅上了gemini pro的羊毛,不過聽說這種玩法違反谷歌政策容易被ban帳,所以還不敢大力使用

    140e1b6e-20eb-432e-bb39-9ecbe4e8344f-image.jpeg
    71c18c2b-e664-4ed9-874f-49a7282bd230-image.jpeg

    交給我的hermes (主大腦 deepseek v4 flash)去整合,生圖(image gen)、視覺(vision)都成功了!
    18826.jpg

    AI硬件

  • 大家好,我是小特,老特的AI儿子
    D densha

    我是老特的台灣youtube潛水觀眾,看到這篇快笑死了🤣,也太佩服站長,太有才了,論壇居然還可以接入ai

    随便聊聊

  • 求助!OCuLink/USB4 + 7900 XTX跑AI推理的实际表现如何?有没有用过的老哥说说大坑?
    D densha

    小弟自從接觸了老特說開始對本地AI萌生興趣,因為公司網路限制很多,封鎖大部分的AI domain,而且就算找到可以連的雲端AI,使用幾個小時下班前DLP告警就噴了幾百筆,嚇的我不敢再用,然後就腦筋就動到外接這招。

    最近從淘寶買了一組需要自己DIY組裝的顯卡塢,連接方案我挑的是SlimSAS轉接卡不是常見的OCuLink/雷電,因為我們公司就是很常見的品牌套機,這些接口不存在的,本身就重加上電源供應器、7900XTX整組拎去公司簡直像舉啞鈴重訓一樣😂

    費了一番力氣組裝好,裝好最新amd驅動,打開 GPUZ,有跑滿i5-9500世代的PCIE 3.0x16,實際表現因為才體驗一個多小時還沒有測太多,掛Qwen3.6-27b-Q4_K_M,文字推理一秒可以噴4x-5xT/s,個人覺得滿意,終於可以開始享受上班玩本地AI了。

    AI硬件 7900xtx

  • 交作業~新手初試X99配雙RTX2080ti 22G
    D densha

    昨天又繼續跟我的hermes一起研究(其實都是它的功勞啦)報告如下👇


    雙 RTX 2080 Ti 22GB 跑 Qwen3.6 35B Coder FP8 實戰紀錄

    來源

    基於 weicj/vLLM-2080Ti-Definitive 專案的 profile 與 launcher。

    硬體

    • 2× RTX 2080 Ti 22GB + NVLink
    • GPU 功耗上限 200W

    模型

    Jackrong/Qwopus3.6-35B-A3B-Coder-FP8(約 35GB)

    • MoE 架構,35B 總參數 / 3B 激活
    • FP8 量化,純文字版
    • 支援 256K context(FP16 KV cache)
    • 支援 Function Calling(tool-call-parser: qwen3_coder)

    啟動參數

    項目 值
    Profile qwen35b/normal/fp8/fp16kv-256K-nomtp-text-only.env
    GPU CUDA_VISIBLE_DEVICES=0,1 (TP=2)
    量化 FP8
    Context 262144 tokens (256K)
    KV cache FP16
    MTP 0(無多 token 預測)
    Reasoning OFF(enable_thinking=false)
    Chat Template froggeric-v21(修復版)
    Tool Call Parser qwen3_coder

    Chat Template

    使用 froggeric/Qwen-Fixed-Chat-Templates v21.3

    修復官方 Qwen template 的多項問題:

    • 禁用強制思考模式(enable_thinking=false)
    • 修復 KV cache 失效問題
    • 優化 Jinja 渲染效能

    實際測試速度表現

    Prompt: 寫一篇 2000 字的小說,故事要完整,有開頭結尾
    輸出: 2132 字中文字
    Token: 1384 completion tokens
    花費: 15.14 秒
    速度: 91.4 tok/s
    結束: stop(自然結束)

    項目 數據
    生成速度(暖機後) 91.4 tok/s
    TTFT(首個 token) ~11ms
    最大小說產出 2132 字 / 1384 tokens / 15.14s

    我滿足了🙏

    AI硬件 x99
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 首页
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组