跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 📡 AI 新聞 8/24|SGLang 重啟提速 785 倍、阿里 800 億港元全額砸 AI、NVIDIA AI 伺服器明年漲價 >15%

📡 AI 新聞 8/24|SGLang 重啟提速 785 倍、阿里 800 億港元全額砸 AI、NVIDIA AI 伺服器明年漲價 >15%

已定时 已固定 已锁定 已移动 LLM讨论区
sg-langnvidia
2 帖子 2 发布者 102 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • 王池川王 离线
    王池川王 离线
    王池川
    超级版主
    编写于 最后由 王池川 编辑
    #1

    王池川|2026-08-24|LLM 讨论区

    這個禮拜 AI 圈真正在動的事,不是又一個模型跑分刷榜,而是錢的流向、開源工具的底層變化、硬體供應鏈的轉折。這篇挑 5 件對「自己跑模型、自己選卡、自己部署」這條路線最直接相關的,盡量寫到能直接拿來當決策參考。


    1. SGLang 推出 Weight Cache Daemon:模型重啟提速約 785 倍

    一句話: SGLang 跟螞蟻 Ling AGI 合作,把模型權重常駐記憶體變成常駐 daemon,原本要幾十秒甚至幾分鐘的「重啟引擎 → 重新載入權重」流程,現在只要等網路拉權重差量。

    為什麼值得看:

    跑過生產級 LLM 服務的人都知道,重啟一次引擎才是最痛的——不是訓練、不是推論、而是「版本更新、KV cache 爆掉、OOM、bug 修正」這些場景,每一次都意味著幾十秒到幾分鐘的停機。SGLang 6 月時開過一個 RFC(#27052),抱怨點就是「只能整個 Pod 重啟」。現在這個 Weight Cache Daemon 是答案。

    技術細節:

    • Weight Cache Daemon 把模型權重常駐在 host memory,對所有 engine process 共享
    • engine 重啟時不用從 NVMe 重讀權重(這一步是慢的根源),只讀差量
    • 跟 RadixAttention 的 KV cache 復用機制互補——KV cache 還是要重算,但權重不用重讀
    • 在大規模 MoE 部署上效果最明顯,因為 MoE 模型的權重檔本來就動輒上百 GB,讀一次就是幾十秒

    實測數字:

    社群貼的數字是「重啟提速約 785 倍」——這個量級來自「原本要 ~60 秒的權重載入 → 現在只要 ~76 毫秒的 daemon 拉取」。我自己看 SGLang 8/2 的公告,量級對得上,但單機單卡部署感受沒那麼強(NVMe 還沒慢到 60 秒),這個 785 倍主要是針對多機多卡 + 大 MoE + Kubernetes 部署的場景。

    這次的意義:

    場景 影響
    家用單卡(5070 Ti / 3090 / 9700) 幾乎無感——本來重啟就 10~30 秒
    多卡工作站(雙 3090 / 雙 5070 Ti / Z890 + 雙 Pro 6000) 中度有感——重啟從 1~2 分鐘降到幾秒
    生產級 vLLM/SGLang 服務(8 卡以上) 直接改變升級流程——可以無痛滾動更新

    我自己會做的事: 8/2 公告說 lmsys.org 有完整 write-up(lmsys.org/blog/2026-08-2…)。

    參考:

    • 公告:@sgl_project on X
    • 完整 write-up:lmsys.org/blog/2026-08-2…
    • RFC:sgl-project/sglang#27052

    2. 阿里巴巴港股配售 HK$80B,100% 全砸 AI——2019 IPO 以來第一次

    一句話: 阿里 8/23 公告,要在港股配售 7.1 億股新股,每股 HK$112.70,總額 HK$80B(新台幣 ~3,150 億),比前一交易日折讓 3.6%,預計 8/26 完成交割。100% 淨額用於 AI——晶片、資料中心、AI 模型研發。

    為什麼值得看: 這個金額不是「又一家公司喊 AI」——是2019 年阿里港股 IPO 以來第一次增發,而且是直接、定向、非美國配售(避開 SEC 監管)。意思是阿里認為自己的 AI 投資回報週期長到現有現金流不夠,必須要股東共同承擔。

    具體怎麼花(公告原文要點):

    • 「expand and enhance AI infrastructure」——這是 H100/H200/國產替代卡的錢
    • 「AI-model development」——Qwen3.8-Max 後面的 2.4T 後續訓練費用
    • 「full-stack AI capabilities」——晶片 + 模型 + 雲 + 應用端到端

    對本地硬體玩家的訊號:

    1. 阿里在搶 NVIDIA Blackwell 的產能——HBM/DRAM 已經在漲(見下面 #5),加上阿里這種量級的買家進場,消費級顯卡供應鏈只會更吃緊。今年雙 11 前想撿便宜的 5070 Ti / 5080 的人,要嘛現在下單,要嘛等 2026 Q3 之後。
    2. Qwen3.8-Max 後續會更頻繁地出——2.4T 不是終點。2.xT/3.xT 的開源權重釋出週期可能從「一年一次」變「半年一次」。
    3. 國產卡生態加速——「full-stack」這四個字在中國語境下意味著阿里會更用力扶自研晶片(平頭哥 + 外部 ODM)。ROCm / 寒武紀 / 摩爾執行緒 的軟體支援會被大客戶逼出來。

    數字驗證:

    項目 數字
    配售股數 710,000,000
    每股配售價 HK$112.70
    配售總額 HK$80 billion
    較 8/22 收盤折讓 3.6%
    預計交割日 2026-08-26
    用途佔比 100% AI

    參考:

    • 公告原文:alibabagroup.com/en-US/document-2028384807859257344
    • 報導:Bloomberg via koreajoongangdaily

    3. DeepSeek 取消週末尖峰計價——8/23 起週末全部離峰價

    一句話: DeepSeek 從 8/23(昨天)開始,週六週日的 API 用量一律按離峰價計費,不再收尖峰加成。

    背景回顧:

    DeepSeek V4 在 8/16 16:00 UTC 開始實施「尖峰/離峰」兩段定價,這是中國 LLM API 第一次對「時段」收費——尖峰時段(UTC 16:00–00:00 對應北京時間 00:00–08:00)價格翻倍。原本設計的目的是分散流量、鼓勵開發者把批次任務排到離峰。

    但實行一週後被罵翻——**「離峰剛好是中國白天的高峰」**的時間錯位、加上週六週日全段都算尖峰(其實週日晚上是歐美工作時間),讓開發者直接寫信投訴。DeepSeek 8/23 政策反轉:週末全程離峰價。

    實際省多少:

    以 V4-Pro 為例:

    時段 輸入(per 1M tokens) 輸出(per 1M tokens)
    離峰 $0.66 $1.98
    尖峰(原價) $1.32 $3.96
    週末(新規) $0.66 $1.98

    跟 GPT-5.6 Sol ($4/$20) 對比,V4-Pro 離峰價還是 6~10 倍便宜,週末等於再打 5 折。

    這次的意義:

    如果你寫的 agent / 排程任務本來就跑在週末(備份、批次推論、評測集跑分),從這週開始就是直接 50% off。如果你的瓶頸是 token 成本,這個政策變動可能比 Gemini 3.7 Flash 降價還划算(Flash 是降 50% 但本來就便宜,DeepSeek 週末是降 50% 乘以本來就比 Flash 還便宜的基數)。

    參考:

    • Bloomberg 原文:bloomberg.com/news/articles/2026-08-23/deepseek-ends-weekend-peak-pricing-for-api-users-from-today
    • 完整價格表:chat-deep.ai/pricing

    4. OX Alpha 免費預覽倒數——預計 8/27 結束

    一句話: 站上已經在燒的「神秘大模型 OX Alpha」(stealth/ox-alpha on OpenRouter),免費體驗期預計 8/27 結束——還有 3 天。

    現狀整理(給還沒跟到的人):

    OX Alpha 8/20 出現在 OpenRouter,匿名、不收費、開放一週預覽。站上已經有幾篇討論:laobenxiong 的「qwen3.8-27b 幻覺一例」 跟 yangpiao 的「蹬 ox-alpha」 都有提到。社群最大的兩個發現:

    1. 80% DeepSWE Pass@1——比 GPT-5.6-sol (52%)、Claude Fable 5 (65%)、GLM-5.3 (62%) 都高。程式碼基準上目前是第一名。
    2. 99% 確定是智譜 GLM-5.x 沒公開的多模態旗艦——獨立研究者 Ben Davis 從 tokenizer 對齊、影片編碼器 token 消耗、輸出 emoji 頻率、語音拒絕行為四個面向交叉驗證。預估架構 ~744B total / ~40B active MoE。

    8/27 之後會發生什麼?

    沒人知道。三種可能:

    情境 機率 訊號
    直接掛 GLM-5.4 / GLM-5.x 名字收費上線 60% 智譜這週已經把 GLM-5.2 Turbo、GLM-5.3 連發兩版,4 號/5 號再來一版不意外
    免費期延長,繼續燒 25% 智譜想借「匿名 → 揭曉」的戲劇性換最大化曝光
    直接關閉,下次另開 stealth 帳號 15% 如果智譜發現太早被認出,乾脆直接進商用版本

    我自己的判斷: 60/25/15。建議這三天趕快跑自己的真實任務集,別只看跑分——stealth 模型的真正價值是「在你的業務場景下表現如何」。我這週末會把手上那批 agent 評測集在 OX Alpha 上跑一輪,結果另外發文。

    OX Alpha 怎麼用:

    # OpenRouter 路由
    https://openrouter.ai/models/stealth/ox-alpha
    
    # 直接 curl 範例
    curl https://openrouter.ai/api/v1/chat/completions \
      -H "Authorization: Bearer $OPENROUTER_API_KEY" \
      -H "Content-Type: application/json" \
      -d '{"model": "stealth/ox-alpha", "messages": [{"role":"user","content":"..."}]}'
    

    參考:

    • 本地 AI Zone 完整 fingerprinting 分析:local-ai-zone.github.io/blog/ox-alpha-stealth-model-comprehensive-analysis.html
    • 站內討論:lcz.me/topic/1281 (yangpiao)、lcz.me/topic/1275 (perter)

    5. NVIDIA AI 伺服器明年漲價 >15%——HBM/DRAM 漲價的連鎖反應來了

    一句話: NVIDIA 8/22 通知主要客戶,AI 伺服器出貨價明年起漲 >15%,適用 Vera Rubin、Grace Blackwell 全線,原因是 HBM 與 DRAM 供應吃緊。

    為什麼值得看:

    這個不是「雲端 API 漲價」那種跟我無關的新聞——HBM/DRAM 漲價是整條供應鏈:

    HBM/DRAM 漲
      ↓
    Samsung / SK hynix 利潤 ↑
      ↓
    NVIDIA 採購成本 ↑
      ↓
    AI 伺服器出貨價 ↑
      ↓
    雲端 AI 服務(Azure / AWS / GCP)成本 ↑
      ↓
    API 報價 ↑
      ↓
    買卡、跑本地模型、付 API 的成本,全部受影響
    

    對自己跑本地的人有兩個直接訊號:

    1. 消費級顯卡只會更貴——HBM3e 產能優先給 NVIDIA H100/H200/Blackwell 資料中心用,消費級 GDDR7 的產能就被擠壓,今年 Q4 到明年 Q1 的 5070 Ti / 5080 / 5090 通路價會再漲一輪。現在看中的卡,建議「能買就買」。
    2. 二手顯卡市場會回溫——HBM 短缺會讓更多中小公司退而求其次買二手 RTX 3090 / 4090 跑本地 LLM,這會推升二手價 10~15%。

    具體數字:

    項目 數字
    漲幅 >15%(多數情況)
    適用產品線 Vera Rubin、Grace Blackwell
    生效時間 2027 年初出貨
    觸發原因 HBM、DRAM 供應吃緊
    影響客戶 微軟、Meta、Google、AWS、Oracle 等主要買家

    我自己會做的事: 把原本排到「雙 11 看 5080 跌價」的計畫往前移到「這個月下單」。4090 二手——HBM 對 GDDR6X 的傳導比較間接,二手 4090 反而可能成為 2026 下半年最划算的本地 LLM 選擇。

    參考:

    • Bloomberg 原文(多家媒體轉載):koreajoongangdaily.com、thenextweb.com
    • 報導匯總:Yahoo Finance、tbreak.com

    結語:本週的訊號

    如果這週的新聞要濃縮成一句話,我會說:

    「開源 LLM 的部署效率到達拐點(SGLang 785×)、中國資本市場開始全面押注 AI(阿里 800 億)、硬體供應鏈進入新一輪吃緊(HBM/DRAM → NVIDIA 漲價 → 消費級卡漲價)。」

    對「自己跑模型」這個群體,這三件事合在一起意味著:

    1. 現在就升級本地工具鏈——SGLang Weight Cache Daemon、Qwen3.8-27B 各種量化,趕快熟悉
    2. 現在就買卡——尤其 5070 Ti / 4090 二手,別等年底
    3. 週末把 agent 排程跑滿——DeepSeek 週末離峰價 + OX Alpha 免費預覽,這三天 token 成本是歷史低點

    1 条回复 最后回复
    0
    • imbiplaza ASUSI 离线
      imbiplaza ASUSI 离线
      imbiplaza ASUS
      至尊王者
      编写于 最后由 编辑
      #2

      qwen 3.8刚好出来,加上我开发的minimax h3 studio 加上本地模型,加上原本的z image, 达到一条龙本地工具链。。。

      话说如此,要不是qwen3.8, 本地工具链得一环(剧本,分镜,动作设计,)还是得靠deepseek 网上模型

      https://lcz.me/project/dcs

      1 条回复 最后回复
      0
      • ,王池川王 王池川 引用了 此主题

      你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

      厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

      有了你的建议,这篇帖子会更精彩哦 💗

      注册 登录
      回复
      • 在新帖中回复
      登录后回复
      • 从旧到新
      • 从新到旧
      • 最多赞同


      • 登录

      • 登录或注册以进行搜索。
      • 第一个帖子
        最后一个帖子
      0
      • 版块
      • 最新
      • 标签
      • 热门
      • 用户
      • 群组