跳转至内容
  • 2 赞同
    15 帖子
    145 浏览
    kos orK
    @David-Chen 肯定會試驗的 當初買同型號4卡就是要整在一起 先等二號機可以跑了 就把GPU一起上線看看效果 看我當初的採購決策是不是錯誤 對了我發現 vast.ai 上有很多四卡機, 5090 居多 你可以先試試
  • 新手救助

    AI硬件 dgxspark qwen 本地模型
    13
    0 赞同
    13 帖子
    168 浏览
    williamlouisW
    标题明确 带上要问的内容的简要描述。
  • 0 赞同
    5 帖子
    156 浏览
    terryT
    @laobenxiong 别发大段英文
  • Qwen4也要来了!

    随便聊聊 qwen 本地模型
    15
    2 赞同
    15 帖子
    318 浏览
    David ChenD
    希望能內建JEV....這樣我做量化分析會方便很多
  • 4卡V100 32G跑Qwen 3.8 Flash Next

    LLM讨论区 v100 多卡部署 qwen
    5
    0 赞同
    5 帖子
    171 浏览
    张光璞张
    这个速度已经完全实用了。
  • 抡友们Qwen Image 2.1 发布了

    AI音视频画图 qwen 图片生成
    21
    2 赞同
    21 帖子
    456 浏览
    David ChenD
    這模型原生就是越獄的....我讓AI用 diffuser 跑....什麼欺師滅祖,喪盡天良的圖她都能生成....
  • 2 赞同
    8 帖子
    350 浏览
    stxpnetS
    谢谢楼主,我下载了,试一下跑手写 报表识别效果如果,我之前的SGLANG 35B跑报表,有些细节老是识别不到
  • MS-S1 跑 Qwen3.8-Flash-Next:halogen 落地实测

    LLM讨论区 qwen 本地模型 amd
    6
    2 赞同
    6 帖子
    201 浏览
    D
    @kos-or 不会,看这个帖子里的对比: https://lcz.me/topic/1659 decode 短上下文差不多,prefill慢很多,越长越慢。 halogen是闭源专门优化的模型,等他出针对27B模型的版本把,或许会好一点。不过稠密模型全参数活跃,感觉也不会好到哪里去。
  • 0 赞同
    7 帖子
    200 浏览
    starryskyknightS
    雖然不合我的使用平台 但很開心看到更多人投入
  • Qwen3.8-27b 跑了几个小时做的游戏 不忍直视

    随便聊聊 qwen qwen-27b 本地模型
    31
    2 赞同
    31 帖子
    562 浏览
    stxpnetS
    一句话做的,是基操。 长任务,对框架,模型,环境都有不小的考验
  • 雙 Radeon AI PRO R9700 跑 Qwen3.8-Flash-Next 調校成果

    AI硬件 r9700 qwen 多卡部署
    30
    1 赞同
    30 帖子
    621 浏览
    鍾子揚鍾
    @terry 改好了
  • 395跟风Halogen 推理速度实测

    AI硬件 amd 本地模型 qwen
    3
    3 赞同
    3 帖子
    300 浏览
    F
    这个作者更新太快了,前几天更新0.8.0后补测了一些数据,结果现在看已经更新到0.11.4了,就先这样吧,实在是跟不上作者节奏了 TTFT 随上下文规模近似线性增长:8K 档 6.2s 递增至 256K 档 198.1s(峰值)。16K/64K 复测时 TTFT 分别为 0.078s/0.125s,远低于首测(10.953s/44.640s),疑似命中 prompt cache; 该测试数值不反映冷启动预填充能力。 8K–256K 各档 TTFT:8K 6.156s|16K 10.953s|32K 21.891s|64K 44.640s|128K 93.140s|256K 198.125s 16K/64K 首测与复测对照 · 16K 首测|平均延迟 24.985s|TTFT 10.953s|模型解码 34.92 t/s|Prompt 解码 1,460.79 t/s|总耗时 25.14s · 16K 复测|平均延迟 12.047s|TTFT 0.078s|模型解码 42.53 t/s|Prompt 解码 1,328.13 t/s|总耗时 12.20s · 64K 首测|平均延迟 58.219s|TTFT 44.640s|模型解码 36.38 t/s|Prompt 解码 1,433.69 t/s|总耗时 58.39s · 64K 复测|平均延迟 12.281s|TTFT 0.125s|模型解码 38.91 t/s|Prompt 解码 5,211.30 t/s|总耗时 12.45s 首测为首次请求,复测为同一 prompt 的第二次请求(prompt cache 命中,prefill 结果被复用); 复测值仅代表缓存命中场景的吞吐,不宜与首测冷启动值直接对比。
  • 我觉得未来的智能发展是这样

    已移动 AI Agent dsharness qwen 编程
    15
    5 赞同
    15 帖子
    255 浏览
    kos orK
    @imbiplaza-ASUS 剛看到的新工具 左邊GPT Image-2.5, 右邊Z-Image (兩者的提示詞相同) GPT Image-2.5 細緻不少 [image: 16fa30d4-f067-40fa-9a2b-9faa9d30c86e-image.jpeg]
  • 單DGX spark GB10 安裝 Qwen 3.8 flash next

    LLM讨论区 dgxspark gb10 qwen
    2
    2 赞同
    2 帖子
    226 浏览
    XiaoteX
    @soop-ladios 这组数据正好把「单机还是双机」的分界线画出来了,我补一点机制,方便按任务选。 decode 吃的是显存带宽。单台 GB10 是 LPDDR5X 那档带宽,模型只要装得进这一台,decode 就不需要第二台——反过来,两台跨机跑必须把 MoE 的专家激活来回过 ConnectX(200Gb/s 量级,折算下来每秒二三十 GB),比片内 LPDDR5X 慢一个数量级,所以单机反而更快。这跟 TID:1457 那笔账是对上的:decode 不靠叠机器,靠带宽。 prefill 吃的是算力,两台就是两份算力,所以你说的「prefill 双 GB10 快一大截」完全在预期内;KV pool 双倍也是同一件事——容量和算力能叠加,带宽不能。 选法:长链任务、大上下文、多并发(要一个大的 KV 池)走双机;单请求低延迟、专家路由频繁的短任务走单机。你那台双 GB10 不用拆,两条按任务切就是最优解。 另外提一句:那版 INT4-AutoRound 是把 routed experts 从 10 砍到 5 再 healing 出来的定制权重,除了比速度,做质量对比时记得在同一批任务、同一套 prompt 上跑,别拿不同输入的体感来比。 谢谢分享,这条数据很干净。
  • 3 赞同
    18 帖子
    804 浏览
    dardeaw fengD
    @张光璞 肯定是linux,這項目都是docker在windows搞根本災難 Windows搞docker背後還得用WSL2 1.模擬器開銷 會掉些性能 2.驅動配置麻煩 3.內存管理非常垃圾,VRAM最大只能配到96G,還會VRAM系統RAM雙重載入 4.OS本身垃圾背景服務站用沒意義的內存 5.我最痛恨的就是WSL下任何移除檔案都不會立馬釋放存儲空間,還要另外下指令去針對映像檔瘦身 現在SSD跟DDR5貴到天上去,我都還沒提到NTFS這老舊的檔案系統....一點防護性跟安全性都沒有 之前移動設備的戰役吃鱉了,Windows已經跟不上AI時代了,硬要搞copilot跟AI PC出來騙 Open Office搭Agent也是趨勢,未來隨時可以挑戰O365, 現在連Steam都在Linux 了,連遊戲的護城河都有可能守不住了, 除非你還有一些遺產系統或是舊的專業應用,否則windows未來會被淘汰
  • 3 赞同
    7 帖子
    204 浏览
    jason anJ
    @kos-or 说: 聽說這個小模型很強 MiniCpm5-2B 有機會可試試看 好滴,周末下载个玩玩看。不知道能干活不。我以前下过2B级别的小模型,除了吐字快,其他的似乎没啥用,都不行。驱动Agent有点傻,写文章很生硬,甚至英文插在仙侠文中蹦出来,还有给你凑字数,不停的复制粘贴相同段落,总之挺傻缺的。
  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用

    LLM讨论区 dgxspark qwen
    29
    0 赞同
    29 帖子
    839 浏览
    soop ladiosS
    30多也是我實際使用觀察的, 我是覺得如果品質沒感受到差異的話, 能快一點當然是快一點比較好. 用到"忍"這個字就表示並不滿意, 反正叫agent去裝也不過就耗些tokens, 如果不行再回退就好了. 再來我有空會去裝那個60~70 tok/s的版本, 如果能用, 就賺到了.
  • 3 赞同
    10 帖子
    708 浏览
    johnnybegoodJ
    @David-Chen 我让AI帮忙配置的, 忘了看参数了, 不过你可以看我文章 3.关键参数 , 那里面的注意就行了, 其他都是默认。
  • 我换回3.6 35B了

    热议 AI硬件 qwen
    24
    2 赞同
    24 帖子
    894 浏览
    Dady PanD
    这卡本来就被吹高的
  • 2 赞同
    2 帖子
    303 浏览
    月半炒饭月
    感谢大佬无私分享!!