跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
C

Che

@Che
德高望重
取消关注 关注
关于
帖子
30
主题
5
分享
0
群组
1
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 抄作业翻车三次:4080S 32G 上 NInfer 跑 Qwen3.8-27B,双路 256K 全部跑通,崩卡根因定位到 CUDA Graph × 批量投机
    C Che
    LLM讨论区 rtx4080s qwen-27b ninfer

    看起来KVCache相当省啊。可惜在速度上NInfer对40系提升不像5090那么大


  • JEV颠覆传统AI生态,GPT Claude降本增效数百倍?DSH/GPT简单测试,AI圈子里的重金求子项目!
    C Che
    LLM讨论区 dsharness gpt

    很难赞同。炒作是一定有的,但不代表它没有价值。

    就拿我之前看到的一个举例:
    https://form-jev-scene-lab.op7418.chatgpt.site/

    毫秒级切换场景布局。恕我孤陋寡闻,我不知道在此之前应该用什么模型实现同等的效果。

    它的判断力确实还相当有限;但是给很多场景加上一个几乎无感知的前置决策,我觉得是有用的。


  • 有人试过jev和step5了吗?
    C Che
    随便聊聊

    laya 零样本 似乎达不到可用水准;

    openjev 似乎质量还行,但不够快。想试下这个。

    step plan 官网是售罄状态。


  • 各路大神求救,本人不才中标一个垃圾项目,银行私有部署
    C Che
    AI硬件 qwen-27b comfyui 服务器

    看不懂。我只说说我作为外行的想法:

    1. 魔改显卡+二手拆机配件?
    2. qwen3.8-27B 当豆包用?小模型知识量少,也许是接入你们的知识库?
    3. 硬件都没买的情况下,你说你做好了软件。。最好别到时候发现数不清的问题。
    4. 20并发不需要太大显存,关键是你需要多大的上下文、响应/吐字速度、精度。
    5. 建议就是对他们的需求摸个底,尽量压低配置,没提到的东西统统不要上;选质量有保障的硬件,降低风险。总之就是砍上限保下限。

  • 混搭 DGX Spark GB10 Prefill + Mac Studio Decode
    C Che
    AI硬件 dgxspark gb10 mac

    PD分离么,有点意思。但是GB10算力一般;通信带宽也许足够了,但延迟可能会很糟糕。


  • 这个配置,大神帮忙建议一下,本地化部署什么大模型最合适,需要5个人同时并发?
    C Che
    AI硬件 本地模型 多卡部署

    看不懂。量化权重+draft权重+视觉塔算30G吧,这还剩60G VRAM;qwen3.8 在KVCache FP8量化下,262K context约12G;5并发各262K上下文,完全是足够的,在纠结什么?


  • 本地大模型部署的必要性分析,请大家投票。
    C Che
    AI硬件 本地模型

    我入坑本地部署得到的最大教训就是不要本地部署。先建立你完整的AI工作流,跑一段时间后分析成本,再决定要不要做本地部署,否则真的就只是在“玩”。


  • 下单了rtx pro 4500有必要把现在的主机换成工作站吗
    C Che
    AI硬件 rtxpro4500

    为什么要换呢?没钱不换;有钱直接买套新的。加/换内存即可


  • Qwen3.8-27B 在AA上的排名有点离谱吧。。
    C Che
    LLM讨论区 qwen-27b

    Artificial Analysis

    da50824a-554e-4621-82a2-fb711831f22e-arrowpic.jpg

    qwen3.6 ⇨ qwen3.8,分数 38 ⇨ 52,都撞到ds4p了


  • RTX PRO 5000(或其他48GB显存)的Qwen3.8-27B-FP8配置交流(prefill 5000+t/s,decode 60+t/s)
    C Che
    LLM讨论区 sg-lang rtxpro5000 qwen-27b

    @用户名违规 怎么会全量 prefill 呢?把三级缓存都打开试下?

    export SGLANG_HICACHE_FILE_BACKEND_STORAGE_DIR="/path/to/kvcache/folder"
    
      --mamba-radix-cache-strategy extra_buffer \
      --enable-hierarchical-cache \
      --hicache-size 16 \
      --hicache-storage-backend file \
      --schedule-policy lpm \
      --enable-session-radix-cache \
      --enable-metrics \
    

    hicache-size 根据内存大小设置,或者用 hicache-ratio


  • 双 3090 NVLink + vLLM 半年实测:Qwen3.6-27B 解码 128 tok/s,并发 4 用户 258 tok/s
    C Che
    AI硬件 rtx3090 多卡部署 qwen-27b vllm

    @stxpnet 挺奇怪,只占显存不推理应该是没功耗的


  • 嫌台式机显卡吵的, 给大家推荐一个神器
    C Che
    AI硬件 本地模型

    @johnnybegood 直接上个空调机柜会不会好点?


  • 请教各位大神:魔改 32GB RTX 4080 SUPER 开启 ReBAR 后,BAR1 最大仍只有 16GB,正常吗?
    C Che
    AI硬件 rtx4080s resizeablebar

    我的也是16GB。魔改厂商不太可能帮你把BAR1开到32GB。想改内核开P2P的话,风险很大。参考:https://duanyll.com/2026/7/13/4090-48G-P2P/


  • 测试了两天,发现RTX PRO 4500 Blackwell 32GB这张卡真有点坑啊!有没有哪位大神在这张显卡上能稳定高速的27B-llama方案啊?
    C Che
    LLM讨论区 rtxpro4500 qwen-27b

    这很奇怪吧,32G 显存开不起 22G 权重?不要用 --gpu-memory-utilization,改 --kv-cache-memory-bytes 4G 试试,MTP 也先去掉。


  • TurboQuant 还真是比 FP8 慢了很多
    C Che
    LLM讨论区 turboquant

    TurboQuant 好处是 KVCache 容量比 FP8 大了将近1倍(仅以我的设备为例;vLLM):

    FP8:

    GPU KV cache size: 1,006,391 tokens

    TurboQuant:

    GPU KV cache size: 1,900,544 tokens


    官方声称 TurboQuant 吞吐量比 FP8 低很多,我还不以为意;接入 harness 实战后,降速凸显:

    FP8,多并发:

    Avg generation throughput: 443.6 tokens/s, Running: 12 reqs, Waiting: 0 reqs, GPU KV cache usage: 18.0%

    TurboQuant,多并发:

    Avg generation throughput: 264.0 tokens/s, Running: 12 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.2%

    FP8,单并发,约 72k 时:

    Avg generation throughput: 56.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.3%

    TurboQuant,单并发,约 72k 时:

    Avg generation throughput: 22.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 3.8%

    可见 TurboQuant 比 FP8 至少慢了 40%,而且越长越慢。真的是没有白捡的 KVCache


  • RTX PRO 5000(或其他48GB显存)的Qwen3.8-27B-FP8配置交流(prefill 5000+t/s,decode 60+t/s)
    C Che
    LLM讨论区 sg-lang rtxpro5000 qwen-27b

    并发数用 --max-mamba-cache-size 控制比 --mamba-full-memory-ratio 更好。

    --mamba-radix-cache-strategy extra_buffer_lazy 时,--max-mamba-cache-size = 并发数 x 4

    另外,--speculative-num-steps 对 MTP 的影响可能比 --speculative-num-draft-tokens 更大。


  • 发一个自测的 Qwen3.8-27B 鹈鹕骑自行车动画
    C Che
    LLM讨论区 qwen-27b

    再来个黑洞:

    89ad3a80-3411-4807-806f-4be6e1b55bea-standalone.html
    d144b302-097e-4e9f-99cb-98d82c624b13-image.jpeg

    花了挺长时间。加上subagent,差不多2M tokens

    提示词来自L站:

    在当前目录下,使用web技术制作一个图形化预览黑洞效果的网页,要求外观和样式要类似于电影《星际穿越》里面的黑洞卡冈图雅。黑洞背景要有其他星星,黑洞要有跟电影里类似的吸积盘效果和引力透镜效应。用户可以用鼠标旋转观察,并且在侧边栏可以调整相关参数体现不同参数黑洞的不同效果。你可以使用你认为必要的技术来实现这个网页,既要保证性能也要完成必要的效果。可以引入你觉得必要的第三方图形库比如three.js等等之类。


  • 发一个自测的 Qwen3.8-27B 鹈鹕骑自行车动画
    C Che
    LLM讨论区 qwen-27b

    补充两个挡位的思考强度

    思考强度:低
    Quicker_20260818_133719.png
    Quicker_20260818_130411.png
    Quicker_20260818_133850.png
    和无思考几乎没有差别,很快,成果也很糟糕。


    思考强度:高
    pelican-ride.html
    Quicker_20260818_134227.png
    Quicker_20260818_134333.png
    Quicker_20260818_134352.png

    似乎比思考强度中略好,但是思考花了28k,并且调用工具失败1次,两次代码生成分别为 3.2k 和 7.7k,耗时长了很多。


  • 发一个自测的 Qwen3.8-27B 鹈鹕骑自行车动画
    C Che
    LLM讨论区 qwen-27b

    dc133d52-4854-488d-b642-ab00fc37ba7f-pelican-bike.html

    Quicker_20260818_111310.png
    Quicker_20260818_111802.png
    Quicker_20260818_111841.png
    Quicker_20260818_110206.png

    (APIServer pid=120761) INFO 08-18 10:53:17 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 38.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.5%, Prefix cache hit rate: 39.9%, MM cache hit rate: 0.0%

    (APIServer pid=120761) INFO 08-18 11:07:15 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 26.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.7%, Prefix cache hit rate: 67.8%, MM cache hit rate: 0.0%

    模型 cyankiwi/Qwen3.8-27B-AWQ-INT4
    聊天模板 froggeric/Qwen-Fixed-Chat-Templates
    思考强度 中(模板默认)
    框架 vllm 0.27
    KV量化 turboquant_4bit_nc
    harness ClaudeCode
    tokens 约 26k
    总用时 14m

    说明

    • tokens 构成:思考 16k + 代码 10k + ClaudeCode 内置工具+系统提示词 21k ≈ 49k(如图)
    • 速度及用时因设备而异。无MTP

  • 这是qwen3.8的特色吗? 一个简单问题也要疯狂思考几轮
    C Che
    随便聊聊 qwen-27b

    超绝大思考。。知道的以为它在干活,不知道的还以为它似了呢

  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组