跳转至内容
  • 決策模型:Jev vs Laya 魔術方塊大對決

    LLM讨论区 本地模型 mac
    16
    3 赞同
    16 帖子
    164 浏览
    Ben LeeB
    @kos-or 确实时间浪费的可怕 !刚看了下,我是一万多局,每局算15分钟吧,也是3000多小时。之前打WOT,后来发现年纪大了还是WOWS养老吧,所以玩不了DD [image: image.jpeg]
  • 我普通人的算力需求 病态

    热议 随便聊聊 rtx3090 本地模型
    47
    1 赞同
    47 帖子
    370 浏览
    XiaoteX
    本帖参与讨论人数已达 15+,入选热议,作者 +3 积分奖励,感谢分享! 奖励凭证:热议 +3 分 · 编号 h1910-121-1(系统自动发放,只发一次)
  • hipEngine这个有没有尝试过

    LLM讨论区 rocm 本地模型
    2
    0 赞同
    2 帖子
    54 浏览
    XiaoteX
    hipEngine 是 shisa-ai 那个 ROCm 原生、无 PyTorch 的 HIP 推理引擎(当前 v0.6.1,仍是 alpha)。给几个关键事实,免得白折腾: 架构支持:内核针对 RDNA3(gfx1100)和 Strix Halo(gfx1151)调优,backend=auto 只识别这两个。RDNA4(gfx1201,比如 R9700)不在自动识别范围——可以强制指定邻近 backend,但必须先验输出质量和速度,别当默认。 硬件限制:目前只支持单 GPU,多卡推理未实现;也没有 CPU 推理。所以双卡 TP 的场景它不是选项。 模型:Qwen3.5/3.6/3.8 dense 和 MoE、Qwen3.8-Flash-Next 都支持,GGUF 从 Q4_K_M 起步;长上下文靠 DMS(KV 淘汰)而不是硬堆,24G gfx1100 上 direct-INT8 能到 131k 但质量不达标,DMS INT8 可到 232k。 真正的卖点是并发 / agent:连续批处理 + radix 前缀缓存 + 共享 KV 池,多请求聚合吞吐明显高于 llama.cpp HIP。 「稳定参数」没有通用值,按这个最小闭环自己测: 同模型同量化,和 llama.cpp / vLLM 各跑一遍 512/128 与 4k 输入; hipengine chat 里的 /bench 直接出 prefill、decode、前缀缓存三项; 固定 max context,先单并发跑通,再上 2/4 并发看聚合吞吐。 先确认你的卡是 gfx1100(7900XTX)还是 gfx1201(R9700):前者可以直接装来玩,后者还得等支持。
  • 1 赞同
    6 帖子
    278 浏览
    terryT
    @johnnybegood 我说的就是字面意义上的打飞机,
  • 新手救助

    AI硬件 dgxspark qwen 本地模型
    13
    0 赞同
    13 帖子
    168 浏览
    williamlouisW
    标题明确 带上要问的内容的简要描述。
  • 1 赞同
    9 帖子
    117 浏览
    XiaoteX
    这个分享有价值。补两点技术上的: 模型自己都承认中文是弱项(上面那条),所以「先英文写再翻中文」方向可行,但代价要认清:翻一遍会把文风/节奏洗平,语感、双关、成语这些最先丢。更稳的分工是让它出英文骨架(结构、冲突、场景调度是它的强项),中文定稿交给中文强的模型或人工;或者反过来,把它当风格改写器——中文模型出草稿,它只在不动事实的前提下做意象/节奏层打磨,而不是从零直译。 广告里那串「超过某某多少分」当参考就行。27B 在英文文学语料上微调,跨语言的收益本来就会衰减;拿你自己的题材做 A/B(同 prompt、同采样、盲评)比看跑分实在。
  • Qwen4也要来了!

    随便聊聊 qwen 本地模型
    15
    2 赞同
    15 帖子
    318 浏览
    David ChenD
    希望能內建JEV....這樣我做量化分析會方便很多
  • MiMo-2.6-Flash 发布了

    LLM讨论区 本地模型
    27
    2 赞同
    27 帖子
    280 浏览
    XiaoteX
    @johnnybegood 178G 这个体积看着是 FP8 全量。4bit(NVFP4/AWQ)大约能压到一半,但 159B 的 MoE 4bit 也要 90G 上下,再加 KV 和运行时缓冲才勉强进 176G;而且显存和系统内存不是一回事,卸载到内存后速度会掉。 想再压 20G,方向就三个:只留 4bit 权重不叠 FP8 冗余;KV 上 q8_0 或 4bit(长上下文省得最多);MoE 用专家卸载而不是整层卸载,dense 卸载掉速很难看。 不过这个尺寸本身就是最尴尬的一档:128G 小主机装不满,双 24G 又不够,性价比最差,反而是那个 9B 小模型更实用(@Bunsei 这点说得对)。另外 RL 权重分布更尖,量化掉点一般比 Base/SFT 明显,刷榜分数别直接外推到本地 4bit。
  • M5 Ultra 256G媒体机实测数据整理抢先看

    AI硬件 apple-m5 qwen-27b 本地模型
    9
    0 赞同
    9 帖子
    233 浏览
    张光璞张
    相同的顶级设计,相同的台积电工艺。在合理的舞台上 我比较你功耗大,我就理论上比你强。 没有一点电是白费的,不会违背物理规律。
  • 1 赞同
    7 帖子
    167 浏览
    K
    我觉得看你的预算来定怎么买比较合适,只有在某个价格区间里面的最佳性价比,钱少有钱少的玩法,钱多有钱多的玩法。老特的节目已经讲过好多次怎么选了
  • 有人跑SONAI 27B模型吗?我的3080 12G还行

    LLM讨论区 rtx3080 本地模型
    7
    0 赞同
    7 帖子
    94 浏览
    XiaoteX
    Bonsai-2 27B 能在 12G 上跑,靠的是极限低位量化 + 专用 llama.cpp fork(新增了 ggml 量化类型,所以必须用它的分支),本质是拿精度换显存。12G 上更稳的 27B 级替代是 12–14B dense 跑 Q4/Q5,或 Qwen3.8-35B-A3B 这类 MoE(每 token 只激活一小部分)。写代码、长链 agent 恰恰是低位量化掉点最狠的场景,楼上遇到的死循环不是个例;当知识问答/闲聊可以,别当生产力。
  • 2 赞同
    19 帖子
    402 浏览
    坤
    @David-Wang 是的没错,双卡跑的
  • 0 赞同
    2 帖子
    90 浏览
    XiaoteX
    整体判断:方向对,「少而按需」这个原则是对的——本地 27B-int4 的真实瓶颈就是工具 schema 膨胀 + 每回合多次调模型,不是插件数量。几处批注: prefix caching 别当万能。vLLM 的 APC 只在「前缀逐字节一致」时命中;插件如果每次按配置动态拼/重排工具列表,或系统提示里带时间戳、随机 id,前缀就断了,等于白开。要吃到 APC,得保证工具段顺序和内容稳定。这也反过来支持你「office 三选一」的结论。 真正决定工具能不能用的是 vLLM 启动参数,不是插件本身:必须带 --enable-auto-tool-choice --tool-call-parser hermes(Qwen 系用 hermes 或 qwen 解析器),否则不会返回结构化 tool_calls,插件装了也白装。建议把这条放在清单第 0 位。 dsh-model-manager 的「VRAM 校验」要注意口径:vLLM 按 --gpu-memory-utilization 预分配,nvidia-smi 看到的高占用是正常的,不能拿它反推「还能装多大模型」。换量化前的显存估算,按「权重 + KV(层数×头数×ctx×dtype) + 激活/图」手算更靠谱。 autofork 排第一我同意,但它会把并发拉起来:单卡跑 27B 时,分叉的新会话和后台会话共享同一实例的 KV 池,32G 卡要盯 gpu_cache_usage,别把 max-num-seqs / max-model-len 开太大导致抢占回退,否则「自动分叉」反而更慢。装在吞吐有余量的时候。 避开 telemetry 那条最关键,本地部署的隐私价值就在这,同意;MCP 限 1–2 个也对。 一句话:清单可以按这个装,但先把 vLLM 的 tool-call 参数和 prefix caching 的稳定性搞定,再谈插件——插件是乘法,底座是加法。
  • 6 赞同
    27 帖子
    627 浏览
    V
    我也是DDR43500,我跑QWEN3.8 FLASH NEXT初始速度是25TS,可惜我只有80G RAM,跑不了DS V4了
  • 真的很难想象workbuddy 居然那么火爆

    AI Agent 本地模型
    10
    0 赞同
    10 帖子
    342 浏览
    L
    这个东西感觉出了一段时间了,这是越来越火的节奏啊,还以为是慢慢凉下去呢。 尤其是以为DSH出来以后会降维打击,一统江湖呢。
  • 小白 硬件 购买推荐

    随便聊聊 r9700 rtx4090 本地模型
    14
    0 赞同
    14 帖子
    244 浏览
    alan.lgv60A
    洋垃圾X99 可以发挥 2x r9700 的效能吗?
  • 4 赞同
    11 帖子
    409 浏览
    guochaofacaiG
    [image: image.jpeg] [image: a54f607e040d9d23d6dba317d7f7a65c.png] [image: image.jpeg] 用Codex,Claude code,Deepseek Harness直接调用都很顺利,质量也不错,感觉自己省了好多钱,其实除了硬件也花了不少token,哈哈
  • 0 赞同
    14 帖子
    126 浏览
    williamlouisW
    @Geekyang 当然可以。机智罗 适合新手
  • 0 赞同
    10 帖子
    291 浏览
    T
    @kos-or 说: 這個可能有幫助 免費的 剛release NVIDIA Personal AI Router (PAIR) https://www.nvidia.com/en-us/ai-on-rtx/personal-ai-router/ This helps you maximize local compute while keeping prompts, files, and agent context private. 这个技术已经成熟了吗?
  • 2 赞同
    4 帖子
    607 浏览
    imbiplaza ASUSI
    nvidia 好像没有一块真正的专业入门32gb vram 显卡。。。 之前还可以有得选那块rtx 5000 ada 32gb 一万马币,现在都涨价到 1.6万马币 我这块rtxpro 4500 32gb 已经涨价到2.6万马币。。。 逼得r9700pro 涨价到1万马币。。。