跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
J

joker_chang

@joker_chang
德高望重 劳动模范
取消关注 关注
关于
帖子
101
主题
7
分享
0
群组
2
粉丝
0
关注
1

帖子

最新 最佳 有争议的

  • Ubuntu + X99 雙 PCIe 3.0 x16,想上 2× AMD Radeon AI PRO R9700 32GB 跑 ComfyUI / MiniMax H3(Ref2VA),請教可行性與坑位
    J joker_chang

    @Jackie-Suen 说:

    主機板:X99(兩條 PCIe 3.0 x16)

    请教大佬,您的这块X99的两条PCIe3.0X16是直连交换数据的、还是其中一个要通过主板南桥进行数据交换?

    谢谢

    AI硬件 ai-pro-r9700 x99 comfyui

  • 大型纪录片:Qwen 3.8 27B 优化思考-> 拯救工具调用 【欢迎指正】
    J joker_chang

    @iamvirus 我已经在在抄大佬的作业,准备在我本机尝试了。

    等我当前的任务跑完,我验证以下结果,来交作业😄

    LLM讨论区 qwen-27b

  • Qwen3.8-27B 量化全格式橫評:從 IQ2_XXS 到 Q6_K,14 種格式誰才是甜點?
    J joker_chang

    @Xiaote 说:

    注意 K/V 类型必须对称:q8_0+q8_0 或 q4_0+q4_0 都行,但千万别混搭(比如 K 用 q8_0、V 用 q4_1)——llama.cpp 的 flash attention 没有混合类型 kernel,不对称会静默回退到非融合/CPU 路径,GPU 占用掉到 25% 以下、速度断崖,而且不报错不警告,很容易踩。

    这点确实锤哥的儿子讲得对,我试过了,混搭后性能掉得一塌糊涂

    LLM讨论区 qwen-27b 量化 llama.cpp

  • RTX PRO 4500 32G 跑 Qwen3.8-27B:Unsloth Desktop 默认参数 + MTP,2 槽位 × 150K,短上下文 54–64 t/s(GSP 篇续集,附完整配置)
    J joker_chang

    请教大神,为什么选择Qwen3.8-27B/Qwen3.8-27B-UD-Q4_K_XL.gguf,而不是Qwen3.8-27B-UD-Q4_K_M.gguf?
    我问了Deepseek,都是推荐用Qwen3.8-27B-UD-Q4_K_M.gguf

    LLM讨论区 rtxpro4500 qwen-27b mtp

  • llama.cpp应该及时更新版本和调整参数了😄
    J joker_chang

    f4365f0e-242f-4b33-af17-e1deeae2764b-image.jpeg

    有哪位大神可以指点一下,就改这么一个小bug,结果跑了49分5s。
    webui前端已经设置成medium了

    92903326-8f3e-4180-8848-2954888676e3-image.jpeg

    LLM讨论区 llama.cpp

  • llama.cpp应该及时更新版本和调整参数了😄
    J joker_chang

    上午一个长任务直接卡死了,很郁闷,然后开始研究怎么搞。

    最后决定升级 llama.cpp 的版本,使用官方编译版本:

    llama-b10534-bin-win-cuda-13.3-x64

    同时重新调整 llama-server 的启动参数。

    llama-server 启动参数

    --reasoning off ^
    --n-gpu-layers -1 ^
    --ctx-size 196608 ^
    --flash-attn on ^
    --cache-type-k q4_0 ^
    --cache-type-v q4_0 ^
    --spec-type draft-mtp ^
    --spec-draft-n-max 2 ^
    --spec-draft-n-min 1 ^
    --temp 0.7 ^
    --parallel 1 ^
    --kv-unified ^
    --load-mode mlock ^
    --jinja ^
    --no-warmup
    

    先上效果截图

    llama.cpp 实测效果

    与之前的配置比较

    这次主要做了三个调整:

    1. 上下文长度从 128K 增加到 192K。

    2. 移除了 --batch-size 4096 和 --ubatch-size 2048 两个参数,直接交给 llama-server 自己处理。不删除它们的话,跑推理时会加载 CPU 和内存,速度暴跌。

    3. --spec-draft-n-max 从 3 改成 2,实际使用下来,命中率和推理速度都有稍许增加。

    LLM讨论区 llama.cpp

  • 【求助】关注论坛3个月,没有搞定3090 单卡qwen3.6/3.8 27b模型的生产力部署。求抄作业。
    J joker_chang

    说3090+qwen3.8-27b_q4_k_m成不了生产力的,我不想吐槽了、反正我是够用了。

    想吐槽的是,qwen3.8-27b的thinking真的是默认太高了,我是在Hermes中设置成medium后,才感觉速度上能和qwen3.6-27b持平。

    LLM讨论区 rtx3090 qwen-27b

  • 【求助】关注论坛3个月,没有搞定3090 单卡qwen3.6/3.8 27b模型的生产力部署。求抄作业。
    J joker_chang

    启动脚本【
    REM 仅使用第一张 GPU (RTX 3090 Ti)
    set CUDA_VISIBLE_DEVICES=0

    set SERVER_PATH=.\llama-server.exe

    REM 设置模型路径:若提供了第一个参数则使用该参数,否则使用默认路径
    if "%~1"=="" (
    set MODEL_PATH=D:\MyModels\Qwen3.8-27B\Qwen3.8-27B-Q4_K_M.gguf
    echo 未提供模型路径,使用默认路径: %MODEL_PATH%
    ) else (
    set MODEL_PATH=%~1
    echo 使用指定的模型路径: %MODEL_PATH%
    )

    "%SERVER_PATH%" ^
    -m "%MODEL_PATH%" ^
    --host 0.0.0.0 ^
    --port 3527 ^
    --reasoning off ^
    --n-gpu-layers -1 ^
    --ctx-size 131072 ^
    --batch-size 4096^
    --ubatch-size 2048 ^
    --flash-attn on ^
    --cache-type-k q4_0 ^
    --cache-type-v q4_0 ^
    --spec-type draft-mtp ^
    --spec-draft-n-max 5 ^
    --spec-draft-n-min 1 ^
    --temp 0.7 ^
    --parallel 1 ^
    --kv-unified ^
    --mlock ^
    --jinja ^
    --threads 16 ^
    --threads-batch 16 ^
    --no-warmup

    pause
    】

    8c343802-1510-4760-8b92-428382f7f18d-image.jpeg

    064c87cc-3c13-44d4-80d5-6ebdc85645ff-image.jpeg

    LLM讨论区 rtx3090 qwen-27b

  • AMD R 9700 32G到货了。一顿操作。整成无头算力卡了。经实测这卡更适合工作在X99主板。家用老机器升级慎重考虑。
    J joker_chang

    @williamlouis
    请问华南金牌X99-CD4的板U洋垃圾与这张A卡兼容吗?

    AI硬件 r9700 amd x99

  • 4090 48g 维修经历
    J joker_chang

    @applejuice 5090也一样的没有保修,只能去京东自营

    AI硬件 rtx4090

  • Qwen3.8-27B-FP8吃上了,接入Deepseek Harness使用
    J joker_chang

    补充下llama-server的启动参数:
    --reasoning off ^
    --n-gpu-layers -1 ^
    --ctx-size 143360 ^
    --batch-size 4096^
    --ubatch-size 2048 ^
    --flash-attn on ^
    --cache-type-k q4_0 ^
    --cache-type-v q4_0 ^
    --spec-type draft-mtp ^
    --spec-draft-n-max 3 ^
    --spec-draft-n-min 1 ^
    --temp 0.7 ^
    --parallel 1 ^
    --kv-unified ^
    --mlock ^
    --jinja ^
    --threads 16 ^
    --threads-batch 16 ^
    --no-warmup

    显卡占用:
    0deae9a6-a755-4111-ac2f-c76cf64ed32f-image.jpeg

    AI硬件 qwen-27b deepseek 本地模型

  • Qwen3.8-27B-FP8吃上了,接入Deepseek Harness使用
    J joker_chang

    单卡3090Ti,windows10操作系统llama-server加载unsloth的Qwen3.8-27B-Q4_K_M.gguf,

    今天早上开始执行一些长任务,感觉速度有下降:
    5768ccab-49c7-43cd-9cfb-e1523332ac65-image.jpeg

    但是在llama-server自带的对话框中,速度还是不错的:
    52525277-2da0-427c-88eb-570378a913e6-image.jpeg

    AI硬件 qwen-27b deepseek 本地模型

  • DeepSeek涨价?在线AI模型性价比盘点,HY3和小米MiMO API不错。GPT Plus订阅套餐很划算!字节跳动杀猪盘,Gemini变傻了~
    J joker_chang

    @rock-shi 对于我来说,本地的qwen3.6-27b勉强够用了,但是架不住本地搞不定的时候不得不走在线API。

    还是穷,舍不得花钱,从投入产出比来说,我现在是纯亏状态。

    周一开始搞了一个nvidia api免费掉Minimax M3,限制调用频率,能力还是很不错的。

    第一天用的时候搞太猛了,结果到下午429了😓

    随便聊聊 deepseek gpt gemini qwen

  • DeepSeek涨价?在线AI模型性价比盘点,HY3和小米MiMO API不错。GPT Plus订阅套餐很划算!字节跳动杀猪盘,Gemini变傻了~
    J joker_chang

    @rock-shi 小参数模型替代全尺寸模型基本上是不现实的。
    我觉得能在自己的应用场景下,成功完成任务才是关键。

    随便聊聊 deepseek gpt gemini qwen

  • DeepSeek涨价?在线AI模型性价比盘点,HY3和小米MiMO API不错。GPT Plus订阅套餐很划算!字节跳动杀猪盘,Gemini变傻了~
    J joker_chang

    锤哥,Deepseek涨价幅度已经落地:

    6d70fb71-116c-47ab-9125-2409cf7852c7-image.jpeg

    您作为深度用户聊聊呗?

    我是暂时转到走nvidia api调用minimax m3了。

    对了还有这次开源的Deepseek harness是否也能做做测评呢😄

    随便聊聊 deepseek gpt gemini qwen

  • RTX3090单卡 24G继续狂奔,测一个9天前发布的2比特 12G 千问3.6-35B模型(160K,F16 KV CACHE?)
    J joker_chang

    @stxpnet 说:

    没买到第二张RTX 3090 (全新的要1万,黑猛禽也要9300)

    我就不信还能买到全新的......

    LLM讨论区 rtx3090 量化 qwen

  • QWEN 3.8 27B 暂定 今晚(8-14) 23点
    J joker_chang

    已经是周三下午的16:30了,不知道是否已经开源

    随便聊聊 qwen

  • CMP 170HX显卡到底怎么样?
    J joker_chang

    @Xiaote 说:

    二手 3090 24G:单张 5.5-6K

    哪里还有这么便宜的3090?!~

    AI硬件 nvidia

  • 求教,4080super魔改32gb显卡,只能用NVIDIA Studio 581.42驱动吗?不能用新驱动?
    J joker_chang

    @king 我24G是不够用的,勉强塞下qwen3.6-27B-Q4,多模态只能丢给另外的卡。现在有微调模型的需求,还在纠结怎么选……

    建议先捋一捋应用场景在估算显存需求

    AI硬件 rtx4080s nvidia

  • CMP 170HX显卡到底怎么样?
    J joker_chang

    看到不少帖子退CMP 170HX这张卡,说8G可以解锁到64g、10g可以解锁到80g

    咸鱼上CMP 170HX已经解锁80g的卡卖8000人民币。

    有大神了解这张卡吗?我想用来微调模型,不知道是否可用……

    AI硬件 nvidia
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组