跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
williamlouisW

williamlouis

@williamlouis
超级版主
取消关注 关注
关于
帖子
919
主题
25
分享
0
群组
1
粉丝
14
关注
0

帖子

最新 最佳 有争议的

  • 关于升级显卡和添置第二张显卡的一点个人忠告!
    williamlouisW williamlouis

    一 关于生产力升级
    生产力指有营收项目。可正向增加个人收入。
    这种情况下。看项目收入。收入有限的情况下建议考虑 AMD 方向。收入状态看好。建议直接上 NV pro 5000 72G 或 pro 6000 96G 。6000D不要考虑。这个阉割版非常不友好。钱花了还得折腾没必要。
    二 本帖重点 个人学习入手,或现有卡片再添加第二或更多张。
    学习入手 只推荐 7900XTX 24G 京东自营 或 闲鱼在保卡。不要研究 20系列,个人感觉 20系 炒作成分太大。建议详细了解下什么是矿卡。矿卡的寿命到底还有没有剩余。没直接挂掉的矿卡在更换 显存后到底能活多久。矿卡的剩余价值真实数值。(低到你无法想象,现在的价格也随现在的算力市场炒作起来的。)其寿命都不如V100等工业垃圾。现有服役中能跑的基本都是个人早期自用没矿过。或矿期非常短。

    增加第二张卡有没有必要。个人意见是完全没必要。
    第一 这是个完全无用的技能。在求职市场没有任何需求。一家公司不可能投资搞什么矿卡组合。这不现实。
    第二 显卡目前的价格还没高到 公司无力购买的层次。价格能一直向上浮动,只说明了购买需求远远大于生产供应量。公司不是个人。如果有需求。目前的价格一样不是阻碍。
    第三 无限制的追求本地算力对于个人提升几乎是零。本地算力增长不会增加一点您个人的能力。计算机聪明了和您的脑子不存在任何联系。
    第四 投资20W的算力也不会超过 deeskeep kimi 等国产在线算力。但是你给在线AI花20W 一定会得到你预期的项目。高端人士除外,它们要求的太多了。重点是您能真的学到一些东西。增长自己的能力。
    第五 本地算力的重要性。1.算力避风港。在拥有AI独立开发并盈利的情况下。它是你在不可控在线算力价格情况下,自我保护的安全机制。2.了解 AI模型结构的最快方案。在金钱受限的情况下 装一个 9B模型和27B模型是没有区别的。comfyfui 低速跑一下出个垃圾 和高速跑一下 流程一样。3.先用在线AI打一桶金才是这个时代您应该掌握的技能。
    第六 事实如下:经过任务一 二 两个任务测试。本地算力在编程赚钱这个项目中,作用是零。这就是事实。
    仅供参考。不同意见欢迎回帖。

    AI硬件 多卡部署 amd nvidia

  • 【避坑指南】CMP 170HX 是一张完全不值得推荐的卡。没买的就不要入坑了。
    williamlouisW williamlouis

    避坑总结:卡商不是傻子。如果有不得不入手的理由请详细考虑。本人判断是个坑。炒作已经是个定论了。N年前新卡100U,淘汰后卖2000U。请尊重自己的脑子!
    上数据:

    项目 解锁后状态 说明
    显存 64 GB HBM2e(8GB 版 Hynix 颗粒) 软件解锁,无需硬件改动
    算力 FP16 ~164 TFLOPS / BF16 ~174 TFLOPS 约 A100 的 85%,Tensor Core 正常工作
    FP32 ~12.2 TFLOPS 解锁前被 cripple 到几乎不能用
    FP64 ~6.5–11.6 TFLOPS 完整 1:2 比例,没砍
    显存带宽 ~1263–1600 GB/s 实测,接近 A100 水平
    PCIe Gen2 x4(软件)/ Gen1 x16(需焊电容) 原始被锁 Gen1 x4,软件可升到 Gen2 x4;要 x16 需硬件改电容
    ECC ❌ 无法开启 硬件有,但 GSP 不启动,长期推理有风险
    NVLink ❌ 完全没有 多卡 tensor parallel 基本不可行

    关键限制与风险
    体质抽奖
    8GB Hynix 版解锁 64GB 相对稳定,但 10GB Samsung 版解锁 80GB 普遍不稳定,40GB 才是安全线 。NVIDIA 当初屏蔽显存可能不只是市场分割,也可能是颗粒本身有缺陷。
    PCIe 瓶颈
    即使解锁后也只有 Gen2 x4(~2 GB/s),加载 64GB 模型权重要等几十秒。如果你频繁换模型或做流式处理,体验很差。焊电容改 x16 可以提升到 ~4 GB/s,但信号仍是 Gen1,且需要动手能力 。
    被动散热
    没有风扇,必须放在有前后风道的服务器机箱里,家用机箱直接过热降频。
    无显示输出
    纯计算卡,需要另备亮机卡或核显。
    INT8 仍被锁
    虽然 FP16/BF16 算力完全释放,但 INT8 推理路径似乎还有限制,比 FP16 慢 3.7 倍 。
    价格暴涨
    解锁工具放出前这张卡只要 $100–200,现在已经炒到 $1000–2000+,性价比在快速稀释 。极尽于无的性价比!

    AI硬件 170hx

  • 版主7900XTX 24G 蓝宝石 白金版 折腾日记。折腾过程从入手到成功全过程。部分版主个人开发架构分享。
    williamlouisW williamlouis

    六月八日下午:
    到货,拍摄开箱视频。留存。防止后期纠纷。
    开箱后查看SN码。发现是A25开头怀疑是旧卡。仔细观察金手指。有明显使用痕迹。观察其他部件没有长期烤鸡痕迹。联系客服。客服让官网注册保修。显示为2026年6月1日。思考后点了收货。大概率是官返品。我认为可以接受。反正有3年保修。
    9ba2a4ee-401c-4d5f-bb1d-cc64493845a9-image.jpeg
    时间紧张。还有工作没搞。(就是真没搞,又突发了情况)
    装上显卡后发现电源是2*8pin 输出。电源功率是够大。但是单线路输出不足。这块就是我自己记错了。以为有3路输出。没办法停工,去京东拍了个振华3代1000W。注意:只有这款是振华最便宜直接3路输出带3条线。其他低瓦数的也可以用。就是线只有2条。节约时间直接上这个了。关于电源的问题。一次性讲清。1托2显卡供电能不能用。答案是可以的。但是在显卡峰值工作的时间。线路会发热。小品牌电源盒可能会冒烟。我就是用1托2接法暂时点亮了显卡。看了下显卡的芯片。体质测试只能明天跑了。记录下折腾配置

    部件 型号/规格
    CPU Intel i7-4790K(LGA1150,4核8线程)
    主板 技嘉 Z97-HD3(Z97芯片组,PCIe 3.0)
    内存 32GB DDR3
    显卡 蓝宝石 RX 7900 XTX 白金版 24GB(目前1张,计划再加1张)
    硬盘 1TB 固态
    电源 现有电源(8Pin供电为1托2转接,功率偏紧张)
    系统 准备/已装 Ubuntu 24.04 Server(Linux)
    用途 本地AI算力,跑 Qwen3.6-27B 等开源大模型

    其他计划折腾设备简介:路由:Gl inet BE6500.电脑:Mac mini M4 32G版。IBM 笔记本2台 集成显卡工作本。Windows 系统 Linux mint 23 系统。华为 M5 平板一台 鸿蒙系统。 步步高 平板一台 安卓系统。iPad 9 一台 iOS系统。网络 连接 DMIT BWG 一主一备 防止与管理的20台服务器失联。外援在线算力:claude 4.7 DeepSeek V4 pro。其他已经放弃。
    静待明日更新。

    AI硬件 7900xtx

  • AI本地音频项目。本地AI自主创作歌曲。效果非常nice。测试结果:完全媲美Suno(Suno收费10-50U)
    williamlouisW williamlouis

    一.
    要求 规格
    Node.js 18 or higher
    Python 3.10+(推荐使用 3.11)或 Windows 便携版
    NVIDIA GPU 4GB+显存(无需LLM即可运行),建议12GB+显存(需配合LLM使用)
    CUDA 12.8(适用于 Windows 便携包)
    FFmpeg 用于音频处理
    紫外线 Python 包管理器(推荐用于标准安装)
    二.
    AI音乐生成
    特征 描述
    全歌曲生成 创作时长不超过 4 分钟的完整歌曲,包含人声和歌词。
    乐器模式 生成不含人声的纯音乐曲目
    自定义模式 微调 BPM、调性、拍号和持续时间
    样式标签 定义流派、情绪、节奏和乐器配置
    批量生成 一次性生成多个变体
    人工智能增强 将流派标签丰富为包含正确 BPM/调性/时间的详细描述。
    思考模式 让人工智能推理结构并生成音频代码
    三.

    🎵 ACE-Step & ACE-Step UI 完整本地部署指南

    ACE-Step UI 是一款开源的 AI 音乐生成专业图形界面,作为 Suno 的完美替代方案,它基于强大的 ACE-Step 1.5 引擎。通过本指南,您可以完全在本地(免费、无限制、私有化)部署这一套强大的 AI 音乐生成环境。

    ✨ 核心特性 (Features)

    • 🆓 完全免费且本地运行:摆脱订阅费用,无需联网即可在本地 GPU 上完成推理。
    • 🎶 完整的音乐生成能力:支持生成带人声、歌词的完整歌曲(长达 4 分钟以上),支持纯音乐模式。
    • 🎛️ 高度自定义:精细控制 BPM、调式(Key)、拍号及歌曲风格标签(Style Tags)。
    • 🧠 AI Enhance (智能增强):内置 LLM 增强模式,将简单的标签自动扩写为高质量的音乐提示词。
    • 🎧 专业级类 Spotify 界面:支持深/浅色模式、播放列表管理、实时生成进度队列。
    • 🛠️ 内置音频工具:集成 AudioMass 音频编辑器、Demucs 音轨分离以及视频背景生成等进阶功能。

    📂 0. 前置环境与目录规划

    为了避免路径错误,本指南统一将主目录设置在 D:\AI 下。

    1. 安装 Visual Studio Build Tools 2026

    1. 运行安装程序。

    2. 勾选所需组件:仅需勾选 “使用 C++ 的桌面开发”。

    3. 关键步骤(修改路径):点击上方的“安装位置”,将路径全部改到 D:\Microsoft Visual Studio。

      ⚠️ 注意:安装路径名称不能和缓存路径名称相同。

    4. 点击右下角的“安装”并等待完成。

    2. 下载并配置依赖工具 (Node.js & FFmpeg)

    1. 新建工具文件夹:D:\AI\tools
    2. 配置 Node.js:
      • 前往官网下载 Node.js 的 独立文件.zip 二进制版(不要下载 .msi 安装程序)。
      • 将其解压到 D:\AI\tools 目录下。
      • 将解压后的文件夹重命名为更短的名字:node。
    3. 配置 FFmpeg:
      • 下载 Windows 版本的 .exe 压缩包(请选择带 full 的完整版)。
      • 将其解压到 D:\AI\tools 目录下。
      • 将解压后的文件夹重命名为:ffmpeg。

    3. 配置终端启动脚本

    在 D:\AI 文件夹内新建一个名为 start_dev.bat 的脚本文件。
    (双击运行该脚本时,它会打开一个终端并自动安装必要的依赖,完成后终端的工作路径应指向 D:\AI。接下来的所有步骤,都需要通过双击此脚本打开的终端来进行。)


    ⚙️ 1. 部署后端模型 (ACE-Step-1.5)

    双击运行 start_dev.bat 打开终端,执行以下命令:

    :: 切换到 AI 目录
    cd /d D:\AI
    
    :: 克隆后端仓库
    git clone https://github.com/ace-step/ACE-Step-1.5
    cd ACE-Step-1.5
    
    :: 使用 uv 同步环境 (会自动下载完整版 Python 到 D:\AI\tools\uv_python)
    uv sync
    
    :: 启动 AI 核心服务
    uv run acestep --port 8001 --enable-api --backend pt --server-name 127.0.0.1
    

    ✅ 成功标志:当终端提示 API endpoints enabled 时,说明后端已成功启动,运行在 8001 端口。(请保持此窗口开启,不要关闭)


    🖥️ 2. 部署 UI 服务端 (Server)

    保持刚才的后端窗口运行。重新双击 start_dev.bat 打开一个新的终端窗口:

    :: 切换到 AI 目录
    cd /d D:\AI
    
    :: 克隆前端 UI 仓库
    git clone https://github.com/fspecii/ace-step-ui
    cd ace-step-ui/server
    
    :: 安装 Node 依赖
    npm install
    
    :: 复制环境变量配置文件
    copy .env.example .env
    

    配置环境变量:
    使用文本编辑器(如记事本)打开 D:\AI\ace-step-ui\server\.env 文件,找到(或手动添加)以下路径指向配置之一:

    ACESTEP_PATH=D:\AI\ACE-Step-1.5
    # 或者使用以下配置:
    # PYTHON_PATH=D:\AI\ACE-Step-1.5\.venv\Scripts\python.exe
    

    启动 Server 服务:

    npm run dev
    

    ✅ 成功标志:终端显示服务端成功启动,运行在 3001 端口。(请保持此窗口开启)


    🌐 3. 部署前端 UI (Web 界面)

    保持后端和 UI服务端 的窗口都在运行。第三次双击 start_dev.bat 打开又一个新的终端窗口:

    :: 切换到前端根目录
    cd /d D:\AI\ace-step-ui
    
    :: 安装前端依赖
    npm install
    
    :: 启动前端界面
    npm run dev
    

    ✅ 成功标志:终端显示前端服务启动,运行在 3000 端口。(请保持此窗口开启)


    🎉 4. 开始使用 (Usage)

    1. 打开您的浏览器,访问前端 UI 本地地址:
      👉 http://localhost:3000
    2. 页面加载后会显示登录界面,随便输入一个任意的用户名即可登录进入。
    3. 进入主界面后,您就可以像使用 Suno 一样,使用类 Spotify 风格的 UI 来尽情创作您的 AI 音乐了!

    日常启动说明:
    以后每次重新启动电脑后想使用 AI 音乐生成器,您只需按顺序开启三个终端:

    1. 启动 ACE-Step (8001 端口)
    2. 启动 UI Server (3001 端口)
    3. 启动 UI Frontend (3000 端口)

    Enjoy your AI music creation! 🎵

    AI音视频画图 tts

  • 4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型
    williamlouisW williamlouis

    除非你能自己 DIY 4080S 不然魔改怎么玩儿。没太看明白。
    修显卡的老张我问了。最近拒绝维修 魔改显卡。。。。。。。

    AI硬件 rtx4080s r9700

  • Kimi K3 几天测试后 总结。如何正确使用。
    williamlouisW williamlouis

    Kimi K3 的正确使用方式 是 多 Agent 辩证 协同模式。其他的模式没有任何特点。都可以被平替。当然这个平替指的是所有 现存的 AI模型。
    一 关于 多Agent 辩证协同模式。烧钱拿结果模式。二者是等同的。这个模式可以做到很多人 想象 并希望实现的 多人格 多专精技术 多部门 多智能体 互相辩证 讨论,并协同工作。得出一个几乎完美的结果。小游戏 小项目 需要第三档会员 199 。复杂项目必须 699 四档会员才行。并且在token烧空前需要充值 加油包。实测。充加油包是必然结果。KIMI 的黑洞效果等都不是 四档会员额度可以直接完成的。
    并且这个左右互搏技术 耗时非常长。基础4倍。高难度10-20倍耗时。
    二 这玩意儿不太适合学习。最大弱点。烧钱。非常烧。建议有明确项目及计划 在其他模型无计可施的情况下再考虑。
    三 实测分析。
    1.测试 小游戏 制作。精良级 。轻松完成。做工精细。
    2.测试 普通网站 制作。精良级。轻松完成。做工精细。
    3.测试 复杂项目。肉戏在这。请仔细阅读。提供项目大纲,开始项目实施。耗时30分钟左右。出结果。项目失败。根据 Kimi K3 的失败品。我补充了 失败的地方及要改进的意见。第一步可以看到,在没有详细提示词。模糊任务的情况下。K3 也不行。所以任何项目一定要有细节。80%以上的可行性。不然 AI 一样无计可施。 重新开工。这次跑了三档会员的 56%额度。为了方便计算。开的新号。数据是准确的。耗时 6-7小时。全程没用我指导。我也全程围观了 KIMI K3 的传奇技能 “左右互搏术”。在任务开始后 2小时出了一版。然后 KIMI 呼叫了4个 Agent 验收。这段就经典了。项目失败。 4个 Agent 通过4个验收线程。验收项目判定不合格。推翻了工作结果。并清退这次干活的5个Agent 。然后根据项目这次验收失败的经验重新召唤新的Agent 应聘。界面就是这么显示的。在20分钟的长跑级招聘。新报道的4个Agent 开工。之后 陆续又加入了新人。总共17个Agent 完成了这个项目。并且成品是可以使用的。

    总结:KIMI K3 速度不优秀。评价 偏慢。token消耗极快。不省钱,评价:它在烧钱上已经战胜了 claude 。实力:再不用K3的情况下,都不如 Qwen 27B 本地。LOW的一批。在不计消耗 极限K3 多Agent 模式下。它是非常牛B。在几个项目上拿第一是可能的。

    LLM讨论区 本地模型 kimi

  • AI 产品溢出产能回收计划 & 实战任务发布-细则-任务 一
    williamlouisW williamlouis

    恭喜 超凡大师。abaalei 成功进军 视频生产力赛道。这是一个很有潜力的赛道。涵盖项目丰富。祝愿他在这条康庄大道上日进斗金。前途似锦。
    在此。特宣布将论坛任务 一 下发给 abaalei 。详情我会私聊他。

    荣誉大厅

  • 受站长的激励,分享一下这10天都在comfyui做了些什么“大”制作
    williamlouisW williamlouis

    针对漫画我可以提些重要的建议:
    一。漫画发展的时间很久了。就目前的市场反响,实体书非名人作品销量都非常低迷。连载中在线订阅是主要的盈利方向。
    二。仿制名人风格的作品太多。消费者麻木。买单的很少。建议启用些已经挂掉的名人风格。作品尽量小众。可以迎合一些市场上的风格期待者。能有不错的收获。
    三。剧情是重点。多让 AI. 动动脑。剧本是重中之重。是否能成功取决于你的剧本。而不是你的本地算力硬件。

    AI音视频画图 comfyui

  • 从 41 到 56 tok/s:我修好了 DFlash 官方 benchmark 的 bug,顺手在 7900 XTX 上搭了全套联网大模型
    williamlouisW williamlouis

    27B 不能联网 搜索的问题。很多人提问。提供一个解决方案吧。在不借用 hermes的情况下如何实现。安装后测试完全可用。建议 32G显存。24G可用但是不能太复杂。
    全程使用 kimi k3 1M max 配置
    实施时长:1小时。主要原因是网速。网速慢的时候得1.5小时

    Qwen3.6-27B 本地部署方案与测试报告


    一、环境

    项 配置
    CPU / 内存 i7-4790K(4C/8T)/ 32 GiB DDR3
    GPU RX 7900 XTX 24 GiB(gfx1100),驱动 amdgpu 6.16.13,ROCm 7.2.0
    系统 Ubuntu 24.04,kernel 6.14,磁盘余量 637G
    网络 局域网固定 IP 192.168.8.247(路由器锁定)

    二、总体架构

    浏览器 → Open WebUI (:8080, venv) → dflash_server (:8000, C++/HIP) 
    → 7900 XTX
                                                │
    Q4_K_M 主模型 16G + Q8_0 DFlash 草稿 1.8G(DDTree 树验证)
    
    • 推理引擎:Lucebox DFlash(lucebox-hub 源码编译),块扩散草稿 + DDTree 树验证投机解码
    • 隔离原则:venv 只隔离 Python 工具链(下载/前端);模型即 GGUF 文件,多模型切换零隔离成本;未用 Docker
    • 启动命令:dflash(模型 API)、dflash-ui(网页前端),GPU 高性能模式随服务启停自动切换(解决空载风扇噪音)

    三、安装步骤(可复现)

    # 1. 依赖
    apt-get install -y git cmake build-essential hipblas-dev hipcub-dev \
      rocblas-dev rocprim-dev rocwmma-dev python3-venv
    
    # 2. 源码
    git clone --recurse-submodules https://github.com/Luce-Org/lucebox-hub
    cd lucebox-hub/server
    
    # 3. 编译(gfx1100,含 rocWMMA Phase2 prefill kernel)
    cmake -B build -S . -DCMAKE_BUILD_TYPE=Release -DDFLASH27B_GPU_BACKEND=hip \
      -DDFLASH27B_HIP_ARCHITECTURES=gfx1100 -DDFLASH27B_HIP_SM80_EQUIV=ON
    cmake --build build --target test_dflash dflash_server test_flashprefill_kernels -j4
    ./build/test_flashprefill_kernels   # 数值验证
    
    # 4. Python 工具(venv)
    python3 -m venv ~/venvs/dflash && ~/venvs/dflash/bin/pip install huggingface_hub transformers open-webui
    
    # 5. 模型
    hf download unsloth/Qwen3.6-27B-GGUF Qwen3.6-27B-Q4_K_M.gguf --local-dir ~/models/
    hf download Lucebox/Qwen3.6-27B-DFlash-GGUF dflash-draft-3.6-q8_0.gguf --local-dir ~/models/draft/
    

    四、关键调优与踩坑记录

    坑 根因 解法
    官方 bench 速度虚低(41 t/s) bench_he.py 只传 --ddtree-budget 不传 --ddtree,源码里预算不启用树模式 直接驱动 test_dflash 补 --ddtree
    budget≥16 速度腰斩 verify token 数 >16 触发 TILE kernel(gfx1100 上的慢/不稳路径) 实测甜点 budget=12(VEC 路径内 AL 平台期上限)
    Q8_0 草稿必需环境变量 滑窗正确性 DFLASH27B_DRAFT_SWA=2048
    运行中 OOM 崩溃 64K 上下文 KV 全量预分配 + 前缀缓存 32 槽不限量 MAX_CTX=32768 + --prefix-cache-slots 8
    前端报超上下文 Open WebUI 发 max_tokens=32768 服务端 --default-max-tokens 8192(§4.4 钳制,日志已验证)
    风扇空载狂转 DPM 常驻 high 启动脚本内 high,退出 trap 回 auto

    五、测试报告

    测试项 结果
    rocWMMA kernel 数值验证 全部 PASS(S=8192:18.3 ms/iter)
    AR 基线(test_generate) 25.87 tok/s
    投机链模式(缺 --ddtree) 41.4 tok/s
    DDTree budget=12(10-prompt 均值) 44.46 tok/s,AL 4.65,接受率 29.5%,1.72× AR
    API 实测:英文代码 53.9 tok/s(接受率 34%)
    API 实测:中文对话 19.8 tok/s(草稿为代码优化,中文收益低,属预期)
    显存占用(稳定运行) 19.6 / 24 GiB,余量 4+ GiB

    注:参考文章的 81 tok/s 未复现,原因有二——其使用 6 月旧版引擎(现行版在 gfx1100 有性能回退),且其 CPU 为双路 E5;本文数据为本机多次实测均值。


    六、Web 支持(Open WebUI)

    • pip install open-webui 装入同一 venv;启动脚本 dflash-ui 注入:
      • OPENAI_API_BASE_URL(S)=http://127.0.0.1:8000/v1
      • ENABLE_OLLAMA_API=false
    • 访问 http://192.168.8.247:8080,首个注册账号自动成为管理员(数据全在本机)

    七、网页搜索实现

    原理:模型本身不联网。Open WebUI 中间件在调用模型前先用 DuckDuckGo(ddgs,免 API key,本机直连已验证)检索,把结果注入提示词,模型基于注入内容作答并附引用。

    配置落地(两个教训)

    1. 该版本配置键为 ENABLE_WEB_SEARCH / WEB_SEARCH_ENGINE(而非旧版 ENABLE_RAG_WEB_SEARCH);
    2. 首次启动会把默认值持久化进 SQLite(…/site-packages/open_webui/data/webui.db),之后 env 改不动——最终直接改库:
      • web.search.enable=true
      • web.search.engine="duckduckgo"
      • result_count=3

    使用方式

    全局开关只是放行;每个对话需在输入框点 地球图标(代码依据 middleware.py:2456,仅当 features.web_search=true 才执行搜索)。闲聊勿开,免得拖慢首 token。


    八、运维速查

    dflash                 # 启模型 API(:8000)   Ctrl+C 停
    dflash-ui              # 启网页前端(:8080)   Ctrl+C 停
    MAX_CTX=65536 PC_SLOTS=2 MAX_TOKENS=16384 dflash   # 长文本临时配置
    MODEL=/root/models/xxx.gguf dflash                # 换模型
    # 日志:/root/dflash-server.log  /root/webui.log
    

    全部组件已在运行状态,重启机器后按顺序执行 dflash、dflash-ui 即可恢复。

    总结:在保证速度的情况下。让模型能够执行网络搜集工作。这个信息时代里,这个功能更加重要。
    希望此文能帮助到大家。

    LLM讨论区 本地模型 7900xtx dflash

  • AMD R 9700 32G到货了。一顿操作。整成无头算力卡了。经实测这卡更适合工作在X99主板。家用老机器升级慎重考虑。
    williamlouisW williamlouis

    @kos-or 性能没有 7900XTX 强。唯一升级它就是 32G 显存。24G 受够了。我做的旧程序 扔 R9700 就都能直接开跑。
    如果视频生成 还是7900XTX 在性能和价格上占优。并且它没什么噪音。
    视频生成一样是模型加载到显存中开始工作。鉴于24G和32G之间模型的大小差距不大。其实出片画质差距不大。
    但是7900XTX 加载速度更快。在流水线工作制度下。加载快的一方能出更多的片。
    如果用过NV后。你就发现 AMD的生态还是欠缺很多。用了 pro 5000 就完全不想回 AMD 生态了。
    反倒是其他项目 R9700 是个好的方向。它更适合 每日任务类的开发。
    7900XTX 在自动重新加载的机制下依旧 OOM。测试浪费大量时间。它的显存24G限制了继续在我这服役的机会。

    AI硬件 r9700 amd x99

  • RTX 2060 Super 8G 部署 Qwen3.6-35B-A3B 极限参数定稿报告
    williamlouisW williamlouis

    不能有比这个 更LOW的配置了吧?没继续折腾hermes。测试后发现完全没有意思。硬件限制上不到16K 。上了也意义不大。折腾玩下。丰富下社区。
    亮点:这个是无限制模型。有兴趣的可以玩玩。
    一、测试环境

    项目 规格
    GPU NVIDIA GeForce RTX 2060 SUPER 8G (可用显存 7158 MiB)
    CPU Intel Core i7-4790K @ 4.0GHz
    内存 32 GB DDR3
    系统 Windows (WDDM 驱动模式)
    推理后端 llama.cpp b9374 (CUDA 12.4 x64)
    测试模型 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf

    二、测试目的

    验证 8G 显存消费级显卡在 Windows 环境下运行 35B MoE 大模型的可行性,并压榨出最大上下文长度与稳定生成速度的平衡点。


    三、测试过程与数据记录

    阶段 1:默认参数(失败)

    -ngl 80 -c 4096
    
    • 显存:逼近 8G 爆满
    • 现象:failed to fit params to free device memory,llama.cpp 自动回退
    • 速度:~7.5 t/s(显存爆满触发内存交换,断崖式下跌)
    • 结论:不可直接用默认参数硬塞

    阶段 2:MoE 专家路由优化(部分改善)

    -ngl 80 --n-cpu-moe 38 -c 4096
    
    • 显存:~2.5G(异常偏低)
    • 速度:~15 t/s
    • 问题:显存过低,说明 GPU 层数被过度削减,大量权重滞留 CPU 内存,速度瓶颈在内存带宽而非 GPU

    阶段 3:强制显存适配 + 降低 GPU 层数(关键突破)

    -ngl 30 --n-cpu-moe 20 -c 4096 -fit off
    
    • 显存:6.8G / 8G(余量 1.3G)
    • 速度:~15 t/s
    • 结论:-fit off 关闭自动适配后,30 层权重成功驻留显存,进入甜点区

    阶段 4:上下文扩容(最终定稿)

    -ngl 30 --n-cpu-moe 20 -c 8192 -fit off
    
    • 显存:7.0G / 8G(余量 1.1G)
    • 速度:~17 t/s
    • 结论:上下文从 4K 提升到 8K,显存仅增加 ~200MB,速度反而微升,达到最佳平衡点

    四、最终推荐配置(定稿)

    @echo off
    cd /d D:\llama-b9374-bin-win-cuda-12.4-x64
    llama-server.exe ^
      -m "models\Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf" ^
      -ngl 30 ^
      --n-cpu-moe 20 ^
      -c 8192 ^
      -n 2048 ^
      --no-warmup ^
      -np 1 ^
      --host 127.0.0.1 ^
      --port 8080 ^
      -fit off
    pause
    

    五、关键结论

    1. 8G 显存跑 35B MoE 可行,但需精确调参

      • 不能无脑 -ngl 80,必须配合 -fit off 手动控制显存分配
      • --n-cpu-moe 是 8G 卡跑大 MoE 模型的核心参数,负责将非激活专家路由到系统内存
    2. 显存甜点区:6.5G ~ 7.2G

      • 低于 6G:GPU 层数不足,权重在 CPU,速度受限
      • 高于 7.5G:余量不足,Windows WDDM 驱动波动易导致爆显存断崖
    3. Windows WDDM 驱动占用不可忽视

      • 可用显存仅 7.1G 左右(8192 MiB 标称,实际空闲 7158 MiB)
      • 同配置在 Linux 下预计可多出 500MB~1G 可用显存,有望稳定 16K 上下文
    4. 上下文与速度并非完全负相关

      • 本例中 4K → 8K 上下文,速度从 15 t/s 微升至 17 t/s,说明之前 4K 时 GPU 利用率未吃满,8K 反而让流水线更饱和
    5. Qwen3.6-35B-A3B 的思考链(thinking)会消耗额外 token

      • 复杂 prompt 容易陷入长 reasoning 导致响应延迟
      • 建议前端 prompt 加前缀约束:"请直接回答,不要输出思考过程"

    六、使用注意事项

    • 运行时请勿同时运行大型游戏或视频剪辑软件,1.1G 余量经不起抢占
    • 长期稳定运行建议保持 -c 8192,不要尝试 16K(预估显存需求 8.5G+,必爆)
    • 如需更高速度,唯一出路是换显卡(显存 12G+)或迁移至 Linux 系统

    55b40bef-1be4-46ca-8da3-168d4bae0ead-image.jpeg
    94394cd6-6ad3-4939-8ab8-ce1f724c02d5-image.jpeg
    78c0cab3-e8ef-4fb2-95f1-62f3527afc17-image.jpeg

    LLM讨论区 rtx2060

  • AMD R 9700 32G到货了。一顿操作。整成无头算力卡了。经实测这卡更适合工作在X99主板。家用老机器升级慎重考虑。
    williamlouisW williamlouis

    先上配置
    部件 型号/规格
    CPU Intel i7-4790K(LGA1150,4核8线程)
    主板 技嘉 Z97-HD3(Z97芯片组,PCIe 3.0)
    内存 32GB DDR3
    显卡 AMD R9700 32G
    硬盘 1TB 固态
    电源 振华 1000W
    4f6b221a-e7e8-4571-a947-2ca3ffd3b76c-image.jpeg
    兼容性问题。和我配置相近的就不要折腾了。不细讲。
    故障原因:主板太老了。bios 和经过加工的 X99 系列差距太大。没有任何设置锁定 PCIe 3.0显卡接口的能力。官方说的 PCIe 5.0 向下兼容的要点是 1.锁定显卡接口频率。2.bios 识别大显存。3.vbios 能和主板显示接口握手。
    简要方案描述:GitHub 找个老版本的 主板bios 编辑器。下载一个最新的bios文件(2015年的)。用编辑器读取bios. 扔给在线 AI。改几个地方。1.锁定显卡接口频率。2.bios 识别大显存。就这俩能改。Vbios需要购买工具。放弃。测试:能识别 9700了。只能作为算力卡使用。无法显示输出。
    5fc7a57f-0154-444b-aa27-b106e8542779-image.jpeg

    AI硬件 r9700 amd x99

  • (筹备中)AI 产品溢出产能回收计划 & 实战任务发布
    williamlouisW williamlouis

    AI 产品溢出产能回收计划 & 实战任务发布
    为促进 AI 产品的良性发展,有效回收可见的溢出产能,同时为自组团队提供实践目标与实战检验机会,本人(版主 williamlouis)决定以个人名义、佣金制形式发布若干任务,供认可本计划的个人或团队承接执行。本计划为版主个人行为,与论坛官方无关。
    一、佣金标准
    任务视难度及规模而定,佣金暂定为 100–2000 USD(出资方:版主 williamlouis)。
    二、接单规则
    每个任务仅限一人或一个团队承接。任务锁定后,仅在执行人失败或主动申请放弃时方可释放。
    各任务设有固定执行期限,逾期视为失败/放弃。
    任务失败或放弃后,可由其他符合条件者重新申请接手。
    三、验收与争议裁定
    验收人为版主 williamlouis 本人。
    如出现质疑,由第三方介入裁定,裁定结果为最终结论,任何人不得继续争执。
    第三方资格:论坛等级「超凡大师」及以上用户担任。
    裁定佣金:为任务总佣金的 10%,由版主支付,并从任务佣金中永久扣除。若任务最终搁浅,该部分费用由版主个人承担。
    四、资格与保密
    每个任务均有倾向性,仅发布过相关帖子的勋章拥有者具备申请资格。(暂定为技术大牛勋章)
    版主审核通过后,将与接单方进行具体沟通。
    所有任务均为商业渠道输送,不对外公开。请承接方珍视个人信誉与人格,切勿做出有损自身荣誉之事。

    请仔细阅读规则,无资格的任何人私聊将放入黑名单。
    有意向请优先提升自己在本论坛中的勋章等级。

    网络技术 网络

  • 2026-07-28 記憶體相關走勢新聞
    williamlouisW williamlouis

    X99 就够耗到泡沫爆炸了。

    资讯

  • 智能体操控指纹浏览器。解决智能体操控浏览器作业的问题。
    williamlouisW williamlouis

    今天刚更新的功能。我的大部分开发都是基于这个指纹浏览器的 API和MCP 做的。但是难度较大。不适合所有人。
    今天官方更新了这个 Skill 。Skill 是提供给 AI调用的技能包。通过 Skill,AI 可以直接操作 AdsPower,完成启动浏览器、创建浏览器、更新指纹配置等操作;
    适用于 Claude Code/Codex/Cursor/OpenCode/Gemini GL
    npx skills add https://github.com/adspower/adspower-browser --skill adspower-browser
    适用于 OpenClaw
    npx skills add https://github.com/adspower/adspower-browser --skill adspower-browser
    重点来了:适用于 Hermes agent
    hermes skills install https://github.com/AdsPower/adspower-browser/blob/main/skills/adspower-browser --force
    还有个 AdsPower CLI
    这个东东我没用过 所以不发表言论。
    通过 skill 安装浏览器后 先让 AI自学一下操作。再安排他浏览器操作类任务。我用的是DeepSeek v4 pro 可用。flash 大家自测。
    这个浏览器需要图形界面。AdsPower CLI 应该是服务器版。我的项目用不了。一直没用过大家自测。
    桌面版我用了几年了。实现抓取。伪装真人。链接跟踪等编程即可实现。现在可以让 ai 直接上手了。应该非常容易。
    好了。祝大家使用愉快。

    网络技术 网络

  • 关于升级显卡和添置第二张显卡的一点个人忠告!
    williamlouisW williamlouis

    @terry 发这个帖主要是很多抡友兜里紧的不要不要的。在已经接触到本地模型的情况下。还想咬牙上20系的矿卡。准备扩大自己的本地算力。各种探讨,我有点头疼。找个像样的项目搞搞不比做这些无用功要正经儿点吗?
    手头有2000大洋,可以做很多事。
    不如用在线的海螺H3学学 文生图 文生视频。
    用DeepSeek 跑自己心里灵机一动的程序。做个app。都比打水漂儿的矿卡要有意义!
    在这个工业垃圾都敢卖 1W的时代,资金紧张为什么不考虑直接用国产在线AI直接跑。体感。速度。AI能力 都吊打 任意张矿卡的TP。
    大兄弟你怎么看?

    AI硬件 多卡部署 amd nvidia

  • 本地大模型部署的必要性分析,请大家投票。
    williamlouisW williamlouis

    这个我个人意见是不需要投票。
    没有什么意义。
    你到低需不需要一个本地大模型不是别人能投票决定的。
    每个人自己需要什么难道还需要别人投票决定?
    这个议题很荒诞。

    AI硬件 本地模型

  • 关于升级显卡和添置第二张显卡的一点个人忠告!
    williamlouisW williamlouis

    在线 AI 确实帮我赚到了很多USD。这是事实。每月都有几W USD的收入。
    但是专业性很强。
    这也得到一个几乎靠近答案的结果。
    行业专业性+在线 AI 辅助=项目资金营收
    反之
    个人大量金钱投入+本地算力搭建=心灵满足
    在物质资源不充足的前提下,个人的提升方案=自身专业深造+行业与在线AI结合

    AI硬件 多卡部署 amd nvidia

  • AI 产品溢出产能回收计划 & 实战任务发布 - 任务 二
    williamlouisW williamlouis

    项目内容:
    自动抓取指定网页的数据。全部采集后按来源分类。分析 分类后链接的属性。属性:自然流流量,谷歌广告投放难度分析。
    之后开始人工介入选定广告。
    重新开始按人工选择 生成 谷歌ads 的具体投放内容。
    发布方提供的资源:美国洛杉矶服务器一台8U8G100G。上传谷歌ads投放服务端源码一套。
    佣金规划 500 USD。(溢价区间501-1000USD 需要合理数据支撑。)
    项目开发时间:10个工作日(周一至周五为工作日,不含节假日)
    接受任务要求:有程序开发经验,有相关帖子发布在论坛。远程面试合格。

    荣誉大厅

  • 版主7900XTX 24G 蓝宝石 白金版 折腾日记。折腾过程从入手到成功全过程。部分版主个人开发架构分享。
    williamlouisW williamlouis

    折腾了下 windows 11 下 comfly ui。恶补下视频生成技术。直接讲重点。对于系统桌面的需求。单机不能看结果很难受。因为是非工作内容。这台7900XTX 并没接入我的工作网络。状态单身。
    首先是 Linux mint 22.3 下测试 集显负责桌面显示,视频播放等工作。独立显卡负责算力输出。非常容易。没什么可以讲的。直接让在线AI 全程就可以搞定。
    之后 切换到 windows 11 场景。十分折腾 和我好久没用过也是直接原因。说结果吧。
    1.显示器 直连 独立显卡 安装Windows 11
    2.安装完成进入Windows 下 驱动你的集成显卡。(不放心,或技术一般建议重启一下看看设备管理器。集成驱动是否正常。)
    3.关机进入bios 将集成显卡设置为主显卡。显示器接到主板的集成显卡接口,从集成显卡进入系统。
    3步这是我测试后的方案。错误过程直接省略吧。
    这个布局对 comfly ui 有非常显著的提升。在你需要桌面的情况下。
    1e5e63aa-4e5b-4912-8373-e2b29049413f-image.jpeg
    866ea9c5-7aee-4f29-aaaa-7d8be10b78a8-image.jpeg

    AI硬件 7900xtx
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组