跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. 开源个安装包Qwen3.6 35B 塞进了 8GB 显存笔记本:128K、多模态、Thinking,一键安装还能接本地 Agent

开源个安装包Qwen3.6 35B 塞进了 8GB 显存笔记本:128K、多模态、Thinking,一键安装还能接本地 Agent

已定时 已固定 已锁定 已移动 LLM讨论区
qwen本地模型
5 帖子 3 发布者 246 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • bingqin wangB 离线
    bingqin wangB 离线
    bingqin wang
    德高望重
    编写于 最后由 bingqin wang 编辑
    #1

    抡锤的大家都不是小白 就不废话了
    a67eb58469e211990b8051e156a13f2c.png
    035deaab339dda47638ee187ab6c11d4.png
    真机演示视频(实际速度)在:https://live.csdn.net/v/539144?spm=1001.2014.3001.5501
    我自己的电脑配置:

    • RTX 4070 Laptop,8GB 显存
    • Intel i7-14650HX
    • 32GB 内存
    • Windows 11
      模型是 Qwen3.6-35B-A3B 的 Q4_K_M GGUF 版本,使用官方 llama.cpp CUDA 后端。

    现在的版本就是完整 35B 模型直接工作。

    • 短文本生成约 42.3 token/s

    • Thinking 模式约 42.1 token/s
      我把运行需要的东西都装进包里了:

    • llama.cpp b10355

    • CUDA 12.4 runtime

    • cuBLAS

    • GGML CPU/CUDA 后端

    • Microsoft VC++ 应用本地运行库

    • FFmpeg 和 FFprobe

    • 完整模型与多模态 projector

    • 本地对话 UI
      目标电脑不需要再安装 Python、Node.js、CUDA Toolkit、Visual Studio 或 VC++ Redistributable。

    只需要 Windows 10/11、兼容的 NVIDIA 驱动、8GB 级显存和 32GB 内存。

    安装过程就是:

    1. 使用密码 123 解压安装包。
    2. 双击 INSTALL_QWEN35B.bat。
    3. 等待模型校验和加载。
    4. 浏览器自动打开后输入密码 123。

    桌面会自动生成启动、停止和打开对话的快捷方式
    UI 可以直接添加:

    • 图片
    • 视频
    • 文本文件

    我实际测试了发票 OCR、图表读取、一般图片问答和视频画面识别。

    例如图表测试能够正确返回 BETA, 7,视频测试能够识别出画面中的验证码 8642。视频处理使用包内 FFmpeg,不需要用户另外配置。

    当前 projector 不支持音频。PDF 和 Office 二进制文件也没有在浏览器端强行乱解析,建议转换成文本或页面图片后再上传。

    Thinking 可以开,也可以关

    UI 可以选择:

    • 自动
    • 8K
    • 16K
    • 32K
    • 64K
    • 128K

    默认建议使用“自动”。短对话不会每次都背着 128K 历史跑,随着会话增长再逐步扩大预算。

    可以直接接自己的本地 Agent

    服务提供 OpenAI 兼容接口:

    Base URL: http://127.0.0.1:8090/v1
    API key: 123
    Model: qwen35b-local
    

    百度网盘:

    https://pan.baidu.com/s/1ff1XmuJTeb_TZa2Q9vVEfw?pwd=auj7

    提取码:auj7

    完整安装包解压密码:123

    UI 登录密码/API Key:123

    安装包约 21.82 GiB,请确认磁盘空间,并务必完整解压后再运行安装程序。

    1 条回复 最后回复
    3
    • williamlouisW 在线
      williamlouisW 在线
      williamlouis
      超级版主
      编写于 最后由 编辑
      #2

      上点图。兄弟。界面截图就行

      个人主页:xlkj.org Telegram https://t.me/xlkjorg

      bingqin wangB 1 条回复 最后回复
      1
      • williamlouisW williamlouis

        上点图。兄弟。界面截图就行

        bingqin wangB 离线
        bingqin wangB 离线
        bingqin wang
        德高望重
        编写于 最后由 编辑
        #3

        @williamlouis 必须落实

        1 条回复 最后回复
        0
        • stxpnetS 离线
          stxpnetS 离线
          stxpnet
          超凡大师
          编写于 最后由 编辑
          #4

          想看解决实际问题,上下文超过60K之后的实际数据。

          26-08-19
          双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
          8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

          bingqin wangB 1 条回复 最后回复
          0
          • stxpnetS stxpnet

            想看解决实际问题,上下文超过60K之后的实际数据。

            bingqin wangB 离线
            bingqin wangB 离线
            bingqin wang
            德高望重
            编写于 最后由 编辑
            #5

            @stxpnet 例如图表测试能够正确返回 BETA, 7,视频测试能够识别出画面中的验证码 8642 你说的实际问题还想问啥 我自己跑下给你结果就行 不麻烦
            上下文方面
            | 实际提示长度 | 验证位置 | 结果 | 预填充速度 |
            | 32,748 token | 50% | 通过 | 356.1 token/s |
            | 65,544 token | 8%、91% | 通过 | 350.1 token/s |
            | 119,998 token | 4%、50%、96% | 通过 | 346.2 token/s |
            速度反正能用 不吹玄学:120K 提示在测试机上预填充约 346.6 秒。128K 是需要的时候真能用,但是长上下文肯定没有那么流畅。不过咱们自己用不需要那么长吧,我自己上下文都是通过agent挂rag或者路由知识网解决。

            1 条回复 最后回复
            0
            • ,J johnnybegood 引用了 此主题

            你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

            厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

            有了你的建议,这篇帖子会更精彩哦 💗

            注册 登录
            回复
            • 在新帖中回复
            登录后回复
            • 从旧到新
            • 从新到旧
            • 最多赞同


            • 登录

            • 登录或注册以进行搜索。
            • 第一个帖子
              最后一个帖子
            0
            • 版块
            • 最新
            • 标签
            • 热门
            • 用户
            • 群组