跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. AI硬件
  4. 【GTX 1070 8G】NVIDIA GeForce GTX 1070 (8G 华硕) 跑Qwen3.6-35B-A3B ,14~19 token/s ,【补论坛显卡数据库,需要生产力的不用看】

【GTX 1070 8G】NVIDIA GeForce GTX 1070 (8G 华硕) 跑Qwen3.6-35B-A3B ,14~19 token/s ,【补论坛显卡数据库,需要生产力的不用看】

已定时 已固定 已锁定 已移动 AI硬件
7 帖子 4 发布者 78 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • jason anJ 离线
    jason anJ 离线
    jason an
    编写于 最后由 编辑
    #1

    先定性,本帖只给想尝试自己搭建大模型,还没有升级、购买设备的朋友做个参考,顺便补充一下论坛硬件数据库的资料。

    8G显存显卡,两个月前不具备生产力,搭配Hermes蠢得要死,勉强能作为玩具,尝尝鲜,感受一下自动化Agent是啥,但是编程,复杂任务很难完成,多轮后,容易陷入一直调用工具的循环,Hermes超时没了反应。

    但是现在,搭配Deepseek Harness,竟然能够干一些简单的活了,编写个小游戏,写个文章啥的,已经有模有样。至少是真的可以干活了。

    harness真牛逼,他的任务约束能力,至少让这个傻缺模型智能上了两个档次,从学前班成长为初中生的级别。

    因为不是玩AI主力配置,就大概展示一下数据,作为一个参考。

    硬件

    01.png

    软件

    llama-b9310-bin-win-cuda-12.4-x64

    我懒,具体看图

    02.png

    03.png

    04.png

    05.png

    06.png

    上面是运行了一下 Deepseek harness 的日志。下面是直接用网页版,直接访问llama.cpp 模型的截图。

    07.png

    08.png

    09.png

    启动设置:

    @echo off
    chcp 65001 >nul
    title Qwen3.6-35B-A3B 越狱版
    
    cd /d "%~dp0"
    
    :menu
    cls
    echo ==========================================
    echo      Qwen3.6-35B-A3B 越狱版+多模态模型
    echo              
    echo ==========================================
    echo.
    echo 1. Qwen3.6-35B-A3B-Uncensored-Q4_K_M (20G、多模态、综合最优)
    echo.
    echo ==========================================
    
    set /p choice=请输入数字:
    
    if "%choice%"=="1" (
        llama-server.exe ^
        -m "models\Qwen3.6-35B-A3B-Uncensored-Q4_K_M.gguf" ^
        --mmproj "models\mmproj-Qwen3.6-35B-A3B-Uncensored-f16.gguf" ^
        -ngl 999 ^
        --n-cpu-moe 99 ^
        --flash-attn on ^
        --jinja ^
        --api-key 123123 ^
        -c 131072 ^
        -n 8192 ^
        -t 12 ^
        -b 512 ^
        --cache-type-k q4_0 ^
        --cache-type-v q4_0 ^
        --mlock ^
        --no-mmap ^
        --image-min-tokens 1024 ^
        --host 0.0.0.0 ^
        --port 8080
    )
    
    pause
    

    我需要比较长的上下文,开了131072上下文。如果调小一点,速度还会提高。我最大调262144,也能跑的动,速度有所下降。调小了能提高,但是最高也就到19 token/s,再也上不去了。我感觉15 token/s 勉强能接受,写个东西阅读能跟的上,可以调用Hermes,做一些小任务,编程不行。编程还得用DSH调用,勉强能做一些东西,智力还是稍微差一点。另外就是上下文用了超过60%,速度会慢,有时候不给他任务,他后台大模型还会自己调用工具循环,不知道什么原因,我现在强制他不循环调用工具,会好一点,很少像死机一样没反应了。

    本文就是就是给没来得及上车的游戏党玩家做个参考,利用手中的工具,看看大概能跑个什么数值。这显卡做生产力还是差的有点多。

    另外就是不用去试其他大模型了,9B及以下的模型,速度可能比较快一点,但真的智力更堪忧,千问Qwen3.6-35B-A3B,应该是综合性价比最高的,其他厂家的模型,各种量化版本也都试过几十个,输出token速度大多是个位数,8G显存档基本上可以不用试了。这个基本就是8G档的最优模型。

    1 条回复 最后回复
    3
    • jason anJ 离线
      jason anJ 离线
      jason an
      编写于 最后由 编辑
      #2

      忘了说了,这个是大力飞砖,配置卸载的层数不对,是按照3060 12G,64G内存写的,在这个机器上也能跑,只是都放内存里让cpu跑了。3060 12G那个机器能跑37 token/s .

      1 条回复 最后回复
      0
      • dardeaw fengD 离线
        dardeaw fengD 离线
        dardeaw feng
        编写于 最后由 编辑
        #3

        Ornith 1.5 35B可以試試看,同樣是Qwen 3.5用新的COT模式訓練上來的,體驗上可靠度比四個月前的Qwen 3.6 35B好一點

        jason anJ 1 条回复 最后回复
        0
        • dardeaw fengD dardeaw feng

          Ornith 1.5 35B可以試試看,同樣是Qwen 3.5用新的COT模式訓練上來的,體驗上可靠度比四個月前的Qwen 3.6 35B好一點

          jason anJ 离线
          jason anJ 离线
          jason an
          编写于 最后由 编辑
          #4

          @dardeaw-feng 说:

          Ornith 1.5 35B可以試試看,同樣是Qwen 3.5用新的COT模式訓練上來的,體驗上可靠度比四個月前的Qwen 3.6 35B好一點

          好滴,你这个建议我试试。非常感谢!

          1 条回复 最后回复
          0
          • terryT 离线
            terryT 离线
            terry
            超级版主
            编写于 最后由 编辑
            #5

            我弟牛逼,这个玩意都能测试,看来我家里的老古董,也要拿出来看看了😂

            油管:https://www.youtube.com/@抡锤者

            1 条回复 最后回复
            0
            • kos orK 离线
              kos orK 离线
              kos or
              超凡大师
              编写于 最后由 kos or 编辑
              #6

              聽說這個小模型很強 MiniCpm5-2B
              有機會可試試看

              jason anJ 1 条回复 最后回复
              0
              • kos orK kos or

                聽說這個小模型很強 MiniCpm5-2B
                有機會可試試看

                jason anJ 离线
                jason anJ 离线
                jason an
                编写于 最后由 编辑
                #7

                @kos-or 说:

                聽說這個小模型很強 MiniCpm5-2B
                有機會可試試看

                好滴,周末下载个玩玩看。不知道能干活不。我以前下过2B级别的小模型,除了吐字快,其他的似乎没啥用,都不行。驱动Agent有点傻,写文章很生硬,甚至英文插在仙侠文中蹦出来,还有给你凑字数,不停的复制粘贴相同段落,总之挺傻缺的。

                1 条回复 最后回复
                0

                你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                有了你的建议,这篇帖子会更精彩哦 💗

                注册 登录
                回复
                • 在新帖中回复
                登录后回复
                • 从旧到新
                • 从新到旧
                • 最多赞同


                • 登录

                • 登录或注册以进行搜索。
                • 第一个帖子
                  最后一个帖子
                0
                • 版块
                • 最新
                • 标签
                • 热门
                • 用户
                • 群组