跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
  1. 主页
  2. 版块
  3. LLM讨论区
  4. Qwen3.8 27B AA综合评分与 DeepSeek V4 Flash 持平

Qwen3.8 27B AA综合评分与 DeepSeek V4 Flash 持平

已定时 已固定 已锁定 已移动 LLM讨论区
qwen-27bdeepseek
16 帖子 7 发布者 267 浏览
  • 从旧到新
  • 从新到旧
  • 最多赞同
回复
  • 在新帖中回复
登录后回复
此主题已被删除。只有拥有主题管理权限的用户可以查看。
  • 像素盒子像 像素盒子

    能上传,图片不要太大!

    stakiraS 离线
    stakiraS 离线
    stakira
    德高望重
    编写于 最后由 编辑
    #3

    @像素盒子 "错误 您没有权限执行此操作。" 一张 23KB 的 png,转成更小的 jpg 也不行。

    1 条回复 最后回复
    0
    • terryT 在线
      terryT 在线
      terry
      超级版主
      编写于 最后由 编辑
      #4

      1,并没有超越DeepSeek,我也非常看好Qwen3.8 27b,而且我A卡 N卡都部署了,今天的视频大家可以来看。单轮编码能力很好,但是它长线还是完全不如V4 Flash,基础能力相差很大,迭代之后差距更大。只能说小玩玩,后续想办法设计下特殊的工作流可以。超越V4 Flash的说法是碰瓷了。跑分都是轻任务,甚至单论,意义不大。而且Qwen开了思考之后,速度慢成狗,不开思考会降智力,那才是Qwen的真实水平。

      2,应该是你的问题,没人限制你,大家都能上传,你换个浏览器看看。

      油管:https://www.youtube.com/@抡锤者

      1 条回复 最后回复
      0
      • 九龙杨生九 离线
        九龙杨生九 离线
        九龙杨生
        技术大牛 劳动模范
        编写于 最后由 编辑
        #5

        感觉还是上下文长度限制了本地模型的能力;压缩几次就记不住前面的了。

        欢迎访问亿量科技官网
        欢迎访问亿量科技油管频道

        terryT 1 条回复 最后回复
        0
        • 九龙杨生九 九龙杨生

          感觉还是上下文长度限制了本地模型的能力;压缩几次就记不住前面的了。

          terryT 在线
          terryT 在线
          terry
          超级版主
          编写于 最后由 编辑
          #6

          @九龙杨生 最主要是注意力机制,上下文可以压缩,但是召回准确率差别是致命的。

          油管:https://www.youtube.com/@抡锤者

          九龙杨生九 1 条回复 最后回复
          0
          • terryT terry

            @九龙杨生 最主要是注意力机制,上下文可以压缩,但是召回准确率差别是致命的。

            九龙杨生九 离线
            九龙杨生九 离线
            九龙杨生
            技术大牛 劳动模范
            编写于 最后由 编辑
            #7

            @terry 这方面我就不专业了,最近有人跟我对接火山方舟的DeepSeek API资源,能够拿到折扣价;他这种抖音下面自建的和官方的模型能力是不是一样的呢?还是说在什么地方存在性能差距?

            欢迎访问亿量科技官网
            欢迎访问亿量科技油管频道

            terryT 1 条回复 最后回复
            0
            • 九龙杨生九 九龙杨生

              @terry 这方面我就不专业了,最近有人跟我对接火山方舟的DeepSeek API资源,能够拿到折扣价;他这种抖音下面自建的和官方的模型能力是不是一样的呢?还是说在什么地方存在性能差距?

              terryT 在线
              terryT 在线
              terry
              超级版主
              编写于 最后由 terry 编辑
              #8

              @九龙杨生 你要是做生意没啥,有机会就赚,火山引擎是字节跳动的,大厂实力不用担心。问题是你接触的确实是火山吗?你要是自己用,我擦,这三瓜俩枣的,何必呢。

              油管:https://www.youtube.com/@抡锤者

              九龙杨生九 1 条回复 最后回复
              0
              • terryT terry

                @九龙杨生 你要是做生意没啥,有机会就赚,火山引擎是字节跳动的,大厂实力不用担心。问题是你接触的确实是火山吗?你要是自己用,我擦,这三瓜俩枣的,何必呢。

                九龙杨生九 离线
                九龙杨生九 离线
                九龙杨生
                技术大牛 劳动模范
                编写于 最后由 编辑
                #9

                @terry 有两个渠道,一个是移动自建的,一个是火山的,我主要就是担心模型能力不如官方;渠道上游提供商没问题,只是可能有中间商赚差价,不过最终只要能够给出有竞争力的价格就行;

                欢迎访问亿量科技官网
                欢迎访问亿量科技油管频道

                terryT kop wangK 2 条回复 最后回复
                0
                • 九龙杨生九 九龙杨生

                  @terry 有两个渠道,一个是移动自建的,一个是火山的,我主要就是担心模型能力不如官方;渠道上游提供商没问题,只是可能有中间商赚差价,不过最终只要能够给出有竞争力的价格就行;

                  terryT 在线
                  terryT 在线
                  terry
                  超级版主
                  编写于 最后由 编辑
                  #10

                  @九龙杨生 缓存和成本很难做到官方那样,其它的没啥区别。只要你买到的便宜,你何必在乎呢?只不过第三方的V4 flash很难和官方的比速度,因为Engram架构,HCA/CSA这些注意力机制是DeepSeek的独门技术,没有开源。你自己用下要是没问题就搞就是了。自己用没必要啊,一共屁大需求,还不如把qwen3.8 27b玩明白。它能干脏活,剩下的给在线的。

                  油管:https://www.youtube.com/@抡锤者

                  1 条回复 最后回复
                  0
                  • stxpnetS 离线
                    stxpnetS 离线
                    stxpnet
                    超凡大师
                    编写于 最后由 编辑
                    #11

                    感觉不在一个赛道,27B的8位权重 ,8位KV CACHE,48 64G 72G显存应该都可以流畅的跑256K上下文了。 v4 flash要流畅本地部署,至少还要在单CPU上挂 128G 或256G DDR5内存吧?

                    26-08-19
                    双卡3090(8x8x无nvlink,p2p驱动) +Sglang+qwen 3.8 27B awq模型 [功耗异常弃用]
                    8-20 用vllm 0.26+ Qwen3.8-27B-SmoothQuant-W8A8-INT8 200K上下文 ~50t/s

                    1 条回复 最后回复
                    1
                    • kos orK 在线
                      kos orK 在线
                      kos or
                      超凡大师
                      编写于 最后由 kos or 编辑
                      #12

                      加上了GPT5.6-SOL and Luna Max 比較
                      我再找機會讓Luna Max and Qwen3.8-27 實際對壘

                      5d9bf3cd-dc10-402b-9668-ebb13a2e3dc1-image.jpeg

                      九龙杨生九 1 条回复 最后回复
                      0
                      • kos orK kos or

                        加上了GPT5.6-SOL and Luna Max 比較
                        我再找機會讓Luna Max and Qwen3.8-27 實際對壘

                        5d9bf3cd-dc10-402b-9668-ebb13a2e3dc1-image.jpeg

                        九龙杨生九 离线
                        九龙杨生九 离线
                        九龙杨生
                        技术大牛 劳动模范
                        编写于 最后由 九龙杨生 编辑
                        #13

                        @kos-or V4 FLASH MAX这么强的吗?和PRO基本上就差不多了;
                        Qwen3.8 27B估计就是输在长链任务上

                        欢迎访问亿量科技官网
                        欢迎访问亿量科技油管频道

                        kos orK 1 条回复 最后回复
                        0
                        • 九龙杨生九 九龙杨生

                          @kos-or V4 FLASH MAX这么强的吗?和PRO基本上就差不多了;
                          Qwen3.8 27B估计就是输在长链任务上

                          kos orK 在线
                          kos orK 在线
                          kos or
                          超凡大师
                          编写于 最后由 编辑
                          #14

                          @九龙杨生

                          Deepseek-V4-Flash 我沒開過Max, 都用一般的
                          但根據“某次測試”比較 GPT5.6-Luna Max 是比Terra Medium強

                          长链任务可能也要看 Agent 框架的Harness 能力 兩者配合就適合跑长链任务, Codex 接上Qwen3.8 27B 或許可以測試一番
                          Codex vs. Deepseek harness 框架

                          1 条回复 最后回复
                          0
                          • 九龙杨生九 九龙杨生

                            @terry 有两个渠道,一个是移动自建的,一个是火山的,我主要就是担心模型能力不如官方;渠道上游提供商没问题,只是可能有中间商赚差价,不过最终只要能够给出有竞争力的价格就行;

                            kop wangK 在线
                            kop wangK 在线
                            kop wang
                            超级版主
                            编写于 最后由 编辑
                            #15

                            @九龙杨生 opencode Go 的负责人多次表示,目前还没人能在和原厂能力持平的前提下,总成本低于原厂。

                            供参考

                            虚心交流,一起进步

                            1 条回复 最后回复
                            0
                            • kop wangK 在线
                              kop wangK 在线
                              kop wang
                              超级版主
                              编写于 最后由 kop wang 编辑
                              #16

                              感谢提醒,大概看了下,还是老问题,小模型的认知水平太差了。
                              64ac9893-131f-4412-aa3f-2499f4ec83eb-image.jpeg

                              这就导致即便他的逻辑能力,长上下文推理能力不弱于flash-preview,甚至能和0731来回。但因为底层认知有巨大鸿沟,所以他更依赖外部数据源的质量。也会比v4-flash-0731有更多的loop和试错。知识量的差距就是这样。

                              如果以后小模型能再进一步,可能小模型+配套行业的数据源的套餐组合是一套新打法。

                              但话又说回来,即便如此,他的实际解决问题的能力依然出众,确实厉害。
                              43626d02-420b-4f46-a6e7-338298d8f067-image.jpeg

                              对应的,在如此强的工具、Agent能力之下,256K的上下文其实已经有点瓶颈了。
                              上重一点的Agent就很有可能多次压缩,导致信息损失。

                              虚心交流,一起进步

                              1 条回复 最后回复
                              0

                              你好!看起来您对这段对话很感兴趣,但您还没有一个账号。

                              厌倦了每次访问都刷到同样的帖子?您注册账号后,您每次返回时都能精准定位到您上次浏览的位置,并可选择接收新回复通知(通过邮件或推送通知)。您还能收藏书签、为帖子顶,向社区成员表达您的欣赏。

                              有了你的建议,这篇帖子会更精彩哦 💗

                              注册 登录
                              回复
                              • 在新帖中回复
                              登录后回复
                              • 从旧到新
                              • 从新到旧
                              • 最多赞同


                              • 登录

                              • 登录或注册以进行搜索。
                              • 第一个帖子
                                最后一个帖子
                              0
                              • 版块
                              • 最新
                              • 标签
                              • 热门
                              • 用户
                              • 群组