跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(LCZ-Blue)
  • 不使用皮肤
  • LCZ-Green
  • LCZ-Blue
  • LCZ-Black
折叠
品牌标识

抡锤者

首页 版块 标签 硬件 AI 广场
Kk HhK

Kk Hh

@Kk Hh
取消关注 关注
关于
帖子
35
主题
2
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用
    Kk HhK Kk Hh

    @terry 就是思考内容太多了,但是做各种任务的检查和审计是比较核实的,他检查过一般没有什么遗漏。

    LLM讨论区 dgxspark qwen

  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用
    Kk HhK Kk Hh

    @johnnybegood 说:

    @Kk-Hh 单台多少钱买的?

    31000 人民币 JD买的,我是买的技嘉1T的版本,就以现在实际使用的情况来看,这机器也跑不了什么特别大的模型,买个1T版本就够了。

    LLM讨论区 dgxspark qwen

  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用
    Kk HhK Kk Hh

    说实话一个小机能跑成这样,你还要什么自行车啊。再买一台DGX SPARK 做双TP的QWEN 3.8 FLASH NEXT 或者 DPV4 FLASH 我觉得有点不太值,或者再买三台DGX SPARK 做4TP的 GLM 5.3 FLASH 更不值,我宁可多买点云端服务的额度。

    LLM讨论区 dgxspark qwen

  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用
    Kk HhK Kk Hh

    @MSHAVL 说:

    @kk-hh 目前掛在我ai max395上切VRAM/RAM 64/64gb下用IQ4xs搭配dsh也非常舒服,@41k上下文深度下pp200多/tg 20-30token/s開192k上下文,目前已經利用goal然後入睡前讓它大型專案開發,隔天早上起來收割。是確定可以做出前沿模型那種質量。但速度響應上就不苛求了。目前pp可能還有提升的空間應該會更好。

    替代文字

    我这个这个其实在300K TOKEN长度的时候 开MTP-3 其实生成速度也是 20-30token/s,TOKEN 最大长度在单台DGX SPARK可以设置成 1M 但是基于对这些FLASH 模型在云端使用的经验他们前500K还行,后500K 质量太差,所以我在本机就只开了500K的TOKEN长度。

    LLM讨论区 dgxspark qwen

  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用
    Kk HhK Kk Hh

    @terry 说:

    重要的不是别人说如何,是你自己感觉如何,你觉得好就行。

    在我的工作环境下,实测这个版本的qwen 3.8 next flash 要好于我的qwen3.8 27b q8,就是速度对于dgx spark来说还是提不上来。所以呢着急我就用线上的glm 5.3 flash 和qwen 3.8 flash ,不着急的晚上挂机的,就让这个本地跑。https://commandcode.ai 这个站有个好处中外的模型都有了,特别复杂的就花钱用贵的模型。我这个本地机器就是平时做挂机基础执行环节的。

    LLM讨论区 dgxspark qwen

  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用
    Kk HhK Kk Hh

    再啰嗦一句云端服务ollama cloud 的MAX现在好像不让新用户买了,原则还是ollama cloud 最便宜,其次https://commandcode.ai 也能用就是贵点
    7ba35d4d-0c60-4e1e-8f38-af0824beaef0-image.jpeg
    8420bb50-061d-4505-954e-97e8d495eb86-image.jpeg

    LLM讨论区 dgxspark qwen

  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用
    Kk HhK Kk Hh

    82b93ccd-07d8-44f3-b285-459fecc82adf-image.jpeg
    在我的配置下实际显存占用情况

    LLM讨论区 dgxspark qwen

  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用
    Kk HhK Kk Hh

    a2a9d319-e106-4a48-8add-6b35ae0db2f3-image.jpeg
    我补一张图这个是300-400K 的时候TOKEN生成速度。

    LLM讨论区 dgxspark qwen

  • 单台DGX 装qwen 3.8 next flash 500K token 长度,能用
    Kk HhK Kk Hh

    https://github.com/blazux/qwen3.8-Flash-DGX

    就这个质量还行把,接近Q8,一部分放显存里 一部分放硬盘上.token 长度500K。
    我修正了一些参数 YARN=1 CTX=500000 GPU_MEM=0.80 MTP=3 SEQS=2
    速度见下图,

    356943c0-92c1-46ae-ab48-d833c0364231-image.jpeg

    LLM讨论区 dgxspark qwen

  • 27B 本地模型能做严肃逆向吗?Qwen3.8 硬刚最近很火的 Ox Alpha(牛来)匿名模型实测
    Kk HhK Kk Hh

    27ad914a-794e-48ba-9caf-2c329fc2fce9-image.jpeg
    32a2208c-e0e3-45f1-b7eb-eb82dd3792f0-image.jpeg 如果人不参与的话只能做静态逆向,动态逆向这两个也都是傻子,如果一个问题每次只可能有30%的可能性复现,那么你就烧TOKEN 把,最后的结论AI 给的就是不可行。

    LLM讨论区 qwen-27b 本地模型

  • 有大神在本地部署 GLM 5.2 吗?
    Kk HhK Kk Hh

    我觉得还是用云端的挺好 ,GLM5.2的确很强 安全阈值又低 我最近用的也比较疯,OLLAMA CLOUD 应该基本上是最便宜的了。

    LLM讨论区 本地模型 glm

  • 有大神在本地部署 GLM 5.2 吗?
    Kk HhK Kk Hh

    5× DGX Spark+NVFP4+MTP 1M TOEKN ,我猜可能能跑,20W人民币。2x DGX STATION Q8 1M TOKEN 我猜也能跑 20W 美金。 其他服务器版本估计都是天价了。

    LLM讨论区 本地模型 glm

  • 有大神在本地部署 GLM 5.2 吗?
    Kk HhK Kk Hh

    GLM 5.2 是很强,想本地部署,但是成本太高了

    LLM讨论区 本地模型 glm

  • 我最近对AI有点顿悟了,发现架构能力和判断能力是最重要的!
    Kk HhK Kk Hh

    嘿嘿,我也是科班出身的,我是计科的 ,20年+的工作经历。很早我们就自己干了,我一直是叛军架构师,现在AI的发展,我只能说大公司要难受了。架构能力和判断能力自己自定义吧,适合你的就是最好的,包括模型选型,这个没法交流。根据我的了解,很多事情从公司层面根本没法想到现在的发展是相当的迅速,从展示层一直穿到汇编层,慢慢看后面更精彩。我们还是有底线的,至少守法,但是没底线的也有很多大神,肯定会越来越热闹了。

    Mark专区

  • 为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住
    Kk HhK Kk Hh

    --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0.0 --presence-penalty 1.5 --repeat-penalty 1.0 我说的是这些,用官方给的,其实整体来说我测的结果就是别改 例如 --presence-penalty 1.5 这个惩罚太高了,你找一个有难度点的连续步骤自己测一下就知道了

    LLM讨论区 rtx3090 open-code

  • 12 个模型压力测试:谁真“无审查”,谁只是会装?huihui、HauHau、ChatGPT、Gemini、Grok、本地 Qwen/Gemma 横评
    Kk HhK Kk Hh

    每种模型的越狱技术和方式不同,最终的结果也不同,使用越狱模型不是看越狱不越狱,而是要看你手里的模型是用什么方式越狱的,越狱后都有什么参数改变,和非越狱模型的参数差别在那里。

    LLM讨论区 gpt

  • 为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住
    Kk HhK Kk Hh

    建议你用官方默认的参数

    LLM讨论区 rtx3090 open-code

  • LLM API费效比图(每个任务的平均花费,cost per task)
    Kk HhK Kk Hh

    我现在的云端主力就是glm5.2+kimi2.7
    c6f77f10-91c0-47fa-8e35-a8debe982990-image.jpeg
    525532a4-61fd-41e9-bb50-eda8bd50e0e5-image.jpeg

    LLM讨论区 本地模型

  • qwen3.6 27b 35b 帮你们避个坑
    Kk HhK Kk Hh

    @stxpnet 说:

    @九龙杨生 参数,硬件各方面都有。我打算把我的HERMES配置来专门做调参师。 本地模型要玩起来要么升级硬件,要么不断优化参数。
    大家差不多,我只是在调教我的越狱模型

    LLM讨论区 本地模型 qwen-27b

  • qwen3.6 27b 35b 帮你们避个坑
    Kk HhK Kk Hh

    我就是一个ghidra 自动反编译工作流,当然反编译文件比较敏感我就不公开了,我的模型基本上是OLLAMA CLOUD订阅可以用到的模型

    用这个测试完

    正确完成的
    kimi-k2.7-code:cloud
    gemma4:31b-cloud

    知道一些但是明显模型训练数据不对,一本正经胡说八道的
    deepseek-v4-pro:cloud
    glm-5.1:cloud
    qwen3.5:cloud
    qwen3.6 27b 全Q8精度 256K TOEKN 本地
    qwen3.6 35b 全Q8精度 256K TOEKN 本地

    什么都不知道的
    minimax-m3:cloud
    nemotron-3-ultra:cloud

    LLM讨论区 本地模型 qwen-27b
  • 登录

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组