@terry 就是思考内容太多了,但是做各种任务的检查和审计是比较核实的,他检查过一般没有什么遗漏。
Kk Hh
-
单台DGX 装qwen 3.8 next flash 500K token 长度,能用 -
单台DGX 装qwen 3.8 next flash 500K token 长度,能用@Kk-Hh 单台多少钱买的?
31000 人民币 JD买的,我是买的技嘉1T的版本,就以现在实际使用的情况来看,这机器也跑不了什么特别大的模型,买个1T版本就够了。
-
单台DGX 装qwen 3.8 next flash 500K token 长度,能用说实话一个小机能跑成这样,你还要什么自行车啊。再买一台DGX SPARK 做双TP的QWEN 3.8 FLASH NEXT 或者 DPV4 FLASH 我觉得有点不太值,或者再买三台DGX SPARK 做4TP的 GLM 5.3 FLASH 更不值,我宁可多买点云端服务的额度。
-
单台DGX 装qwen 3.8 next flash 500K token 长度,能用@kk-hh 目前掛在我ai max395上切VRAM/RAM 64/64gb下用IQ4xs搭配dsh也非常舒服,@41k上下文深度下pp200多/tg 20-30token/s開192k上下文,目前已經利用goal然後入睡前讓它大型專案開發,隔天早上起來收割。是確定可以做出前沿模型那種質量。但速度響應上就不苛求了。目前pp可能還有提升的空間應該會更好。

我这个这个其实在300K TOKEN长度的时候 开MTP-3 其实生成速度也是 20-30token/s,TOKEN 最大长度在单台DGX SPARK可以设置成 1M 但是基于对这些FLASH 模型在云端使用的经验他们前500K还行,后500K 质量太差,所以我在本机就只开了500K的TOKEN长度。
-
单台DGX 装qwen 3.8 next flash 500K token 长度,能用重要的不是别人说如何,是你自己感觉如何,你觉得好就行。
在我的工作环境下,实测这个版本的qwen 3.8 next flash 要好于我的qwen3.8 27b q8,就是速度对于dgx spark来说还是提不上来。所以呢着急我就用线上的glm 5.3 flash 和qwen 3.8 flash ,不着急的晚上挂机的,就让这个本地跑。https://commandcode.ai 这个站有个好处中外的模型都有了,特别复杂的就花钱用贵的模型。我这个本地机器就是平时做挂机基础执行环节的。
-
单台DGX 装qwen 3.8 next flash 500K token 长度,能用再啰嗦一句云端服务ollama cloud 的MAX现在好像不让新用户买了,原则还是ollama cloud 最便宜,其次https://commandcode.ai 也能用就是贵点


-
单台DGX 装qwen 3.8 next flash 500K token 长度,能用
在我的配置下实际显存占用情况 -
单台DGX 装qwen 3.8 next flash 500K token 长度,能用
我补一张图这个是300-400K 的时候TOKEN生成速度。 -
单台DGX 装qwen 3.8 next flash 500K token 长度,能用https://github.com/blazux/qwen3.8-Flash-DGX
就这个质量还行把,接近Q8,一部分放显存里 一部分放硬盘上.token 长度500K。
我修正了一些参数 YARN=1 CTX=500000 GPU_MEM=0.80 MTP=3 SEQS=2
速度见下图,
-
27B 本地模型能做严肃逆向吗?Qwen3.8 硬刚最近很火的 Ox Alpha(牛来)匿名模型实测
如果人不参与的话只能做静态逆向,动态逆向这两个也都是傻子,如果一个问题每次只可能有30%的可能性复现,那么你就烧TOKEN 把,最后的结论AI 给的就是不可行。 -
有大神在本地部署 GLM 5.2 吗?我觉得还是用云端的挺好 ,GLM5.2的确很强 安全阈值又低 我最近用的也比较疯,OLLAMA CLOUD 应该基本上是最便宜的了。
-
有大神在本地部署 GLM 5.2 吗?5× DGX Spark+NVFP4+MTP 1M TOEKN ,我猜可能能跑,20W人民币。2x DGX STATION Q8 1M TOKEN 我猜也能跑 20W 美金。 其他服务器版本估计都是天价了。
-
有大神在本地部署 GLM 5.2 吗?GLM 5.2 是很强,想本地部署,但是成本太高了
-
我最近对AI有点顿悟了,发现架构能力和判断能力是最重要的!嘿嘿,我也是科班出身的,我是计科的 ,20年+的工作经历。很早我们就自己干了,我一直是叛军架构师,现在AI的发展,我只能说大公司要难受了。架构能力和判断能力自己自定义吧,适合你的就是最好的,包括模型选型,这个没法交流。根据我的了解,很多事情从公司层面根本没法想到现在的发展是相当的迅速,从展示层一直穿到汇编层,慢慢看后面更精彩。我们还是有底线的,至少守法,但是没底线的也有很多大神,肯定会越来越热闹了。
-
为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住--temp 0.7 --top-p 0.8 --top-k 20 --min-p 0.0 --presence-penalty 1.5 --repeat-penalty 1.0 我说的是这些,用官方给的,其实整体来说我测的结果就是别改 例如 --presence-penalty 1.5 这个惩罚太高了,你找一个有难度点的连续步骤自己测一下就知道了
-
12 个模型压力测试:谁真“无审查”,谁只是会装?huihui、HauHau、ChatGPT、Gemini、Grok、本地 Qwen/Gemma 横评每种模型的越狱技术和方式不同,最终的结果也不同,使用越狱模型不是看越狱不越狱,而是要看你手里的模型是用什么方式越狱的,越狱后都有什么参数改变,和非越狱模型的参数差别在那里。
-
为什么opencode等工具调用,本地3090部署的qwen27B,会开始说胡话,然后无限卡住建议你用官方默认的参数
-
LLM API费效比图(每个任务的平均花费,cost per task)我现在的云端主力就是glm5.2+kimi2.7


-
qwen3.6 27b 35b 帮你们避个坑 -
qwen3.6 27b 35b 帮你们避个坑我就是一个ghidra 自动反编译工作流,当然反编译文件比较敏感我就不公开了,我的模型基本上是OLLAMA CLOUD订阅可以用到的模型
用这个测试完
正确完成的
kimi-k2.7-code:cloud
gemma4:31b-cloud知道一些但是明显模型训练数据不对,一本正经胡说八道的
deepseek-v4-pro:cloud
glm-5.1:cloud
qwen3.5:cloud
qwen3.6 27b 全Q8精度 256K TOEKN 本地
qwen3.6 35b 全Q8精度 256K TOEKN 本地什么都不知道的
minimax-m3:cloud
nemotron-3-ultra:cloud