感谢分享,我之前也有过这样的想法,不过碍于内存价格没有实践。这么来看内存带宽是我之前完全忽略的死角,我原本以为 DDR5 内存比 SSD 更快体验只会更好,没想到还是不够快 
linkdesu
-
Qwen3.8-Flash-Next Q4_K_XL 本地实测:48GB 显存 + 128GB 内存,实际能跑到什么程度? -
骂AI真的有用,DeepSeek等主流模型很吃这一套,GPT反应冷淡。用和人相处的方式驾驭AI效率更高!@terry 老特,看到视频中你提到了没有验证邮箱就不能上传图片的问题,我才意识到我的账号好像遇到了一个 BUG:我现在没有任何地方可以重发验证邮件了。
我早起没有验证是因为邮件链接打开页面报错,然后前段时间绑定了 Google 登陆,最近想发帖却无法上传图片了,我就想补一下邮箱验证,但是在设置页面中怎么都找不到这个功能。求帮助
-
mac m5 ultra上线中国官网。1.2T显存带宽,256GB版本8.6万关键还是看个人生产力吧,如果业务收入多,又是跑在 mac 上,搞个集群也合理。不过这样的机会太少了,我之前只看过 X 上有个老哥做预测市场套利买了一堆 mac studio 在跑

-
【避坑指南】CMP 170HX 是一张完全不值得推荐的卡。没买的就不要入坑了。初看以为 100U ,心动,再看已经炒到 2000U ,那只说,这个展开我好像之前在某个 meme 币上见过

-
零代码编程小记——一次完全放手的VibeCoding心路历程感谢分享思路,确实和我的感受一样,以前团队的组建其实也是这样。 leader 也不可能每行代码都审计,到头来每个人做的其实就和今天 agent 做的一样。而且这个标题让我想到了工业革命的时候,第一批机器出来时是不是也有很多工人围在一起,讨论这机器还不如老师傅的手艺。就像我们今天,还会有很多人聚在一起,讨论围观这些 AI 大模型到底行不行

-
7900xtx qwen3.8 27b 63t/s@hayate 居然能上 50 t/s 你让我决定还是试一试了,这个速度用来跑一些小的任务还是很香的。
-
一直没找到在DGX上能完全满意的一套模型配置@soop-ladios 更进一步 2 台 DGX Spark 可以实现 1+1 > 2 的效果,看到没人提就分享一下,成本很高大家量力而行吧。仓库链接: https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark
-
SGLang运行Qwen3.6-27B-AWQ/FP8成功(双3080 20G)50+ token/s 是真香,用过才知道 20+ 还是太苦了
-
QWEN 3.8 27B 暂定 今晚(8-14) 23点就等 3.8 27b 了,真是中国 AI 才是真的 openai

-
# [求助] MiniMax H3 ref_video(参考视频)输入完全不生效 — R9700 / ROCm 7.2.4@terry 本来没什么想说的,但是看到老特又强调一次 hermes ,我真的得好好感谢一下,最近电脑的运维完全交给它了,能力很不错,真的很省心。就是 deepseek 突然说要涨价有点遗憾

-
【交作业】7900 XTX + ROCm + ComfyUI 调优小结干货
,我也是听老特的入了 7900XTX 来做视频,因为是放身边的游戏主机先尝尝咸淡,所以最后还是吧安静放在了第二位,第一位当然是能跑,结果就是今天收到显卡后发现真的好安静。而且 H3 今天也很顺利跑起来了,我因为是兼顾玩游戏用的 windows 系统,所以直接上机智罗老师的整合包非常方便,也是要感谢老特的分享
-
[M5Max] vs [AI PRO 9700] 在 ubuntu 26/windows 11 上的性能对比,好像不折腾也能行?[M5Max] vs [AI PRO 9700] 在 ubuntu 26/windows 11 上的性能对比,要不要折腾?
之前因为买错了 M5Max ,所以手里正好可以用来对比,然后最近看了抡锤者频道听到某期老特说 AI PRO 9700 就是他心中的白月光,于是心中起了邪念决定买回家好好玩弄一番,不是,是好好评测一番。
我个人这边主要的需求是编程,跟老特不太一样,我因为行业原因非常重视信息安全,不论是 llm wiki、memory 整理还是编程我都希望用本地模型解决,所以我的关注点主要在代码生成上。先说结论:
愿意折腾 Linux + AI PRO 9700 是不错的方案,不愿意折腾 Windows + AI PRO 9700 也完全能用。
评测标准我没有做到特别严谨,但是尽可能保证了两个最贴合日常使用的痛点:
- 尽可能不折腾,对的,你没看错,我想要的是玩 3D 打印而不是玩 3D 打印机,此处同理。
- 尽可能贴近日常使用,这里用了我最近偶然发现的 guidellm 这个测试工具。
guidellm 这个工具也顺便推荐一下,它是通过 api 去调用 llm 服务进行跑分,并且会持续一段时间,这段时间持续下来后会达到设备在功耗和性能上的平衡点,原理我也不是特别懂,但是看数据和我正常使用的情况下性能衰减到稳定状态时非常接近。很多新朋友可能不太理解的一点是常看的跑分数据可能需要 /2 才能获得真实场景下长时间运行时的性能,所以我这里使用的数据更加接近真实使用时的感受。但是还是请注意,这个评测不保证绝对的严谨。
qwen3.5-9b 并发评测
这里我先用了 qwen3.5-9b 模型来做性能对比,主要原因是这个模型比较小,能够测试并发,实际用 AI Agent 做过开发的朋友应该都会有一个感受,一旦开始利用 AI 开发,“你”就是最后的瓶颈,怎么优化掉“你”就是这个系统里面性能优化的关键。目前比较前沿的实践就是通过 AI Agent 团队来解决这个问题,所以本地能够比较好的支持并发也是非常有意义的。接下来先看跑分图(所有跑分都是取第二次运行,已经确保预热过后的分数):
M5Max + oMLX + lmstudio-community/Qwen3.5-9B-MLX-4bit
这里做一个简单的说明,如果只关心吞吐,那么可以看图片底部的
Server Throughput Statistics,其中Input Token Per Sec就是 Prefill 速度,Output Token Per Sec就是生成速度。9b 的测试数据都有 3 组,依次代表 1、2、4 并发下的性能。
Mac 上 MLX 模型有特别的优化,并且 oMLX 的使用也是非常简单,不需要任何命令行操作只要理解模型的参数设置即可获得不错的性能,所以这里采用了 oMLX + lmstudio-community/Qwen3.5-9B-MLX-4bit 的组合。
Ubuntu Server 26.04 + AI PRO 9700 + llama.cpp latest + unsloth/Qwen3.5-9B-Q4_K_M

Ubuntu 仍然是最折腾的环境,小白劝退,但是评测看到最后你会发现就算 Windows 也不用眼红。
Windows 11 + AI PRO 9700 + lmstudio + ROCm latest runtime + unsloth/Qwen3.5-9B-Q4_K_M

Windows 上 lmstudio 是当之无愧的最简单运行环境,我最开始只有 RTX4070 的时候就是用这个软件先开始尝试了一下本地翻译模型,理解了其实用价值。唯一的使用门槛就在于你的网络环境和理解模型参数上。
Windows 11 + AI PRO 9700 + lmstudio + Vulkan latest runtime + unsloth/Qwen3.5-9B-Q4_K_M

由于看国外大神的评测发现 ROCm 和 Vulkan 的性能会有差距,而且在 lmstudio 里面点点鼠标就能更换,所以我这里就多测了一种运行环境。本来说实话是感觉有点浪费时间的,但是不要走开看到后面你就懂了。
qwen3.6-27b 评测
然后我用了实际工作中发现最稳定的模型 qwen3.6-27b 来进行测试,这个模型和 35B-A3B 之间的讨论很多,不过碍于篇幅,我这里就不展开了。总之它很具有代表性,这个模型能跑得快,那么 35B-A3B 模型可以预期有 2.5~3 倍的速度提升。
M5Max + oMLX + Jundot/Qwen3.6-27B-oQ4e-mtp

初看感觉是慢,实际使用体验是真慢。所以后来我还是入了 AI PRO 9700 ,因为实际使用中这台设备一旦负责翻译、llm wiki 索引等工作,偶尔再来一个 coding 任务就会慢上加慢。但是好吧这类设备也有一个得天独厚的优势,就是可以通过 ds4 这个项目跑起来 deepseek v4 flash ,知识面是非常齐全的。
Ubuntu Server 26.04 + AI PRO 9700 + llama.cpp latest + unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-MTP-Q5_K_M

看到这里相信大部分朋友已经感受到了 AI PRO 9700 的舒适感,我稍微想要补充一下的是,我这两天发现单 AI PRO 9700 最大的问题就是没有更多的显存去开并发。32GB 显存如果跑 Qwen3.6-27B-Q5_K_M 就要占用 19GB ,想开并发并非不可能但是单个我也只敢开 160KB 的 context ,所以更不推荐并发了。
Windows 11 + AI PRO 9700 + lmstudio + ROCm latest runtime + unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-MTP-Q5_K_M

Windows 11 + AI PRO 9700 + lmstudio + Vulkan latest runtime + unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-MTP-Q5_K_M

这张图中的结果非常让我意外,后来我又尝试了多次,基本就在这个结果附近波动。lmstudio 上使用 Vulkan latest runtime 运行 qwen3.6-27b 不需要任何折腾,然后你就可以获得一个十分不错的性能。
下面是 AI 的总结:

好了,希望对于最后坚持到这里的各位这些跑分能够帮助到一些现在还在观望等待的朋友,对于现在的显卡价格我也是无力吐槽的,只能祝愿大家都能早日把老特的白月光抱回家好好享用一番。老特这方面的品味确实不错

最后附上用的命令:
# 跑 9b 的命令 guidellm run \ --backend kind=openai_http,target=http://192.168.50.x:8000,model=qwen3.6-9b-q4 \ --tokenizer kind=huggingface_auto,model=unsloth/Qwen3.5-9B \ --profile '{"kind":"concurrent","streams":[1,2,4]}' \ --constraint kind=max_duration,seconds=60 \ --data kind=synthetic_text,prompt_tokens=1280,output_tokens=280 # 跑 27b 的命令 guidellm run \ --backend kind=openai_http,target=http://192.168.50.x:8000,model=qwen3.6-27b-q5 \ --tokenizer kind=huggingface_auto,model=unsloth/Qwen3.6-27B \ --profile '{"kind":"concurrent","streams":[1]}' \ --constraint kind=max_duration,seconds=60 \ --data kind=synthetic_text,prompt_tokens=1280,output_tokens=280 -
各位佬,当前最适合16GB显存的黄金模型是哪个?qwen3.5-9b, Hy-MT2-1.8B 和 7B ,反正就是这类跑跑翻译的模型都能爽玩,配合 Trancy 等翻译工具看看 youtube 上的评测、科普视频能有很大帮助
-
AMD AI Pro R9700 LLM调教https://kyuz0.github.io/amd-r9700-ai-toolboxes/index.html 这里有个双 9700 在不同驱动下的 benchmark ,希望也能有帮助
-
双卡AI Pro R9700 32g,Qwen 3.6 27b FP8 256k SGlang部署成功@fcme 35B Q5 +1,这个模型处理 Human In The Loop 类型的任务很不错,长任务在 context 接近极限时容易出现循环或者过度思考
-
B站机智罗发布AMD显卡专用ComfyUI机智整合包V3,全面升级,支持全部AMD显卡!已经跑起来了,前来还愿。中间还遇到一个 MSVC 编译环境安装不对导致的 XB-BOX 节点无法跑通的问题,AI 也帮忙解决了。这里还是要提醒下部署遇到问题的小伙伴,一个是问 AI ,另一个更好的、有编程背景能够了解原理的,可以看他这个早期视频:
【AMD显卡:ComfyUI篇保姆级教程(第二集:ComfyUI本地安装部署)】 https://www.bilibili.com/video/BV1mp93ByEvZ/?share_source=copy_web&vd_source=6e803c938ba638d25972c5404816271b
这里面没用一键包,但是展示的内容可以说就是整合包V3的原理,以及整合包V3里面一带而过的各种依赖的安装细节。
-
7900xtx加显卡坞配这个笔记本是否可行?@566656661 谢谢提醒,我这边确认了一下型号是铭凡的 DEG1 显卡坞,官方标称接口确实是 PCIe 4.0x4 的
-
7900xtx加显卡坞配这个笔记本是否可行?我这边 oculink 显卡坞已经在跑了,没有兼容问题。从它的接口原理上来说只是 PCIE 的延长线,也不应该存在兼容性问题