Heretic FP8 多维度 MTP 测试结果
内容类型 Prefill Decode MTP Accept%
code 529.8 tok/s 43.6 tok/s 94.5%
math 529.2 tok/s 43.7 tok/s 93.9%
prose 528.5 tok/s 43.1 tok/s 90.4%
tool 527.8 tok/s 43.0 tok/s 89.3%
short 527.1 tok/s 43.0 tok/s 88.2%
long_prompt 526.6 tok/s 42.9 tok/s 87.3%
平均 - 43.2 tok/s 90.6%
linghu007
-
AMD R9700 實測:ROCm 10,Qwen38-27B-UD-Q6_K、128K context 和 MTP -
AMD R9700 實測:ROCm 10,Qwen38-27B-UD-Q6_K、128K context 和 MTP抱歉,模型是Qwen3.8-27B-Uncensored-FP8.Q6_K.gguf ,刚那个贴错了。
-
AMD R9700 實測:ROCm 10,Qwen38-27B-UD-Q6_K、128K context 和 MTP抄作业结果。
模型:mlasli/Qwen3.8-27B-Heretic-Uncensored-Q6_K-GGUF
显卡:R9700 32gHeretic FP8 测试结果(Vulkan + R9700)
实际输入 tokens
Prefill tok/s TTFT (s) MTP Accept%
2,048 684 26.9 98.5%
32,768 623 78.1 99.0%
65,536 498 162.4 99.3%
对比论坛帖子(ROCm 10 + R9700)
输入 tokens 他的 Prefill 我们的 Prefill 他的 TTFT 我们的 TTFT
2,048 785.5 684 2.68s 26.9s
32,768 555.6 623 59.1s 78.1s
65,536 410.1 498 160.0s 162.4s
分析:我们的 Prefill 速度接近(Vulkan vs ROCm 差异不大)
TTFT 差异大是因为他的 TTFT 只算 prefill,我们的包含其他开销
MTP acceptance 非常高(98-99%),说明 MTP 工作正常
Decode 速度约 45 tok/s,和之前测试一致AI的分析对吗
-
單張R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4多谢分享,但我试了,同样参数我显存不够(大概多了2g),我开机100M显存占用。
-
Hermes Desktop 桌面版快速上手指南@wml-ai WLS2和win本来就可以分别配置2套hermes啊。为啥要搞个云端的呢?
-
R9700到货,AI+Hermes部署llama.cpp+Qwen3.6-27B-Q4_K_M一次成功!@williamlouis 显卡日常价格就是10900,现在618奸商搞的。但我看了下CUP和内存反而降了,不过我看的是二手。显卡才是新的。
-
Hermes Desktop 桌面版快速上手指南@kop-wang 主要我之前迁移过一次从WIN11迁移到WLS2,确实麻烦。而且很多配置在WLS2中是单独设置的,如果迁移到WIN11,使用桌面版确实可能要调试一番。所以它也是比较了解我的系统状况,给的建议我也要参考。
-
R9700到货,AI+Hermes部署llama.cpp+Qwen3.6-27B-Q4_K_M一次成功!
兄弟,你这套配下来多少钱啊?
图是我准备配的配置。主要是考虑DDR4升级便宜些。CUP缓存大256M。电源大是因为将来顺便升级双显卡。 -
Hermes Desktop 桌面版快速上手指南AI让我别换。哈哈
Hermes ───────────────────────────────────────────────────────────────────────────────────────────────────────────╮
看完了,总结一下关键信息:Hermes Desktop 是什么 - 独立桌面 App,自带 GUI,不依赖命令行 - 内置了一个本地 TUI gateway(端口 9119),直接连到本地 Hermes 环境 - 卖点:免配置 Messaging Gateway、语音对聊、视觉化 Profile/Agent 人格、视觉化定时任务 几个需要注意的问题(文章里提到的) - 部分自定义配置(WSL2 里手动改过的)在桌面版里会显示灰色/空白,且改了就回不去了 - Windows 10 上存在中文输入发不出去的问题(跟 TUI 服务有关) - 打字偶尔会丢末尾几个字(升级有用但不能完全解决) - 如果配置了错误的 remote URL 会卡在 connecting,需等待 30 秒修复界面 核心矛盾 桌面版走的是自己的 TUI gateway(9119),跟你 WSL2 里配的 systemd gateway 是两套体系。要换过去意味着: - cronjob 需要迁移到桌面版新的 cron 系统 - Telegram Bot 等 messaging 配置需要重新接 - 各种脚本(监控/信号/推送)不一定能直接用 结论: 这篇文没改变我的判断。如果你现在跑得稳,没必要换——换过去工作量不小,而且还有 bug。如果想尝鲜体验 GUI,可以在另一台机器上装,WSL2 继续当主力跑。 -
分享:4090/48G, R9700/32G, AI Max 395 (8060S) 跑大语言模型的实测数据R9700还是在我意向购买的最终目标中,因为架构更新,未来支持更久,虽然慢点,但可以支持4卡并联,性价比也高。
-
5700G AX370 +32G 内存、系统linux mint 想入手RX 7900XTX 跑本地大模型写代码,玩文生图,文生视频,各位大佬看看这套配置可以吗,欢迎各位大神来喷,显卡到货长期更新此贴,实战报告奉上!!显卡换了就能跑。
CPU在推理时其实帮不上忙,除非你溢出到内存。 -
抡锤者社区正式上线火线留名支持!每天都在看,我还没开始配置显卡,先学习。