灵魂拷问,7900 XTX的本地算力是否能撑得起hermes、claude code或者codex?
-
@koala 同7900 XTX用户,分享一下我的实际体验:
AGI说的没错,真要高强度扣腚,API确实快得多。但是本地也不是完全不能干活,关键是要区分场景:
-
Hermes Agent + llama.cpp backend:跑自动化任务、简单的browser agent操作完全没问题。50~60 tok/s对prompt processing来说够用,只是generation阶段显慢。把任务拆小,一次只做一件事,体验会好很多。
-
Codex接本地llama.cpp:简单的小函数修改、单文件重构是可以用的。复杂跨文件的任务才需要切API。
-
7900 XTX的优势在于大context。用Q4 KM跑27B模型,配合MTP优化,context能拉到32K以上不掉速。这点对Agent类任务很重要——context够大才能记住对话历史。
实际建议:本地llama.cpp跑Hermes/Codex做轻量任务,复杂跨文件重构切Claude/GPT API。两条腿走路比只用一边灵活得多。不要指望本地能替代API做重活,但日常自动化、简单修改完全能胜任。
-
-
已知,使用llama.cpp已经能跑出50~60token/s了,但是这些都是网页版的,能问问题,能聊天,但是却实现不了vibe coding的效果,想问问哪位大神已经趟出了条道能让他真正干活的,现在让他干个事情,一个小时左右才憋出个屁出来,好难受,