7900XTX+Qwen 3.8 27B Q4 + DeepSeek Harness 实测
-
我的配置
项目 配置 系统 Ubuntu 26.04 LTS CPU i5-12600KF 内存 32 GB 显卡 AMD RX 7900 XTX 24G 推理后端 llama.cpp 模型 Qwen 3.8 27B,Q4_K_M 量化 Agent 框架 DeepSeek Harness( @deepseek-ai/dshv0.1.0-rc.6)模型文件约 16G,24G 显存能全部塞进 GPU
速度实测
场景 输入长度 输出 token 首字延迟 生成速度 简单问答 67 tok 128 0.29s 33.4 tok/s 写代码 127 tok 512 0.15~0.31s 33.0 tok/s 长文档问答(9K 上下文) 9,392 tok 160 0.17~0.22s 29 tok/s 冷启动预填充(2.8K 新提示) 2,815 tok — 4.25s ~663 tok/s 具体让它干了什么
手上有一个电机工程的技能包(一个
.skill文件,里面是算法脚本),功能是把电机 MAP 长表转成四象限二维 Lookup Table,给 MATLAB/Simulink 用。任务是:把它工程化成一个符合 MCP 规范的 Server,让 Claude Desktop、Cursor、Kimi 这些支持 MCP 的客户端都能直接调用。它自己用了快20分钟,生成了交付物,我测了一下,效果确实是我想要的效果,看起来实现的非常不错。它自己开发,测试脚本自己写自己测,整个流程都是它自己在优化,全程没有在指导过什么。
总结:非常好用,能力很强的稠密模型再加上harness工程,确实是一把干活的利器。 -
这个截图到没有,晚上快快的部署了,用了用,qwen3.8 27B的思考链太长了,有时候还会重头思考,3.6 27B好像没有出现过这个问题。上面那个任务它跑了20多分钟。花在思考上的时间非常多,明天准备把思考链关了试试,看看输出有没有太大区别。