有个新想法打算今晚下班试验一下
-
我看到好像还有一块r9600 32gb...价格比r9700 再便宜多50%
这我还真不知道,在京东转了一圈一点这卡的消息都没见着。
-
-
因为我看到rx9070, 所以我会想如果价格一样,可以尝试r9600

说实话我都怀疑这个显卡真的有生产过吗... 万能的淘宝都买不到。
-
@Bunsei
可能是转供马来西亚市场 -
@Bunsei
可能是转供马来西亚市场关键现在这个显存价格,如果他真是R9700一半的价格,我能买四张! 目测真有价格大概是R9700的70~80%左右。
-
刚换了模型,预填充有点爽,但是吐字速度和质量似乎又有点下降了, 不过待机功耗也下去了。 有点难取舍啊。
不过楼主如果有一张是9700,可看一下这人的仓库
https://github.com/mattbucci/2x-3090-GA102-300-A1-sglang-inference
他的仓库有些模型是写的3090双卡,有些模型又写的9700双卡。
如果你有高级的在线API,可以让它们给你改写那个人仓库里的源码,看能适合你的硬件不。 这人每个模型都有benchmark。感觉他可能是专业程序员,业余了搞搞。 -
@Bunsei
我这里的奸商又涨价了原本r9700 - 马币7000, 现在 马币10000 还缺货
我上个月看到他卖r9600 - 马币4800 跟还没涨价的5070ti 持平,现在。。。哼 -
刚换了模型,预填充有点爽,但是吐字速度和质量似乎又有点下降了, 不过待机功耗也下去了。 有点难取舍啊。
不过楼主如果有一张是9700,可看一下这人的仓库
https://github.com/mattbucci/2x-3090-GA102-300-A1-sglang-inference
他的仓库有些模型是写的3090双卡,有些模型又写的9700双卡。
如果你有高级的在线API,可以让它们给你改写那个人仓库里的源码,看能适合你的硬件不。 这人每个模型都有benchmark。感觉他可能是专业程序员,业余了搞搞。 -
-
-
我在京东上没找到啊,问了客服也说没有啊,大神给个链接呗
-
我在京东上没找到啊,问了客服也说没有啊,大神给个链接呗
-
@Bunsei 速度提升有代价,目前我了解的情况是,似乎只支持到131K上下文,我个人比较想要220K以上的上下文。看那个架构,可能要支持262K上下文也需要64G或72G显存
真心建议咱们试试,我这边测试结果非常优秀,提速大概是2倍。我正在整理测试数据今天晚点会再发个帖子。
下面是gpt的数据,我还没有整理:
值得,但要把它定位为“当前能落地的 PP 解码加速方案”,而不是 TP 的全面替代品。
实测依据:- 约 128K 深度下,普通 PP 解码约 12.77 t/s。
- PP + DFlash2 Q4 达到 25.61 t/s,约提升 2 倍。
- 短上下文任务最高达到 47.53 t/s,普通 PP 约 21 t/s。
- 129,481 token 完整预填充为 294.99 t/s;DFlash2 不加速预填充。
- FP16 KV、主模型、mmproj 和草稿模型全部驻留显存,没有 CPU offload。
- Q8 长程仅比 Q4 快 0.38%,却多占约 872MB,因此应选 Q4_K_M。
它特别适合: - 主模型采用 PP 分层;
- 128K 左右长上下文;
- 草稿模型、mmproj、output.weight 放在 R9700;
- 需要弥补 PP 单流解码较慢的问题;
- 以文本 Agent 为主。
-
测试了我的rtxpro 4500, Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q6_K_P
100k 上下文不会比你的快,最高40,最低 30, 但是我这个无审查只能输出英文。。。奇怪,唯有等llm46 出来后再看看









