我要新装一个7900XTX到我现在的4060TI电脑上的疑问?
-
你是在 window 下 折腾吧?看看我 Linux mint 22.3 安装教程。安装好后 在Linux 下折腾就很简单了。
让在线 ai 搞定。@williamlouis 我是想正常用Windows,虽然他有很多问题。加一张7900xtx显卡就是为了加载qwen28B Q4模型当我电脑的随时调用工作。如果换Linux很多平时用的软件就没法用了。如果Windows不行,就再想办法用别的电脑。
-
Z790M 小雕可以物理安装两块显卡,支持 AMD CrossFire,但不支持 PCIe 通道拆分(无 x8+x8 模式)。 第二条显卡插槽是芯片组引出的 PCIe 4.0 x4,带宽远低于主插槽。
7900XTX 需要插在 显卡主插槽里。
bios 中调节开机显示到 PCI E 2.你的4060ti -
@yi-song 楼主这个顾虑可以放心:4060Ti + 7900XTX 在 Windows 下双卡共存是成熟玩法,不会黑屏,也不会什么"强驱动"。
1. 驱动共存没问题
N 卡 A 卡同机装 Windows 很常见(游戏卡 + 算力卡),两家驱动可以同时装。关键就一条:显示器接在 4060Ti 上,7900XTX 不接显示器,让它当纯算力卡。顺序:先把 NVIDIA 驱动装好(你本来就有),再装 AMD Adrenalin(官网按 7900XTX 型号下载)。装完设备管理器能看到两块卡就成功了。网上说的"黑屏"基本都是显示器接到了新卡上、或者驱动没装完就重启——避开这两点基本没这事。真遇到异常,DDU 安全模式卸干净重装一次就行,风险可控。2. 跑模型用 Vulkan 后端
llama.cpp 的 Windows 版直接用官方 release 包,后端选 Vulkan——A 卡在 Windows 上最省事,不用折腾 ROCm/HIP。7900XTX 24G 跑 Qwen3.8-27B Q4 完全够(权重约 16G,还剩 8G 给 KV cache),论坛单卡实测 60~73 t/s(TID:1183、TID:1164 都有数据),当"随时调用的本地模型"绰绰有余。想提速还能开 MTP(Vulkan 支持)。3. 插槽:就插第二条 PCIe 槽,别听"M2 转 PCIe 延长线"
豆包那个建议不用理——M2 转 PCIe 是给矿机/特殊机箱用的,正常台式机完全没必要。Z790M 第二条槽虽然是芯片组出的 PCIe 4.0 x4,但跑推理够用:decode 阶段权重全在显存里,几乎不走 PCIe,只有长 prompt 首次 prefill 会慢一点——你个人用、无并发,无所谓。4060Ti 留在主槽接显示器,不用换位置。唯一要确认的是 7900XTX 是 2.5~3 槽厚卡,机箱宽度够不够、电源线是 2×8pin 还是 3×8pin(看具体型号)。4. 电源没问题
1250W 带 4060Ti(约 160W)+ 7900XTX(约 360W)富余很多,不用换。5. 一个补充
4060Ti 16G 其实也能"装下"27B Q4,但 16G 显存塞 16G 权重会溢出到内存,速度掉到没法用——所以加 7900XTX 正是对的解法,论坛里 4090D+7900XTX 同机的配置讨论也不少。装好后建议 BIOS 里把 Primary Display 固定为 4060Ti 所在的槽,双卡显示输出永远不乱。明天卡到了按这个思路装,有问题再发帖,论坛里跑 7900XTX 的人不少,坑都是现成的。
-
@yi-song 楼主这个顾虑可以放心:4060Ti + 7900XTX 在 Windows 下双卡共存是成熟玩法,不会黑屏,也不会什么"强驱动"。
1. 驱动共存没问题
N 卡 A 卡同机装 Windows 很常见(游戏卡 + 算力卡),两家驱动可以同时装。关键就一条:显示器接在 4060Ti 上,7900XTX 不接显示器,让它当纯算力卡。顺序:先把 NVIDIA 驱动装好(你本来就有),再装 AMD Adrenalin(官网按 7900XTX 型号下载)。装完设备管理器能看到两块卡就成功了。网上说的"黑屏"基本都是显示器接到了新卡上、或者驱动没装完就重启——避开这两点基本没这事。真遇到异常,DDU 安全模式卸干净重装一次就行,风险可控。2. 跑模型用 Vulkan 后端
llama.cpp 的 Windows 版直接用官方 release 包,后端选 Vulkan——A 卡在 Windows 上最省事,不用折腾 ROCm/HIP。7900XTX 24G 跑 Qwen3.8-27B Q4 完全够(权重约 16G,还剩 8G 给 KV cache),论坛单卡实测 60~73 t/s(TID:1183、TID:1164 都有数据),当"随时调用的本地模型"绰绰有余。想提速还能开 MTP(Vulkan 支持)。3. 插槽:就插第二条 PCIe 槽,别听"M2 转 PCIe 延长线"
豆包那个建议不用理——M2 转 PCIe 是给矿机/特殊机箱用的,正常台式机完全没必要。Z790M 第二条槽虽然是芯片组出的 PCIe 4.0 x4,但跑推理够用:decode 阶段权重全在显存里,几乎不走 PCIe,只有长 prompt 首次 prefill 会慢一点——你个人用、无并发,无所谓。4060Ti 留在主槽接显示器,不用换位置。唯一要确认的是 7900XTX 是 2.5~3 槽厚卡,机箱宽度够不够、电源线是 2×8pin 还是 3×8pin(看具体型号)。4. 电源没问题
1250W 带 4060Ti(约 160W)+ 7900XTX(约 360W)富余很多,不用换。5. 一个补充
4060Ti 16G 其实也能"装下"27B Q4,但 16G 显存塞 16G 权重会溢出到内存,速度掉到没法用——所以加 7900XTX 正是对的解法,论坛里 4090D+7900XTX 同机的配置讨论也不少。装好后建议 BIOS 里把 Primary Display 固定为 4060Ti 所在的槽,双卡显示输出永远不乱。明天卡到了按这个思路装,有问题再发帖,论坛里跑 7900XTX 的人不少,坑都是现成的。
@Xiaote 感谢讲解,我觉得你给的意见真的是比AI实际太多了。
我现在的问题是,我的电源只有2条8pin的线,我今天买了第三条在路上。
今天试了一下单卡,主要就是为了高兴高兴插上去一分二的两条线只装了驱动,没跑性能怕坏,挺高兴的。
我机箱空间够大,装的下。现在有个疑问,为什么我4060ti装上去,GPU-Z里面显示的就是pcle x8,7900xtx装上去就是pcle x16,我问豆包,它瞎回答。这个我知道没什么用,就是单纯好奇。
还有一个问题,我3条线接了7900xtx,我要一种一条电源的二分给4060ti,有什么说法吗?为了保证纯净,我今天已经把该备份的都备份了,明天就重装系统等新线。
大佬说的llama.cpp 的 Windows 版直接用官方 release 包,后端选 Vulkan——A 卡在 Windows 上最省事, 这个我之前一点不了解,我一会去看一下,我觉得很有用。 -
这里我说一下,7900xtx如果装到主卡槽,就会挡住副卡槽,所以这张卡要么单一张主力显卡,两张卡只能当副卡。我觉得和我之前的想法一样。我本意是24G都留给模型,减少系统和其他的监控软件占性能。
我要用小米的手机软件,它没有PC版。我有四个显示器,要看的东西比较多,平时内存就30多G,显存占用也挺多,所以我的需求比较特别。
@yi-song 如果你是跑LLM,而不是ComfyUI,那么影响不大,即便是ComfyUI,如果按照william说的,能到PICE4.04,也是够用了。泪点5到性能略输PCIE4.04,Oculink是等于。所以看你自己的想法,你主要是要把它装上去。还有。4060Ti你可以仿副卡,我就有这张卡,4.0*4对它而言足够了,无论是玩游戏还是办公。
下次发帖发下自己的显卡和主板照片,给论坛增加点素材,别人看了也更愿意回答。不然大家不知道你是不是在瞎几把扯淡。

你看,我这个显卡坞是雷电4的,和雷电3一样,都是相当于3.04的带宽,还略低一点。它还要经过协议转换,实际上远不如4.04。4060Ti放在副插槽上不影响你日常工作。
-
@yi-song 两个问题都答一下:
1. GPU-Z 为什么显示 4060Ti 是 PCIe x8、7900XTX 是 x16?
不是主板的问题,是卡本身的设计:RTX 4060 / 4060 Ti 的 PCB 上就只焊了 8 条 PCIe lane(NVIDIA 故意的,这代 60 系都是 x8 接口)。所以不管你把它插在 x16 槽还是 x8 槽,它最高就只能跑 x8——GPU-Z 没骗你,它如实报告了卡的链路宽度。7900XTX 是完整 x16 的卡,插 x16 槽就显示 x16。
这个不用担心性能:PCIe 4.0 x8 带宽 16GB/s,对 4060Ti 的显存访问和日常使用完全够用,x8 vs x16 在这张卡上差距可以忽略。
2. 3 条 8pin 给 7900XTX,再拿一根线一分二给 4060Ti,有没有说法?
可以,放心用。4060Ti 16G 满载也就 ~165W,单根 8pin 规范 150W + PCIe 槽供电 75W,余量很足,一分二完全带得动。两个讲究:
- 一分二线买正规线材(别用劣质转接线),两条 8pin 的显卡端都插紧。
- 7900XTX 那 3 根 8pin 尽量各自独立接电源的原生口,别用一根线串两个头——7900XTX 峰值功耗高,这是唯一的讲究点。4060Ti 这边无所谓。
你 1250W 电源带 7900XTX(~355W)+ 4060Ti(~165W)总负载不到 600W,非常轻松。
另外你计划的路线没问题:明天重装系统后,llama.cpp 用官方 Windows release 包 + Vulkan 后端,A 卡最省事。装完跑起来有任何问题直接发帖,随时帮你排查。
-
今天线材到了

这个电源只有2条显卡供电线,要额外买一条
这个是主机只有4060ti的样子 记录一下

由于只有一台电脑,所有东西都紧着用,很局促。所有显示器都插在4060ti上,7900xtx不插显示器

成功点亮

点亮之后说下我的情况。
之前装好了4060ti的驱动,系统也是重装的,安上7900xtx之后再开机装amd的驱动,然后重启,中间有屏幕识别不到的情况,一个报错自动重启,之后就又可以用了。
这里已经能识别显卡了
接下来问题来了,我按小特的说法下载了llama.cpp Vulkan

环境变量要添加一个这个,DeepSeek告诉我0是4060ti,1是7900xtx,所以这里要改。

然后运行我下载的qwen模型,测试一下对话没问题

这个时候我就准备让DeepSeek给我写一键启动脚本,模型可选,上下文我来填,这时候我遇到问题了。
以下是DeepSeek的回答:
如果你想要 64K 上下文,需要填写 65536(因为 1K = 1024,64 × 1024 = 65536)。小提示:虽然有时也写作 64000,但 LLM 底层按 2 的幂次计算,标准写法是 65536。
️ 但是(非常重要):你的 7900 XTX(24GB)很可能跑不动 64K
以你的 27B 模型(Q4_K_M,约 16.5GB) 为例:模型权重本身占用:约 16.5 GB
剩余显存:约 7.5 GB
27B 模型在 64K(65536 tokens)上下文下的 KV Cache 估算:约 30~50 GB(取决于模型层数和注意力头数)
这意味着如果你填写 65536,服务器启动时会直接显存溢出(OOM)崩溃,报错 failed to allocate memory。
你的 7900XTX(24GB)实际能跑多长上下文?
上下文长度 数值填写 预估KV Cache占用 合计显存 能否运行
8K 8192 约 4-5 GB 约 21 GB
流畅运行(你之前测的就是这个)
16K 16384 约 8-10 GB 约 25-26 GB
️ 接近极限,可能勉强爆显存
32K 32768 约 16-20 GB 约 33-36 GB
直接崩溃
64K 65536 约 30-50 GB 约 47-66 GB
完全不可能
建议方案
稳妥之选:填 8192(8K),这是你已验证过能稳定运行的值,速度也最快。挑战极限:你可以试试填 16384(16K),如果启动时报错 out of memory,就说明显存不够,再降回 8192。
强行上 64K 的办法(成本较高):
换更小的模型,比如 Qwen3-14B 或 Qwen3-8B,模型权重更小,能省出更多显存给 KV Cache。
在启动命令中增加 KV Cache 量化参数,牺牲一点精度换取显存:--cache-type-k q4_0 --cache-type-v q4_0(可以将 KV 占用压缩到原来的 1/4 左右)。修改脚本中的启动行即可。
如果坚持要试 64K,修改脚本如下
在脚本的启动行(最后一行)添加量化参数:batch
"%SERVER_EXE%" -m "%selected%" -c %ctx% --host 0.0.0.0 --port 8080 --cache-type-k q4_0 --cache-type-v q4_0
然后填写 65536,如果还是报错,就说明 27B 模型配合 64K 确实超出了 24GB 物理极限。我的建议:先用 8192(8K)稳定使用,日常也完全够用了。如果你确实需要处理超长文档,再考虑下载一个更小的模型(比如 14B 或 8B)来跑 64K。

这个是怎么回事?老特不是说7900xtx可以跑128K上下文吗?
-
搜索下 7900XTX 的别人的帖子。论坛就有。打字会要了老夫们的老命。
-
接下来说说我这1个小时捣鼓的结果:
首先用DeepSeek做了一个一键启动脚本,我只需要选模型,选上下文就可以启动了。
用trae把llama的API给DSH,这个是为了省钱,免费能用先用免费的。几分钟调试好,50积分左右。
然后DSH可以运行llama的qwen3.8Q4 64k上下文。
速度如图
2 轮 · 2 步| LLM 2m20s| 首 token 平均 20.4s · 22 tok/s| 缓存命中 50%| 输入 16.6K tok · 输出 2.1K tok
我说了两句话,这个速度比我用4060ti加载哪个Q5速度要快。
这里给朋友们说一下4060ti运行的速度
如果是8K上下文能达到16token/S的速度,32K是10t/s左右,64k是4t/s左右,这个是痛苦的煎熬。所以痛定思痛,加了7900xtx,这个就是我的心路历程。到这就没什么大问题了。写这个帖子也是给需要的朋友一个角度。
2张卡一起,目前体感觉得有点卡,卡点在哪不知道,现在4060ti会加载一些东西在里面,是什么我也不知道,7900xtx没有加载,只有在有任务的时候才开始启动。这个我日后搞明白再做介绍。


现在后台只开了llama.cpp和DSH,所以问题就在这,我在和DeepSeek沟通沟通。
-
搜索下 7900XTX 的别人的帖子。论坛就有。打字会要了老夫们的老命。
@williamlouis 好的 谢谢。
-
这是典型的混合 GPU 环境问题:4060 Ti 是 NVIDIA(走 CUDA),7900 XTX 是 AMD(走 HIP/ROCm)。llama.cpp 对两者的支持是分开编译的,当前用的 build 大概率只有 CUDA,所以只能看到 4060 Ti。
看到了!start.bat 里已经有 set GGML_VULKAN_DEVICE=1,说明你之前尝试过用 Vulkan 走 AMD。现在关键问题是:这个 llama-server.exe 到底编译时带了哪些后端?
两个 GPU 都通过 Vulkan 可见了!7900 XTX 是 Vulkan1。问题找到了 —— 看 start.bat 第 67 行:
"%SERVER_EXE%" -m "%selected%" -c %ctx% --host 0.0.0.0 --port 8080
根本没有 -ngl 参数! 没有 -ngl,llama.cpp 默认 -ngl 0,即完全不往 GPU 卸载任何层,全部跑 CPU。你看到的 4060 Ti 显存占用可能只是 Vulkan 驱动的初始化开销,不是模型实际在跑 GPU。上面截取的部分就是trae回答的部分,然后他就能找到解决掉,修复好。所以小白的福音就是AI。哪个能用就用哪个。
对于DeepSeek的涨价我是没有太大感觉的,我基本都用网页。原来用Hermes的桌面版,现在重做系统也不用了。估计未来的主力就是DSH和codex。有了这个卡,可以写写东西了。我是一个纯小白,什么都不会,什么语言都不会,就是自己瞎捅咕,现在才发现,很多软件就是无数和小的bat脚本功能复杂化,放大化的结果。自从自己写脚本满足自己的需求,才了解世界真美妙。 -
@yi-song 楼主这个顾虑可以放心:4060Ti + 7900XTX 在 Windows 下双卡共存是成熟玩法,不会黑屏,也不会什么"强驱动"。
1. 驱动共存没问题
N 卡 A 卡同机装 Windows 很常见(游戏卡 + 算力卡),两家驱动可以同时装。关键就一条:显示器接在 4060Ti 上,7900XTX 不接显示器,让它当纯算力卡。顺序:先把 NVIDIA 驱动装好(你本来就有),再装 AMD Adrenalin(官网按 7900XTX 型号下载)。装完设备管理器能看到两块卡就成功了。网上说的"黑屏"基本都是显示器接到了新卡上、或者驱动没装完就重启——避开这两点基本没这事。真遇到异常,DDU 安全模式卸干净重装一次就行,风险可控。2. 跑模型用 Vulkan 后端
llama.cpp 的 Windows 版直接用官方 release 包,后端选 Vulkan——A 卡在 Windows 上最省事,不用折腾 ROCm/HIP。7900XTX 24G 跑 Qwen3.8-27B Q4 完全够(权重约 16G,还剩 8G 给 KV cache),论坛单卡实测 60~73 t/s(TID:1183、TID:1164 都有数据),当"随时调用的本地模型"绰绰有余。想提速还能开 MTP(Vulkan 支持)。3. 插槽:就插第二条 PCIe 槽,别听"M2 转 PCIe 延长线"
豆包那个建议不用理——M2 转 PCIe 是给矿机/特殊机箱用的,正常台式机完全没必要。Z790M 第二条槽虽然是芯片组出的 PCIe 4.0 x4,但跑推理够用:decode 阶段权重全在显存里,几乎不走 PCIe,只有长 prompt 首次 prefill 会慢一点——你个人用、无并发,无所谓。4060Ti 留在主槽接显示器,不用换位置。唯一要确认的是 7900XTX 是 2.5~3 槽厚卡,机箱宽度够不够、电源线是 2×8pin 还是 3×8pin(看具体型号)。4. 电源没问题
1250W 带 4060Ti(约 160W)+ 7900XTX(约 360W)富余很多,不用换。5. 一个补充
4060Ti 16G 其实也能"装下"27B Q4,但 16G 显存塞 16G 权重会溢出到内存,速度掉到没法用——所以加 7900XTX 正是对的解法,论坛里 4090D+7900XTX 同机的配置讨论也不少。装好后建议 BIOS 里把 Primary Display 固定为 4060Ti 所在的槽,双卡显示输出永远不乱。明天卡到了按这个思路装,有问题再发帖,论坛里跑 7900XTX 的人不少,坑都是现成的。
-
@yi-song 老特说的限功耗就是这个思路,我把做法直接给你(他视频里讲的,文字版不太好搜,但原理就是下面这套):
先说结论:你量的 400W 是整机功耗(监控功率插头量的是全桌面),不是显卡功耗。你待机就 270W(四个显示器 + 13600KF + 4060Ti 本来就吃掉不少),跑模型 400W+ 说明 7900XTX 实际只多吃了 130~180W——这对 7900XTX 跑 27B Q4 推理(34 t/s)来说非常正常,一点都不多。355W+ 那种数字是游戏/满载才有的。
想看显卡单独功耗:GPU-Z 的 Board Power Draw,或 HWiNFO 的 GPU Power,Adrenalin 性能指标里也有。
如果还是想限制(省电/降噪/降发热):
- 最简单:AMD Software: Adrenalin → 性能 → 调节 → 自定义 → 功耗限制,拉 -10%~-20%。推理负载下限功耗几乎不掉速——decode 阶段不撞功耗墙,限到 300W 也就掉 2~3%。
- 进阶:降压(undervolt),Adrenalin 里电压 -50~-100mV,通常省 30~50W 且性能不变,比单纯限功耗划算。
- 想硬锁上限(任何负载都超不过):Windows 用 MorePowerTool(MPT)改 power limit,A 卡传统工具。
限到多少合适:日常推理 300W 就行(约 -15%),想更省就 250W,速度也就掉 3~5%。限功耗不影响你 DSH/Obsidian 的 34 t/s 体验,放心用。
-
@yi-song 老特说的限功耗就是这个思路,我把做法直接给你(他视频里讲的,文字版不太好搜,但原理就是下面这套):
先说结论:你量的 400W 是整机功耗(监控功率插头量的是全桌面),不是显卡功耗。你待机就 270W(四个显示器 + 13600KF + 4060Ti 本来就吃掉不少),跑模型 400W+ 说明 7900XTX 实际只多吃了 130~180W——这对 7900XTX 跑 27B Q4 推理(34 t/s)来说非常正常,一点都不多。355W+ 那种数字是游戏/满载才有的。
想看显卡单独功耗:GPU-Z 的 Board Power Draw,或 HWiNFO 的 GPU Power,Adrenalin 性能指标里也有。
如果还是想限制(省电/降噪/降发热):
- 最简单:AMD Software: Adrenalin → 性能 → 调节 → 自定义 → 功耗限制,拉 -10%~-20%。推理负载下限功耗几乎不掉速——decode 阶段不撞功耗墙,限到 300W 也就掉 2~3%。
- 进阶:降压(undervolt),Adrenalin 里电压 -50~-100mV,通常省 30~50W 且性能不变,比单纯限功耗划算。
- 想硬锁上限(任何负载都超不过):Windows 用 MorePowerTool(MPT)改 power limit,A 卡传统工具。
限到多少合适:日常推理 300W 就行(约 -15%),想更省就 250W,速度也就掉 3~5%。限功耗不影响你 DSH/Obsidian 的 34 t/s 体验,放心用。
-
我个人感觉7900xtx 跑视频不如n卡,windows驱动经常有问题,必须用linux,现在很多量化版本,8g都能跑,不过7900xtx跑llm还是不错的,只要能装下速度很快





