跑什么应用会这么高的温度?
我的解决方案如下:

整体用下来,GPU温度从没超过80°
跑什么应用会这么高的温度?
我的解决方案如下:

整体用下来,GPU温度从没超过80°
下载了官方最新的release【llama-b9553-bin-win-cuda-12.4-x64】


上周收到华南金牌的板U套装和Z40机箱+长城1250W电源,然后用自己旧电脑上的拆机件开始装机。
内存条4条插满(32x2+16x2),1T的SSD,3060怼上,重装全新的windows10,结果点不亮。
不知道是不是我的3060的问题,HDMI不行,换DP亮了。
今天收到RTX3090Ti,双卡怼上,开机

开机正常,但是上周装的nividia显卡驱动丢了。重装驱动,结果发现3090不认。考虑到是不是槽位不对,将上图中两张卡的位置做了对调。重新开机,认到了3090,但是装完驱动后,显示器黑屏。插入3060的DP口,显示器正常显示。但是在任务管理器中看不到3090,只有3060。
以为买的3090Ti翻车了,本着死马当活马医,开始怼DeepSeek......
然后得知,要调整BIOS中的设置:


运气不错,BIOS调整很顺利,并且开机后都没有提示我需要重装显卡驱动,就一切正常。

为了尽快验证新买的卡是能用的,下载LM Studio,加载unsloth\Qwen3.6-27B-GGUF(双卡顺序加载)
用一个我常用的测试题进行测试,结果只有不到20tokens/s
在LM Studio中关掉3060,只用3090单卡加载Qwen3.6-27B-GGUF,同样的问题,39tokens/s
====================================================
今天先到这里,明天开始折腾llama.cpp
原计划是要用deepseek-v4 flash验证本地模型写的代码有没有bug,确实发现了隐藏的bug

但是再做下一步任务的时候报错了:

重试几次都是同样的问题,重启gateway还是错误依旧
换成本地模型就好了,哎......
晒一下deepseek的调用情况:

谢谢锤哥的脚本,我让deepseek改了两稿才能正确的在windows下执行:【import torch
import sys
import os
os.environ['PYTORCH_CUDA_ALLOC_CONF'] = 'expandable_segments:True'
print(f"
正在启动英伟达消费级显存物理专项扫描...")
if not torch.cuda.is_available():
print("
没找到 GPU 驱动")
sys.exit(1)
device = torch.device("cuda:0")
total_mem = torch.cuda.get_device_properties(0).total_memory
safe_margin = 3 * 1024 * 1024 * 1024 # 3 GB
usable_mem = total_mem - safe_margin
print(f"
物理检测到总显存: {total_mem / (10243):.2f} GB")
print(f"
预留安全边界后可用显存: {usable_mem / (10243):.2f} GB")
chunk_bytes = 2 * 1024 * 1024 * 1024
chunk_elements = chunk_bytes // 4 # float32 每个 4 字节
num_chunks = usable_mem // chunk_bytes
print(f"
采用分块扫描策略,共 {num_chunks} 块,每块 {chunk_bytes / (1024**3):.2f} GB")
print(f"
开始物理交替位元扫雷测试(耗时较长)...\n")
try:
for chunk_idx in range(num_chunks):
print(f" -> [块 {chunk_idx+1}/{num_chunks}] 写入全 0 模式并校验物理放电...")
grid0 = torch.zeros(chunk_elements, dtype=torch.float32, device=device)
torch.cuda.synchronize()
if not (grid0 == 0).all():
raise ValueError(f"块 {chunk_idx+1} 放电校验失败!")
del grid0
print(f" -> [块 {chunk_idx+1}/{num_chunks}] 写入全 1 模式并校验物理充电...")
grid1 = torch.ones(chunk_elements, dtype=torch.float32, device=device)
torch.cuda.synchronize()
if not (grid1 == 1).all():
raise ValueError(f"块 {chunk_idx+1} 充电校验失败!")
del grid1
print(f" -> [块 {chunk_idx+1}/{num_chunks}] 交替位元高频冲刷...")
pattern = torch.arange(0, chunk_elements, dtype=torch.float32, device=device)
torch.cuda.synchronize()
# 简单校验:求和
s = pattern.sum().item()
del pattern
torch.cuda.empty_cache() # 每块完成后清理缓存
print(f" ✔ 块 {chunk_idx+1} 通过。\n")
print(f"🎉【显存物理体检通过】所有魔改颗粒逐位读写 100% 正确!")
except Exception as e:
print(f"\n
【铁证如山】显存物理颗粒扫描失败: {e}")
sys.exit(1)】
我x99洋垃圾上的3090和3060都检测通过:【
D:\temp>python vram_heavy_test.py
正在启动英伟达消费级显存物理专项扫描...
物理检测到总显存: 12.00 GB
预留安全边界后可用显存: 11.00 GB
采用分块扫描策略,共 5 块,每块 2.00 GB
开始物理交替位元扫雷测试(耗时较长)...
-> [块 1/5] 写入全 0 模式并校验物理放电...
D:\temp\vram_heavy_test.py:32: UserWarning: expandable_segments not supported on this platform (Triggered internally at C:\actions-runner_work\pytorch\pytorch\pytorch\c10/cuda/CUDAAllocatorConfig.h:28.)
grid0 = torch.zeros(chunk_elements, dtype=torch.float32, device=device)
-> [块 1/5] 写入全 1 模式并校验物理充电...
-> [块 1/5] 交替位元高频冲刷...
块 1 通过。
-> [块 2/5] 写入全 0 模式并校验物理放电...
-> [块 2/5] 写入全 1 模式并校验物理充电...
-> [块 2/5] 交替位元高频冲刷...
块 2 通过。
-> [块 3/5] 写入全 0 模式并校验物理放电...
-> [块 3/5] 写入全 1 模式并校验物理充电...
-> [块 3/5] 交替位元高频冲刷...
块 3 通过。
-> [块 4/5] 写入全 0 模式并校验物理放电...
-> [块 4/5] 写入全 1 模式并校验物理充电...
-> [块 4/5] 交替位元高频冲刷...
块 4 通过。
-> [块 5/5] 写入全 0 模式并校验物理放电...
-> [块 5/5] 写入全 1 模式并校验物理充电...
-> [块 5/5] 交替位元高频冲刷...
块 5 通过。
【显存物理体检通过】所有魔改颗粒逐位读写 100% 正确!
D:\temp>python vram_heavy_test.py
正在启动英伟达消费级显存物理专项扫描...
物理检测到总显存: 23.99 GB
预留安全边界后可用显存: 20.99 GB
采用分块扫描策略,共 10 块,每块 2.00 GB
开始物理交替位元扫雷测试(耗时较长)...
-> [块 1/10] 写入全 0 模式并校验物理放电...
D:\temp\vram_heavy_test.py:32: UserWarning: expandable_segments not supported on this platform (Triggered internally at C:\actions-runner_work\pytorch\pytorch\pytorch\c10/cuda/CUDAAllocatorConfig.h:28.)
grid0 = torch.zeros(chunk_elements, dtype=torch.float32, device=device)
-> [块 1/10] 写入全 1 模式并校验物理充电...
-> [块 1/10] 交替位元高频冲刷...
块 1 通过。
-> [块 2/10] 写入全 0 模式并校验物理放电...
-> [块 2/10] 写入全 1 模式并校验物理充电...
-> [块 2/10] 交替位元高频冲刷...
块 2 通过。
-> [块 3/10] 写入全 0 模式并校验物理放电...
-> [块 3/10] 写入全 1 模式并校验物理充电...
-> [块 3/10] 交替位元高频冲刷...
块 3 通过。
-> [块 4/10] 写入全 0 模式并校验物理放电...
-> [块 4/10] 写入全 1 模式并校验物理充电...
-> [块 4/10] 交替位元高频冲刷...
块 4 通过。
-> [块 5/10] 写入全 0 模式并校验物理放电...
-> [块 5/10] 写入全 1 模式并校验物理充电...
-> [块 5/10] 交替位元高频冲刷...
块 5 通过。
-> [块 6/10] 写入全 0 模式并校验物理放电...
-> [块 6/10] 写入全 1 模式并校验物理充电...
-> [块 6/10] 交替位元高频冲刷...
块 6 通过。
-> [块 7/10] 写入全 0 模式并校验物理放电...
-> [块 7/10] 写入全 1 模式并校验物理充电...
-> [块 7/10] 交替位元高频冲刷...
块 7 通过。
-> [块 8/10] 写入全 0 模式并校验物理放电...
-> [块 8/10] 写入全 1 模式并校验物理充电...
-> [块 8/10] 交替位元高频冲刷...
块 8 通过。
-> [块 9/10] 写入全 0 模式并校验物理放电...
-> [块 9/10] 写入全 1 模式并校验物理充电...
-> [块 9/10] 交替位元高频冲刷...
块 9 通过。
-> [块 10/10] 写入全 0 模式并校验物理放电...
-> [块 10/10] 写入全 1 模式并校验物理充电...
-> [块 10/10] 交替位元高频冲刷...
块 10 通过。
【显存物理体检通过】所有魔改颗粒逐位读写 100% 正确!
】
折腾了几天,踩了无数坑:
1、windows10的电源一定要用卓越性能,不然GPU的频率根本跑不起来,会被限制到180w左右
2、cmake编译llama.cpp不要抄作业(反正我本人没搞定,自己编译的能跑但是最多不到10tokens/s),直接用官方https://github.com/ggml-org/llama.cpp/releases的版本,3090下Windows x64 (CUDA 12)
3、官方编译的版本能Qwen3.6 27B跑到35tokens/s,不过MTP没什么效果,我跑unsloth的MTP版本Qwen3.6 27B,也就只能跑到37tokens/s


看过锤哥视频的介绍,还不如加点钱买魔改的3080

这是我自己编译的llama.cpp
同样的模型,同样的硬件,同样的启动脚本,差别简直了......

这是https://github.com/ggml-org/llama.cpp/releases/download/b9305/llama-b9305-bin-win-cuda-12.4-x64.zip的
哎~
@rock-shi 经过论坛大神的指点(--ubatch-size 1024),和自己不断的折腾,能达到这个值了。
启动参数:
--host 0.0.0.0 ^
--port 3527 ^
--reasoning off ^
--n-gpu-layers -1 ^
--ctx-size 131072 ^
--batch-size 2048 ^
--ubatch-size 1024 ^
--flash-attn on ^
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
--spec-type draft-mtp,ngram-mod ^
--spec-draft-n-max 3 ^
--spec-ngram-mod-n-max 5 ^
--spec-ngram-mod-n-min 3 ^
--temp 0.7 ^
--parallel 1
我现在是X99洋垃圾,插3090Ti+3060,3090跑qwen3.6-27b(128k上下文)作为Hermes的主力模型,3060跑Gemma4-12b,作为多模态辅助模型。
【--spec-type draft-mtp ^
--spec-draft-n-max 3 ^】
实施效果呢......
我的3090跑Qwen3.6-27B-unslothMTP-Q4_K_M.gguf,Hermes coding能稳定60~70t/s;最快能到80多t/s
当然,受限于显存大小,只能
【
--ctx-size 131072 ^
--batch-size 4096^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
】


我运行时的截屏
我现在的用法:
实例1(GPU 0):
Qwen3.6-27B-MTP-GGUF\Qwen3.6-27B-unslothMTP-Q4_K_M.gguf
实例2(GPU 1):
REM 仅使用 RTX 3060 (12G VRAM)
set CUDA_VISIBLE_DEVICES=1
REM 请替换为你的实际路径
set SERVER_PATH=.\llama-server.exe
set MODEL_PATH=D:\MyModels\unsloth\gemma-4-12b-it-GGUF\gemma-4-12B-it-qat-UD-Q4_K_XL.gguf
set MMProj_PATH=D:\MyModels\unsloth\gemma-4-12b-it-GGUF\mmproj-gemma-4-12B-it-F16.gguf
set MTP_PATH=D:\MyModels\unsloth\gemma-4-12b-it-GGUF\mtp-gemma-4-12B-it.gguf
Hermes agent中qwen3.6做主模型、gemma-4做辅助模型(主要用于知识库文档识别时多模态)
给不同的人用,我觉得可以做参考,llama-server起两个服务运行在不同的端口,使用者通过端口来区分调用
使用llama-b9329-bin-win-cuda-12.4-x64这个官方的Release
启动参数:
--reasoning off ^
--n-gpu-layers -1 ^
--ctx-size 131072 ^
--batch-size 2048 ^
--ubatch-size 1024 ^
--flash-attn on ^
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
--spec-type draft-mtp,ngram-mod ^
--spec-draft-n-max 3 ^
--spec-ngram-mod-n-max 5 ^
--spec-ngram-mod-n-min 3 ^
--temp 0.7 ^
--parallel 1
处理一个128KB的md文件,日志:【
[34m3.11.560.628[0m [32mI [0msrv params_from_: Chat format: peg-native
[34m3.11.562.098[0m [32mI [0mslot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 101040854
[34m3.11.562.100[0m [32mI [0msrv get_availabl: updating prompt cache
[34m3.11.564.872[0m [35mW srv prompt_save: - saving prompt with length 12163, total state size = 411.405 MiB (draft: 47.744 MiB)
[0m[34m3.11.766.865[0m [32mI [0msrv load: - looking for better prompt, base f_keep = 0.000, sim = 0.000
[34m3.11.766.874[0m [32mI [0msrv update: - cache state: 1 prompts, 596.347 MiB (limits: 8192.000 MiB, 131072 tokens, 167082 est)
[34m3.11.766.877[0m [32mI [0msrv update: - prompt 0000029F0C14B3A0: 12163 tokens, checkpoints: 1, 596.347 MiB
[34m3.11.766.879[0m [32mI [0msrv get_availabl: prompt cache update took 204.78 ms
[34m3.11.767.318[0m [32mI [0mslot launch_slot_: id 0 | task 1045 | processing task, is_child = 0
[34m3.11.767.333[0m [32mI [0mslot update_slots: id 0 | task 1045 | Checking checkpoint with [8996, 8996] against 2...
[34m3.11.767.336[0m [35mW slot update_slots: id 0 | task 1045 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
[0m[34m3.11.767.340[0m [35mW slot update_slots: id 0 | task 1045 | erased invalidated context checkpoint (pos_min = 8996, pos_max = 8996, n_tokens = 8997, n_swa = 0, pos_next = 0, size = 184.942 MiB)
[0m[34m3.12.161.249[0m [32mI [0mslot create_check: id 0 | task 1045 | created context checkpoint 1 of 32 (pos_min = 361, pos_max = 361, n_tokens = 362, size = 151.047 MiB)
[34m3.15.050.013[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 4458, progress = 0.08, t = 3.28 s / 1358.04 tokens per second
[34m3.16.509.158[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 6506, progress = 0.12, t = 4.74 s / 1372.05 tokens per second
[34m3.18.007.190[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 8554, progress = 0.15, t = 6.24 s / 1370.87 tokens per second
[34m3.19.532.959[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 10602, progress = 0.19, t = 7.77 s / 1365.25 tokens per second
[34m3.21.088.746[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 12650, progress = 0.23, t = 9.32 s / 1357.09 tokens per second
[34m3.22.683.336[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 14698, progress = 0.26, t = 10.92 s / 1346.47 tokens per second
[34m3.24.307.549[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 16746, progress = 0.30, t = 12.54 s / 1335.39 tokens per second
[34m3.25.964.943[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 18794, progress = 0.34, t = 14.20 s / 1323.75 tokens per second
[34m3.27.650.395[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 20842, progress = 0.37, t = 15.88 s / 1312.22 tokens per second
[34m3.29.372.484[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 22890, progress = 0.41, t = 17.61 s / 1300.19 tokens per second
[34m3.31.133.380[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 24938, progress = 0.45, t = 19.37 s / 1287.72 tokens per second
[34m3.32.933.422[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 26986, progress = 0.48, t = 21.17 s / 1274.96 tokens per second
[34m3.34.766.091[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 29034, progress = 0.52, t = 23.00 s / 1262.42 tokens per second
[34m3.36.628.129[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 31082, progress = 0.56, t = 24.86 s / 1250.24 tokens per second
[34m3.38.523.583[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 33130, progress = 0.60, t = 26.76 s / 1238.22 tokens per second
[34m3.40.449.198[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 35178, progress = 0.63, t = 28.68 s / 1226.49 tokens per second
[34m3.42.421.302[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 37226, progress = 0.67, t = 30.65 s / 1214.39 tokens per second
[34m3.44.426.882[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 39274, progress = 0.71, t = 32.66 s / 1202.53 tokens per second
[34m3.46.471.948[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 41322, progress = 0.74, t = 34.70 s / 1190.68 tokens per second
[34m3.48.549.836[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 43370, progress = 0.78, t = 36.78 s / 1179.09 tokens per second
[34m3.50.662.193[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 45418, progress = 0.82, t = 38.89 s / 1167.71 tokens per second
[34m3.52.837.951[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 47466, progress = 0.85, t = 41.07 s / 1155.72 tokens per second
[34m3.55.019.000[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 49514, progress = 0.89, t = 43.25 s / 1144.79 tokens per second
[34m3.57.260.487[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 51562, progress = 0.93, t = 45.49 s / 1133.40 tokens per second
[34m3.59.525.014[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 53610, progress = 0.96, t = 47.76 s / 1122.54 tokens per second
[34m4.00.773.859[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 54644, progress = 0.98, t = 49.01 s / 1115.04 tokens per second
[34m4.00.916.683[0m [32mI [0mslot create_check: id 0 | task 1045 | created context checkpoint 2 of 32 (pos_min = 54643, pos_max = 54643, n_tokens = 54644, size = 364.122 MiB)
[34m4.02.074.532[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 55668, progress = 1.00, t = 50.31 s / 1106.56 tokens per second
[34m4.02.231.320[0m [32mI [0mslot create_check: id 0 | task 1045 | created context checkpoint 3 of 32 (pos_min = 55667, pos_max = 55667, n_tokens = 55668, size = 368.141 MiB)
[34m4.02.295.988[0m [32mI [0mbegin: ngram_mod occupancy = 48153/4194304 (0.01)
[34m4.04.729.586[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 101, tg = 41.53 t/s
[34m4.07.759.011[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 264, tg = 48.34 t/s
[34m4.10.786.113[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 429, tg = 50.54 t/s
[34m4.13.814.218[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 567, tg = 49.23 t/s
[34m4.16.829.972[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 703, tg = 48.38 t/s
[34m4.19.845.676[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 865, tg = 49.29 t/s
[34m4.22.875.983[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 1008, tg = 48.98 t/s
[34m4.25.920.495[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 1167, tg = 49.40 t/s
[34m4.28.956.098[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 1326, tg = 49.74 t/s
[34m4.31.977.717[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 1475, tg = 49.70 t/s
[34m4.34.979.991[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 1619, tg = 49.54 t/s
[34m4.37.989.947[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 1741, tg = 48.78 t/s
[34m4.41.046.861[0m [32mI [0mslot print_timing: id 0 | task 1045 | n_decoded = 1864, tg = 48.10 t/s
[34m4.43.158.621[0m [32mI [0mslot print_timing: id 0 | task 1045 | prompt eval time = 50530.12 ms / 55672 tokens ( 0.91 ms per token, 1101.76 tokens per second)
[34m4.43.158.626[0m [32mI [0mslot print_timing: id 0 | task 1045 | eval time = 40860.81 ms / 1956 tokens ( 20.89 ms per token, 47.87 tokens per second)
[34m4.43.158.627[0m [32mI [0mslot print_timing: id 0 | task 1045 | total time = 91390.93 ms / 57628 tokens
[34m4.43.158.629[0m [32mI [0mslot print_timing: id 0 | task 1045 | graphs reused = 1683
[34m4.43.158.630[0m [32mI [0mslot print_timing: id 0 | task 1045 | draft acceptance = 0.63998 ( 1287 accepted / 2011 generated)
[34m4.43.158.671[0m [32mI [0mstatistics ngram-mod: #calls(b,g,a) = 2 1706 2, #gen drafts = 2, #acc drafts = 2, #gen tokens = 10, #acc tokens = 6, dur(b,g,a) = 7.376, 3.912, 0.002 ms
[34m4.43.158.678[0m [32mI [0mstatistics draft-mtp: #calls(b,g,a) = 2 1704 1704, #gen drafts = 1704, #acc drafts = 1393, #gen tokens = 5112, #acc tokens = 3364, dur(b,g,a) = 0.002, 12570.379, 3.195 ms
[34m4.43.160.706[0m [32mI [0mslot release: id 0 | task 1045 | stop processing: n_tokens = 57628, truncated = 0
[34m4.43.160.751[0m [32mI [0msrv update_slots: all slots are idle
】
输出Tokens速度:

运行时显卡信息:

大佬的感悟我是深有体会的,我本人因为工作需要有很多重复繁杂的工作,用AI写一些小工具是我个人最迫切的需求,同时,因为工作关系(金融单位),数据敏感,因此只能是自己本地搞。
但是最大的好处是,不用担心AI搞出来的东西只有demo级别,本来我也就是给自己用的,demo级别够用了
这时再跑一个简单的问答题,速率降到了53T/S
我觉得这个速度在3090上是正常的。

我用的模型和启动参数:
unsloth\Qwen3.6-27B-MTP-GGUF\Qwen3.6-27B-unslothMTP-Q4_K_M.gguf
--reasoning off ^
--n-gpu-layers -1 ^
--ctx-size 131072 ^
--batch-size 4096^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q4_0 ^
--cache-type-v q4_0 ^
--spec-type draft-mtp ^
--spec-draft-n-max 3 ^
--spec-draft-n-min 1 ^
--temp 0.7 ^
--parallel 1 ^
--kv-unified ^
--mlock ^
--jinja ^
--threads 16 ^
--threads-batch 16 ^
--no-warmup
华南金牌洋垃圾主板和CPU
@Dalu-Fama 工作站版本600w?请问要配多大的电源?
@applejuice 我是直接问的客服,沟通好了配置后,客服会发链改价再付款