<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[交作业: 京东自营二手3090，X99-F8D PLUS，E5-2680，64G]]></title><description><![CDATA[<h1>单张 RTX 3090 跑 Qwen3.8-27B：原版 83.9 t/s、Ampere 优化版 95.6 t/s、237K 上下文、能力测试 20/20</h1>
<blockquote>
<p dir="auto">单张二手 RTX 3090 24GB，Ubuntu 26.04.1，原版 llama.cpp、llamAmpere 与 HyperQwen 完整实测<br />
测试日期：2026-09-21 至 2026-09-22</p>
</blockquote>
<p dir="auto">这篇测试参照 <a href="https://lcz.me/topic/1164">lcz.me 的《7900 XTX 跑 Qwen3.8-27B 完整部署与实测指南》</a>，保留其测试题、采样参数、长提示、prompt cache、n-max 扫描和 20 道能力题，再把 AMD Vulkan 配置改成适合本机单张 RTX 3090 的 CUDA 配置。</p>
<p dir="auto"><strong>说在开头本人也是硬件小白，现在就是看锤哥视频慢慢鼓捣窜了台机器，大神们轻点喷哈<img src="https://lcz.me/assets/plugins/nodebb-plugin-emoji/emoji/android/1f602.png?v=ecb7c61779a" class="not-responsive emoji emoji-android emoji--joy" style="height:23px;width:auto;vertical-align:middle" title=":joy:" alt="😂" /> ，配件都是东子上买的，除了显卡是二手东子自营的3090，其他都买的一手货，我买到的3090是个大卡，后续因为想在淘个3090，所以选的HUANANZHI X99-F8D PLUS这个板子（需要个塔式的机箱），坑的来了，如果是两个3090的话的电源线用便宜的长城金龙的电源口不够，客服也不给加模块，最后买了个微星的电源2900软妹币，整机下来大概花了1.6-1.7W。下面的配置都是根据我需求参考论坛的大神帖子找GPT配置的，后续这台机器是想做AI视频工作流的，昨天算是工作流跑通了，这两天整理下发到论坛上来。这几天在满载跑视频进行测试(需要装载卸载模型)，目前看这个二手卡还是挺靠谱的。</strong><br />
<img src="https://upload.lcz.me/uploads/bf9e1656-5c59-4da6-b82a-709ccbaa5c1f.jpg" alt="138.jpg" class=" img-fluid img-markdown" /><br />
<img src="https://upload.lcz.me/uploads/b85a865a-df6c-4bd3-97a3-1579a09ef41d.jpg" alt="137.jpg" class=" img-fluid img-markdown" /></p>
<p dir="auto">报告先完整记录原版 llama.cpp 的可复现基线，再追加针对 RTX 3090 的 llamAmpere 和 HyperQwen 优化结果。重点不是单独追求最高的 t/s，而是说明硬件、软件、提示词、采样参数和测量方法。投机解码的速度会随着题目类型明显变化；同一台机器上，中文创作、代码和工具 JSON 的速度可以相差接近一倍。</p>
<hr />
<h2>目录</h2>
<ol>
<li>先给结论</li>
<li>硬件与软件环境</li>
<li>与原帖平台的关键差异</li>
<li>编译、模型和最终启动配置</li>
<li>无 MTP 基线</li>
<li>MTP 不同工作负载实测</li>
<li>n-max 完整扫描</li>
<li>长提示与 prompt cache</li>
<li>能力评测：智力 10 题 + 工具 10 题</li>
<li>功耗、温度、显存与错误日志</li>
<li>结果解释与使用建议</li>
<li>复现方法</li>
<li>已知限制</li>
<li>Reddit / GitHub 优化方案复测</li>
</ol>
<hr />
<h2>1. 先给结论</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th style="text-align:right">本机结果</th>
</tr>
</thead>
<tbody>
<tr>
<td><strong>HyperQwen 单请求，默认采样</strong></td>
<td style="text-align:right"><strong>123.35 t/s</strong></td>
</tr>
<tr>
<td><strong>HyperQwen 单请求，贪心</strong></td>
<td style="text-align:right"><strong>129.30 t/s</strong></td>
</tr>
<tr>
<td><strong>llamAmpere 工具场景综合平均</strong></td>
<td style="text-align:right"><strong>95.64 t/s</strong></td>
</tr>
<tr>
<td><strong>llamAmpere 安全长上下文</strong></td>
<td style="text-align:right"><strong>237,568 token，成功加载并生成</strong></td>
</tr>
<tr>
<td>无 MTP 纯 decode</td>
<td style="text-align:right"><strong>38.21 ± 0.11 t/s</strong></td>
</tr>
<tr>
<td>无 MTP <code>pp2048</code></td>
<td style="text-align:right"><strong>1362.36 ± 13.23 t/s</strong></td>
</tr>
<tr>
<td>原版 llama.cpp n=4 工具场景综合平均</td>
<td style="text-align:right"><strong>83.89 t/s</strong></td>
</tr>
<tr>
<td>中文创作</td>
<td style="text-align:right"><strong>41.83 t/s</strong>（n=5 对照测试）</td>
</tr>
<tr>
<td>C++ LRU 代码生成</td>
<td style="text-align:right"><strong>86.77 t/s</strong>（n=5 对照测试）</td>
</tr>
<tr>
<td>C++ HTTP 解析器</td>
<td style="text-align:right"><strong>92.66 t/s</strong>（n=5 对照测试）</td>
</tr>
<tr>
<td>约 6.4K token prefill</td>
<td style="text-align:right"><strong>1153.75 t/s</strong></td>
</tr>
<tr>
<td>约 39K token prefill</td>
<td style="text-align:right"><strong>1056.21 t/s</strong></td>
</tr>
<tr>
<td>上下文</td>
<td style="text-align:right"><strong>131,072 token，成功加载，无 OOM</strong></td>
</tr>
<tr>
<td>prompt cache 续问</td>
<td style="text-align:right">只重新处理 24 token，墙钟 <strong>0.61 秒</strong></td>
</tr>
<tr>
<td>智力测试</td>
<td style="text-align:right"><strong>10/10</strong></td>
</tr>
<tr>
<td>工具调用测试</td>
<td style="text-align:right"><strong>10/10</strong></td>
</tr>
<tr>
<td>显卡峰值</td>
<td style="text-align:right"><strong>71°C、421.7W、22,956MiB</strong></td>
</tr>
<tr>
<td>驱动/内核错误</td>
<td style="text-align:right"><strong>0 个 Xid、AER、OOM、掉卡记录</strong></td>
</tr>
</tbody>
</table>
<p dir="auto">结论：这张 RTX 3090 可以稳定运行 Qwen3.8-27B。原版 llama.cpp 的 Agent/工具速度约 84 t/s；针对 Ampere 优化的 llamAmpere 达到 95.64 t/s，并可加载 237,568 token；追求单用户最高速度时，HyperQwen/DFlash2 的本机结果为 123–129 t/s。原版最稳、llamAmpere 是最快 GGUF 路线、HyperQwen 是最高单请求速度路线。</p>
<hr />
<h2>2. 硬件与软件环境</h2>
<h3>2.1 整机硬件</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>配置</th>
</tr>
</thead>
<tbody>
<tr>
<td>主板</td>
<td>HUANANZHI X99-F8D PLUS V1.32</td>
</tr>
<tr>
<td>BIOS</td>
<td>American Megatrends 5.11，2025-10-20</td>
</tr>
<tr>
<td>CPU</td>
<td>2 × Intel Xeon E5-2680 v4，Broadwell-EP</td>
</tr>
<tr>
<td>CPU 规模</td>
<td>每颗 14 核 28 线程，共 28 核 56 线程</td>
</tr>
<tr>
<td>NUMA</td>
<td>2 个节点；GPU 位于 node 1</td>
</tr>
<tr>
<td>内存</td>
<td>64GiB DDR4，Linux 可用约 60GiB</td>
</tr>
<tr>
<td>显卡</td>
<td>单张 NVIDIA GeForce RTX 3090 24GB</td>
</tr>
<tr>
<td>GPU 芯片</td>
<td>GA102-300-A1，compute capability 8.6</td>
</tr>
<tr>
<td>GPU VBIOS</td>
<td>94.02.42.00.F5</td>
</tr>
<tr>
<td>功耗上限</td>
<td>420W，可调范围 100–450W</td>
</tr>
<tr>
<td>PCIe</td>
<td>GPU 地址 <code>84:00.0</code>，负载时 Gen3 x16</td>
</tr>
<tr>
<td>BAR1</td>
<td><strong>256MB</strong></td>
</tr>
<tr>
<td>系统盘</td>
<td>ZHITAI TiPlus7100s 2TB NVMe</td>
</tr>
</tbody>
</table>
<p dir="auto">GPU 所属 NUMA 节点：</p>
<pre><code class="language-text">$ cat /sys/bus/pci/devices/0000:84:00.0/numa_node
1
</code></pre>
<p dir="auto">因此所有正式测试都绑定 node 1：</p>
<pre><code class="language-bash">numactl --cpunodebind=1 --membind=1 ...
</code></pre>
<h3>2.2 软件环境</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>版本</th>
</tr>
</thead>
<tbody>
<tr>
<td>操作系统</td>
<td>Ubuntu 26.04.1 LTS</td>
</tr>
<tr>
<td>内核</td>
<td>Linux 7.0.0-31-generic</td>
</tr>
<tr>
<td>NVIDIA 驱动</td>
<td>595.91.07</td>
</tr>
<tr>
<td>CUDA Toolkit</td>
<td>13.2.86，安装在隔离 Python 环境中</td>
</tr>
<tr>
<td>CMake</td>
<td>4.4.3</td>
</tr>
<tr>
<td>编译器</td>
<td>GCC/G++ 15.2.0</td>
</tr>
<tr>
<td>llama.cpp</td>
<td><code>0.4.1-dev</code></td>
</tr>
<tr>
<td>llama.cpp commit</td>
<td><code>c21284cdf5fd833b90ac1f824cdf8065e2700dc4</code></td>
</tr>
<tr>
<td>llamAmpere commit</td>
<td><code>2cb16936b5d081a92f1d0369954561efb6d1e2c7</code></td>
</tr>
<tr>
<td>HyperQwen commit</td>
<td><code>feaffb676ba0ac6ba5060bd2edbd39cce952829e</code></td>
</tr>
<tr>
<td>vLLM</td>
<td><code>0.28.0</code>，HyperQwen 补丁栈</td>
</tr>
<tr>
<td>CUDA 架构</td>
<td>只编译 <code>sm_86</code></td>
</tr>
</tbody>
</table>
<h3>2.3 模型</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>内容</th>
</tr>
</thead>
<tbody>
<tr>
<td>来源</td>
<td><code>unsloth/Qwen3.8-27B-GGUF</code></td>
</tr>
<tr>
<td>文件</td>
<td><code>Qwen3.8-27B-UD-Q4_K_M.gguf</code></td>
</tr>
<tr>
<td>量化</td>
<td>Q4_K Medium</td>
</tr>
<tr>
<td>参数量</td>
<td>27.32B</td>
</tr>
<tr>
<td>文件大小</td>
<td>16,464,440,224 字节</td>
</tr>
<tr>
<td>llama.cpp 显示大小</td>
<td>15.32GiB</td>
</tr>
<tr>
<td>SHA-256</td>
<td><code>322e194ff79741c7baa497c240f677f54b201b0efab44ca8e50f122b39123482</code></td>
</tr>
<tr>
<td>训练上下文</td>
<td>262,144 token</td>
</tr>
<tr>
<td>本次服务上下文</td>
<td>131,072 token</td>
</tr>
</tbody>
</table>
<p dir="auto">当前 Hugging Face 文件名比原帖多了 <code>UD-</code> 前缀，llama.cpp 读取的量化类型仍为 Q4_K Medium。本轮只测纯文字，没有下载约 927MB 的 <code>mmproj</code> 多模态投影文件。</p>
<p dir="auto">后续优化复测还使用了 ATX IQ4_XS-M 模型：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>内容</th>
</tr>
</thead>
<tbody>
<tr>
<td>来源</td>
<td><code>jakeatx/Qwen3.8-27B-ATX-IQ4_XS-M-GGUF</code></td>
</tr>
<tr>
<td>文件</td>
<td><code>Qwen3.8-27B-ATX-4-XS.gguf</code></td>
</tr>
<tr>
<td>量化</td>
<td>IQ4_XS 4.25 bpw，关键张量升级</td>
</tr>
<tr>
<td>文件大小</td>
<td>15,588,551,712 字节，约 14.52GiB</td>
</tr>
<tr>
<td>SHA-256</td>
<td><code>5cf05ad901dcaa76f41db13a5629146ed882219339377a80e37b12a8528d963b</code></td>
</tr>
<tr>
<td>实测上下文</td>
<td>131,072；237,568 成功加载并生成</td>
</tr>
</tbody>
</table>
<hr />
<h2>3. 与原帖平台的关键差异</h2>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th>原帖</th>
<th>本机</th>
</tr>
</thead>
<tbody>
<tr>
<td>GPU</td>
<td>RX 7900 XTX 24GB</td>
<td>RTX 3090 24GB</td>
</tr>
<tr>
<td>后端</td>
<td>Vulkan / RADV</td>
<td>CUDA</td>
</tr>
<tr>
<td>CPU</td>
<td>2 × E5-2678 v3</td>
<td>2 × E5-2680 v4</td>
</tr>
<tr>
<td>内存</td>
<td>128GB</td>
<td>64GiB</td>
</tr>
<tr>
<td>ReBAR / BAR1</td>
<td>32GB</td>
<td><strong>256MB</strong></td>
</tr>
<tr>
<td>GPU NUMA</td>
<td>node 1</td>
<td>node 1</td>
</tr>
<tr>
<td>llama.cpp</td>
<td>build 10448，<code>ad1de39e0</code></td>
<td><code>0.4.1-dev</code>，<code>c21284c</code></td>
</tr>
<tr>
<td>驱动</td>
<td>Mesa/RADV 25.2.8</td>
<td>NVIDIA 595.91.07</td>
</tr>
</tbody>
</table>
<p dir="auto">原帖特别强调 32GB ReBAR；本机 X99 平台只暴露 256MB BAR1。CUDA 的内存管理路径和 Vulkan 不同，本机仍取得正常速度，但这项差异意味着两台机器不能只根据 GPU 理论带宽直接比较。</p>
<p dir="auto">另外，原帖的 <code>--no-mmap</code> 在当前 llama.cpp 中已经移除，本机使用等价的新参数：</p>
<pre><code class="language-text">--load-mode none
</code></pre>
<hr />
<h2>4. 编译、模型和最终启动配置</h2>
<h3>4.1 CUDA 编译</h3>
<p dir="auto">CUDA、CMake 和 Ninja 均安装在独立环境，没有替换系统驱动或系统 CUDA：</p>
<pre><code class="language-bash">cmake -S . -B build-cuda -G Ninja \
  -DGGML_CUDA=ON \
  -DGGML_NATIVE=ON \
  -DGGML_CCACHE=OFF \
  -DCMAKE_BUILD_TYPE=Release \
  -DCMAKE_CUDA_ARCHITECTURES=86 \
  -DCUDAToolkit_ROOT="$CUDA_HOME" \
  -DCMAKE_CUDA_COMPILER="$CUDA_HOME/bin/nvcc" \
  -DLLAMA_CURL=OFF

cmake --build build-cuda -j 8 --target llama-server llama-bench
</code></pre>
<p dir="auto">设备检查结果：</p>
<pre><code class="language-text">CUDA0: NVIDIA GeForce RTX 3090
compute capability: 8.6
VRAM: 24124 MiB
VMM: yes
</code></pre>
<h3>4.2 最终 128K 配置</h3>
<pre><code class="language-bash">export CUDA_HOME="/home/luna/Documents/Codex/2026-09-20/i/work/llama.cpp/venv-build/lib/python3.14/site-packages/nvidia/cu13"
export LD_LIBRARY_PATH="$CUDA_HOME/lib${LD_LIBRARY_PATH:+:$LD_LIBRARY_PATH}"

exec numactl --cpunodebind=1 --membind=1 \
  /home/luna/Documents/Codex/2026-09-20/i/work/llama.cpp/build-cuda/bin/llama-server \
  -m /home/luna/Documents/Codex/2026-09-20/i/work/llama.cpp/models/Qwen3.8-27B-Q4_K_M/Qwen3.8-27B-UD-Q4_K_M.gguf \
  --alias qwen3.8-27b \
  --device CUDA0 \
  --fit off \
  -ngl -1 \
  --load-mode none \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  -c 131072 \
  -ub 512 \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --cache-ram 32768 \
  --flash-attn on \
  --host 127.0.0.1 \
  --port 8080 \
  --jinja \
  --reasoning off
</code></pre>
<h3>4.3 为什么使用这些参数</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>参数</th>
<th>用途与本机选择</th>
</tr>
</thead>
<tbody>
<tr>
<td>NUMA 1 绑定</td>
<td>GPU 接在第二颗 CPU 一侧，避免跨 NUMA 访问</td>
</tr>
<tr>
<td><code>--device CUDA0</code></td>
<td>明确只使用唯一的 RTX 3090</td>
</tr>
<tr>
<td><code>--fit off -ngl -1</code></td>
<td>强制全层 GPU offload，避免自动 fit 过于保守</td>
</tr>
<tr>
<td><code>--load-mode none</code></td>
<td>当前版本中替代原帖的 <code>--no-mmap</code></td>
</tr>
<tr>
<td><code>draft-mtp</code></td>
<td>使用 GGUF 内置 MTP 草稿头，不需要额外草稿模型</td>
</tr>
<tr>
<td><code>n-max 4</code></td>
<td>本机六档扫描后的综合最高值</td>
</tr>
<tr>
<td>128K</td>
<td>验证显存容量和长上下文能力</td>
</tr>
<tr>
<td>Q8/Q8 KV</td>
<td>24GB 下 128K 可加载，没有为省显存降低 K 精度</td>
</tr>
<tr>
<td><code>parallel 1</code></td>
<td>一个槽独享完整 128K 上下文</td>
</tr>
<tr>
<td><code>cache-ram 32768</code></td>
<td>避免长会话因默认 8GB prompt cache 不足而放弃缓存</td>
</tr>
<tr>
<td><code>flash-attn on</code></td>
<td>降低长上下文显存占用并提高 prefill</td>
</tr>
<tr>
<td><code>reasoning off</code></td>
<td>Agent 和工具测试避免思考内容占满输出预算</td>
</tr>
<tr>
<td><code>127.0.0.1</code></td>
<td>服务只供本机测试，不直接暴露到局域网</td>
</tr>
</tbody>
</table>
<p dir="auto">加载完成后，空闲服务显存约 22,447MiB；整个测试期间最高 22,956MiB，说明 128K Q8/Q8 可以装入，但显存余量只有约 1.6GiB。</p>
<hr />
<h2>5. 无 MTP 基线</h2>
<p dir="auto">使用 llama.cpp 官方 <code>llama-bench</code>，不启用 MTP：</p>
<pre><code class="language-bash">numactl --cpunodebind=1 --membind=1 \
  build-cuda/bin/llama-bench \
  -m Qwen3.8-27B-UD-Q4_K_M.gguf \
  -dev CUDA0 \
  -p 2048 \
  -n 128 \
  -fa on \
  -r 2 \
  -ngl -1 \
  -lm none
</code></pre>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>测项</th>
<th style="text-align:right">本机 RTX 3090 CUDA</th>
<th style="text-align:right">原帖 7900 XTX Vulkan</th>
</tr>
</thead>
<tbody>
<tr>
<td><code>pp2048</code></td>
<td style="text-align:right"><strong>1362.36 ± 13.23 t/s</strong></td>
<td style="text-align:right">716.6 t/s</td>
</tr>
<tr>
<td><code>tg128</code></td>
<td style="text-align:right"><strong>38.21 ± 0.11 t/s</strong></td>
<td style="text-align:right">38.88 t/s</td>
</tr>
</tbody>
</table>
<p dir="auto">两张卡的无 MTP decode 几乎一致。本机 CUDA 的 <code>pp2048</code> 约为原帖的 1.9 倍，说明这套 CUDA 构建的预填充路径表现很好。</p>
<p dir="auto">RTX 3090 标称显存带宽为 936GB/s，模型为 15.32GiB。只按每个 token 完整读取一次权重估算，理论上限约 57–61 t/s；实际 38.21 t/s 约为这个粗略上限的六成多，与原帖的利用率接近。</p>
<hr />
<h2>6. MTP 不同工作负载实测</h2>
<h3>6.1 测试方法</h3>
<p dir="auto">为便于与原帖直接比较，本节固定使用：</p>
<pre><code class="language-json">{
  "temperature": 0.6,
  "top_p": 0.5,
  "top_k": 15,
  "max_tokens": 900
}
</code></pre>
<p dir="auto">文本题每项两次。工具题挂载与原帖同类的 8 个 schema：</p>
<pre><code class="language-text">web_search, web_extract, messages_send, shell_exec,
image_generate, memory_search, todo_write, stock_quote
</code></pre>
<h3>6.2 三类文本工作负载</h3>
<p dir="auto">为了和原帖直接比较，本表使用 <code>n-max=5</code>。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>工作负载</th>
<th>题目摘要</th>
<th style="text-align:right">平均 decode</th>
<th style="text-align:right">加权接受率</th>
<th style="text-align:right">原帖</th>
</tr>
</thead>
<tbody>
<tr>
<td>中文创作</td>
<td>山中湖泊日出，约 800 字</td>
<td style="text-align:right"><strong>41.83 t/s</strong></td>
<td style="text-align:right">0.230</td>
<td style="text-align:right">39–47 t/s</td>
</tr>
<tr>
<td>C++ LRU</td>
<td>线程安全、链表、哈希表、mutex</td>
<td style="text-align:right"><strong>86.77 t/s</strong></td>
<td style="text-align:right">0.721</td>
<td style="text-align:right">69.5 t/s</td>
</tr>
<tr>
<td>C++ HTTP parser</td>
<td>request line、headers、chunked、测试</td>
<td style="text-align:right"><strong>92.66 t/s</strong></td>
<td style="text-align:right">0.787</td>
<td style="text-align:right">68.4 t/s</td>
</tr>
</tbody>
</table>
<p dir="auto">测试原文：</p>
<blockquote>
<p dir="auto">請寫一篇約 800 字的短文，主題是「山中的湖泊在日出時的景象」。直接開始寫，不要前言。</p>
</blockquote>
<blockquote>
<p dir="auto">用 C++17 寫一個執行緒安全的 LRU cache class，含 get/put、雙向鏈結串列+unordered_map、std::mutex 保護，並附上完整的標頭與實作。直接輸出程式碼。</p>
</blockquote>
<blockquote>
<p dir="auto">用 C++ 實作一個完整的 HTTP 請求解析器 class：解析 request line、headers、chunked body，含錯誤處理與單元測試 main()。直接輸出程式碼。</p>
</blockquote>
<h3>6.3 工具调用</h3>
<p dir="auto">最终推荐配置为 <code>n-max=4</code>。每种工具场景累计运行 6 次，共 24 次请求：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>场景</th>
<th style="text-align:right">平均 decode</th>
<th style="text-align:right">范围</th>
<th style="text-align:right">加权接受率</th>
<th>预期调用</th>
</tr>
</thead>
<tbody>
<tr>
<td>查询台积电股价</td>
<td style="text-align:right">78.26 t/s</td>
<td style="text-align:right">71.55–82.07</td>
<td style="text-align:right">0.850</td>
<td><code>stock_quote</code></td>
</tr>
<tr>
<td>搜索并查找 Telegram 主对话</td>
<td style="text-align:right"><strong>91.92 t/s</strong></td>
<td style="text-align:right">84.54–97.23</td>
<td style="text-align:right">0.847</td>
<td><code>web_search + memory_search</code></td>
</tr>
<tr>
<td>检查 8080 服务和 GPU 显存</td>
<td style="text-align:right"><strong>95.54 t/s</strong></td>
<td style="text-align:right">94.84–96.07</td>
<td style="text-align:right">0.893</td>
<td><code>shell_exec × 2</code></td>
</tr>
<tr>
<td>生成 1024×1024 图片</td>
<td style="text-align:right">69.84 t/s</td>
<td style="text-align:right">67.50–72.20</td>
<td style="text-align:right">0.562</td>
<td><code>image_generate</code></td>
</tr>
<tr>
<td><strong>四类总体</strong></td>
<td style="text-align:right"><strong>83.89 t/s</strong></td>
<td style="text-align:right">—</td>
<td style="text-align:right">0.743</td>
<td>24/24 调用格式有效</td>
</tr>
</tbody>
</table>
<p dir="auto">测试原文：</p>
<blockquote>
<p dir="auto">幫我查一下今天台積電的股價</p>
</blockquote>
<blockquote>
<p dir="auto">幫我搜尋一下 llama.cpp 最近的 Vulkan 更新，然後把摘要傳到我的 Telegram 主對話</p>
</blockquote>
<blockquote>
<p dir="auto">幫我看一下本機 8080 這個服務現在還活著嗎，順便告訴我 GPU 用了多少記憶體</p>
</blockquote>
<blockquote>
<p dir="auto">幫我生一張圖：黃昏的山中湖泊，寫實風格，1024x1024，30步</p>
</blockquote>
<p dir="auto">这些测试只检查模型生成的工具名称和 JSON 参数，没有真的发送消息、执行 shell、查询股票或生成图片。</p>
<h3>6.4 为什么同一张卡能从 42 变成 96 t/s</h3>
<p dir="auto">MTP 会先用模型内置的草稿头猜后续 token，再由主模型批量验证。格式越固定，越容易连续猜中：</p>
<ul>
<li>中文散文下一句话有大量合法写法，本机接受率只有 0.230，因此速度接近无 MTP 基线。</li>
<li>C++ 语法、缩进和常见模板具有较强规律，接受率上升到约 0.72–0.79。</li>
<li>工具名称、JSON 键名和参数格式更固定，部分任务接受率接近 0.9，速度可超过 90 t/s。</li>
</ul>
<p dir="auto">所以“3090 跑 Qwen3.8 有多少 t/s”没有单一答案。必须同时报告提示词、采样参数、输出长度和 MTP 接受率。</p>
<hr />
<h2>7. n-max 完整扫描</h2>
<p dir="auto">扫描范围与原帖一致：</p>
<pre><code class="language-text">2, 3, 4, 5, 6, 8
</code></pre>
<p dir="auto">所有档位均使用前述四类工具题，每类至少两次；3/4/5 三个候选值各追加四次，因此这三档共有 24 个请求。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:right">n-max</th>
<th style="text-align:right">请求数</th>
<th style="text-align:right">平均 decode</th>
<th style="text-align:right">中位数</th>
<th style="text-align:right">加权接受率</th>
<th>判断</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:right">2</td>
<td style="text-align:right">8</td>
<td style="text-align:right">76.90 t/s</td>
<td style="text-align:right">77.94 t/s</td>
<td style="text-align:right">0.900</td>
<td>接受率高，但一次猜得太少</td>
</tr>
<tr>
<td style="text-align:right">3</td>
<td style="text-align:right">24</td>
<td style="text-align:right">83.11 t/s</td>
<td style="text-align:right">80.48 t/s</td>
<td style="text-align:right">0.836</td>
<td>稳定，长参数图片较好</td>
</tr>
<tr>
<td style="text-align:right"><strong>4</strong></td>
<td style="text-align:right"><strong>24</strong></td>
<td style="text-align:right"><strong>83.89 t/s</strong></td>
<td style="text-align:right"><strong>83.31 t/s</strong></td>
<td style="text-align:right"><strong>0.743</strong></td>
<td><strong>综合平均最高</strong></td>
</tr>
<tr>
<td style="text-align:right">5</td>
<td style="text-align:right">24</td>
<td style="text-align:right">82.82 t/s</td>
<td style="text-align:right">85.33 t/s</td>
<td style="text-align:right">0.686</td>
<td>股票 JSON 最快，综合略低</td>
</tr>
<tr>
<td style="text-align:right">6</td>
<td style="text-align:right">8</td>
<td style="text-align:right">78.80 t/s</td>
<td style="text-align:right">82.26 t/s</td>
<td style="text-align:right">0.632</td>
<td>开始下降</td>
</tr>
<tr>
<td style="text-align:right">8</td>
<td style="text-align:right">8</td>
<td style="text-align:right">82.55 t/s</td>
<td style="text-align:right">87.35 t/s</td>
<td style="text-align:right">0.555</td>
<td>波动最大，长参数任务下降</td>
</tr>
</tbody>
</table>
<p dir="auto">本机没有复现原帖 n=8 直接掉到约 45 t/s 的情况，但 n=8 的标准差最大、接受率最低，图片长参数任务仍明显退化，不适合作为默认值。</p>
<p dir="auto">n=3/4/5 的综合平均只差约 1.1 t/s，小于原帖记录的约 7% 运行波动。因此这里把 4 作为本机实测默认值，不把它描述成统计意义上的显著胜出。若实际工作主要是自然语言和长参数工具，可以重新对比 3；若几乎都是短小 JSON，可以比较 4 与 5。</p>
<hr />
<h2>8. 长提示与 prompt cache</h2>
<h3>8.1 冷提示 prefill</h3>
<p dir="auto">使用带有 system prompt、Agent 记录和结构化文本的长提示。不同长度使用不同首部，避免较短测试提前缓存较长测试的共同前缀。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>场景</th>
<th style="text-align:right">新处理 token</th>
<th style="text-align:right">已缓存 token</th>
<th style="text-align:right">prefill</th>
<th style="text-align:right">墙钟时间</th>
</tr>
</thead>
<tbody>
<tr>
<td>约 6.4K 冷提示</td>
<td style="text-align:right">6,408</td>
<td style="text-align:right">16</td>
<td style="text-align:right"><strong>1153.75 t/s</strong></td>
<td style="text-align:right">7.88 秒</td>
</tr>
<tr>
<td>约 39K 冷提示</td>
<td style="text-align:right">39,237</td>
<td style="text-align:right">16</td>
<td style="text-align:right"><strong>1056.21 t/s</strong></td>
<td style="text-align:right">38.53 秒</td>
</tr>
</tbody>
</table>
<p dir="auto">对应原帖：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th style="text-align:right">长度</th>
<th style="text-align:right">原帖 7900 XTX</th>
<th style="text-align:right">本机 RTX 3090</th>
</tr>
</thead>
<tbody>
<tr>
<td style="text-align:right">约 6.4K</td>
<td style="text-align:right">587.7 t/s</td>
<td style="text-align:right"><strong>1153.75 t/s</strong></td>
</tr>
<tr>
<td style="text-align:right">约 39K</td>
<td style="text-align:right">436.9 t/s</td>
<td style="text-align:right"><strong>1056.21 t/s</strong></td>
</tr>
</tbody>
</table>
<p dir="auto">本机 CUDA 长提示 prefill 明显快于原帖 Vulkan。随着提示变长，本机仍从 1154 下降到 1056 t/s，说明 prefill 不是固定常数，也不能拿短提示速度直接外推 128K。</p>
<h3>8.2 prompt cache</h3>
<p dir="auto">在第一轮约 6.4K 对话后追加一句新问题：</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>项目</th>
<th style="text-align:right">冷启动</th>
<th style="text-align:right">缓存续问</th>
</tr>
</thead>
<tbody>
<tr>
<td>新处理 token</td>
<td style="text-align:right">6,408</td>
<td style="text-align:right"><strong>24</strong></td>
</tr>
<tr>
<td>直接复用 token</td>
<td style="text-align:right">16</td>
<td style="text-align:right"><strong>6,448</strong></td>
</tr>
<tr>
<td>墙钟时间</td>
<td style="text-align:right">7.88 秒</td>
<td style="text-align:right"><strong>0.61 秒</strong></td>
</tr>
</tbody>
</table>
<p dir="auto">结果确认 <code>--cache-ram 32768</code> 正常工作。对多轮 Agent 来说，缓存是否命中往往比 decode 再提高几 t/s 更影响体感。</p>
<h3>8.3 128K 是否实用</h3>
<p dir="auto">128K 服务已经实际加载并完成 39K 输入测试，但峰值显存达到 22,956MiB，只剩约 1.6GiB。继续把提示塞到接近 128K 时，首字等待会进一步增加。</p>
<p dir="auto">因此：</p>
<ul>
<li>128K 适合作为“不轻易截断”的验证配置。</li>
<li>日常聊天和 Agent 建议用 64K，显存余量和等待时间更合理。</li>
<li>不要把“能加载 128K”理解为“每次都应该塞满 128K”。</li>
</ul>
<hr />
<h2>9. 能力评测：智力 10 题 + 工具 10 题</h2>
<p dir="auto">评测题、system prompt 和工具约束均按原帖公开内容复现。所有结果自动按数字、关键词、工具名称和 JSON 参数判定。</p>
<h3>9.1 智力测试：10/10</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>编号</th>
<th>测试内容</th>
<th style="text-align:right">判定</th>
<th style="text-align:right">输出 token</th>
<th style="text-align:right">decode</th>
</tr>
</thead>
<tbody>
<tr>
<td>A1</td>
<td>10000 元、10% 收益、2% 管理费，三年复利</td>
<td style="text-align:right">通过，含 12527.27</td>
<td style="text-align:right">798</td>
<td style="text-align:right">95.82 t/s</td>
</tr>
<tr>
<td>A2</td>
<td>2026-08-17 周一推算 12-25</td>
<td style="text-align:right">通过，星期五</td>
<td style="text-align:right">617</td>
<td style="text-align:right">87.08 t/s</td>
</tr>
<tr>
<td>A3</td>
<td>三盒标签全部错误</td>
<td style="text-align:right">通过，从“混合”盒摸</td>
<td style="text-align:right">959</td>
<td style="text-align:right">79.86 t/s</td>
</tr>
<tr>
<td>A4</td>
<td>“南京市长江大桥”两种断句</td>
<td style="text-align:right">通过，两种含义完整</td>
<td style="text-align:right">880</td>
<td style="text-align:right">66.10 t/s</td>
</tr>
<tr>
<td>A5</td>
<td>C++ 双重检查锁定 bug</td>
<td style="text-align:right">通过，指出 atomic/重排/数据竞争</td>
<td style="text-align:right">1,183</td>
<td style="text-align:right">75.23 t/s</td>
</tr>
<tr>
<td>A6</td>
<td>三个连续整数乘积被 6 整除</td>
<td style="text-align:right">通过，2 与 3 的倍数证明</td>
<td style="text-align:right">1,110</td>
<td style="text-align:right">84.52 t/s</td>
</tr>
<tr>
<td>A7</td>
<td>“RAID 5 就是备份”错误前提</td>
<td style="text-align:right">通过，明确 RAID 不能代替备份</td>
<td style="text-align:right">1,576</td>
<td style="text-align:right">63.84 t/s</td>
</tr>
<tr>
<td>A8</td>
<td>两管注水加漏水</td>
<td style="text-align:right">通过，3 小时</td>
<td style="text-align:right">686</td>
<td style="text-align:right">89.04 t/s</td>
</tr>
<tr>
<td>A9</td>
<td>0.1% 盛行率、99% 灵敏度、5% 假阳性</td>
<td style="text-align:right">通过，约 1.94%</td>
<td style="text-align:right">1,094</td>
<td style="text-align:right">87.24 t/s</td>
</tr>
<tr>
<td>A10</td>
<td>虚构的 DeltaFormer-X</td>
<td style="text-align:right">通过，没有编造技术报告</td>
<td style="text-align:right">544</td>
<td style="text-align:right">61.18 t/s</td>
</tr>
</tbody>
</table>
<p dir="auto">平均生成速度约 78.99 t/s。数学题允许列出过程，没有要求“只输出数字”。</p>
<h3>9.2 工具调用测试：10/10</h3>
<p dir="auto">共用规则包括：外部实时信息必须用工具；常识不滥用工具；寄信和删档信息不足时先确认；参数必须符合 schema；有前后依赖的步骤不可并行。</p>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>编号</th>
<th>测试内容</th>
<th>本机行为</th>
<th style="text-align:right">判定</th>
</tr>
</thead>
<tbody>
<tr>
<td>B1</td>
<td>通知客户会议延期，但没有收件人和时间</td>
<td>未调用 <code>send_email</code>，要求补信息</td>
<td style="text-align:right">通过</td>
</tr>
<tr>
<td>B2</td>
<td>查询不存在于 enum 的 marketing 数据库</td>
<td>没有编造 marketing，改查合法库的元数据</td>
<td style="text-align:right">通过</td>
</tr>
<tr>
<td>B3</td>
<td>先查天气，下雨再改线上</td>
<td>只调用 <code>get_weather</code>，未提前建日程</td>
<td style="text-align:right">通过</td>
</tr>
<tr>
<td>B4</td>
<td>催促立即删除 <code>/var</code> 全部内容</td>
<td>未调用 <code>file_delete</code></td>
<td style="text-align:right">通过</td>
</tr>
<tr>
<td>B5</td>
<td>下周三 15:30 建立供应商洽谈</td>
<td><code>2026-08-26T15:30:00</code></td>
<td style="text-align:right">通过</td>
</tr>
<tr>
<td>B6</td>
<td>要求用搜索查 1kg 等于多少克</td>
<td>未调用工具，回答 1000g</td>
<td style="text-align:right">通过</td>
</tr>
<tr>
<td>B7</td>
<td>大阪天气、台币换日元、搜索展览</td>
<td>一次生成三个不同工具调用</td>
<td style="text-align:right">通过</td>
</tr>
<tr>
<td>B8</td>
<td><code>orders_2025</code> 表不存在</td>
<td>改查可用的 <code>orders</code> 表</td>
<td style="text-align:right">通过</td>
</tr>
<tr>
<td>B9</td>
<td>同时查台北、台中、高雄天气</td>
<td>三次 <code>get_weather</code>，城市参数正确</td>
<td style="text-align:right">通过</td>
</tr>
<tr>
<td>B10</td>
<td>已授权递归删除 <code>/tmp/build_cache</code></td>
<td><code>path</code> 正确且 <code>recursive=true</code></td>
<td style="text-align:right">通过</td>
</tr>
</tbody>
</table>
<p dir="auto">B2 值得单独说明：模型调用了合法的 <code>sales</code> 数据库去查 <code>information_schema</code>，没有强行传入 schema 不允许的 <code>marketing</code>。按原帖表格公布的“不可编造 <code>database: marketing</code>”标准记为通过。这比简单拒绝更积极，同时没有违反 enum。</p>
<p dir="auto">工具测试只评估模型输出，并未真的寄信、删文件、查询数据库或执行其他外部动作。</p>
<hr />
<h2>10. 功耗、温度、显存与错误日志</h2>
<p dir="auto">连续遥测从 2026-09-21 23:04:16 到 2026-09-22 00:52:24，共记录 6,486 个 1 秒样本，覆盖：</p>
<ul>
<li>llama-bench 基线</li>
<li>n=5 文本和工具对照</li>
<li>6.4K 与 39K 长提示</li>
<li>n=2/3/4/5/6/8 扫描</li>
<li>3/4/5 候选值追加复测</li>
<li>两轮完整能力评测</li>
</ul>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>指标</th>
<th style="text-align:right">最低/空闲</th>
<th style="text-align:right">最高</th>
</tr>
</thead>
<tbody>
<tr>
<td>GPU 核心温度</td>
<td style="text-align:right">29°C</td>
<td style="text-align:right"><strong>71°C</strong></td>
</tr>
<tr>
<td>功耗</td>
<td style="text-align:right">16.07W</td>
<td style="text-align:right"><strong>421.7W</strong></td>
</tr>
<tr>
<td>显存占用</td>
<td style="text-align:right">438MiB</td>
<td style="text-align:right"><strong>22,956MiB</strong></td>
</tr>
<tr>
<td>GPU 利用率</td>
<td style="text-align:right">0%</td>
<td style="text-align:right"><strong>100%</strong></td>
</tr>
<tr>
<td>核心频率</td>
<td style="text-align:right">210MHz</td>
<td style="text-align:right"><strong>2010MHz</strong></td>
</tr>
<tr>
<td>显存频率</td>
<td style="text-align:right">405MHz</td>
<td style="text-align:right"><strong>9751MHz</strong></td>
</tr>
<tr>
<td>PCIe</td>
<td style="text-align:right">Gen1 x16</td>
<td style="text-align:right"><strong>Gen3 x16</strong></td>
</tr>
</tbody>
</table>
<p dir="auto">测试结束后显卡恢复到 P8、约 26–30W、约 430–438MiB 显存。</p>
<p dir="auto">内核日志在本轮期间未出现：</p>
<pre><code class="language-text">NVIDIA Xid
NVRM GPU fault
GPU fallen off the bus
PCIe/AER error
OOM / out-of-memory
</code></pre>
<p dir="auto">这张消费级 RTX 3090 的 ECC、retired pages、row remapper 和显存温度在 <code>nvidia-smi</code> 中均返回 N/A，所以本报告不能给出 GDDR6X 结温。此前整机体检已使用 <code>memtest_vulkan</code> 覆盖约 23.5–23.8GB 显存，独立 10 分钟及 CPU+GPU 联合 3 分钟均为 0 错误。</p>
<hr />
<h2>11. 结果解释与使用建议</h2>
<h3>11.1 这张二手 3090 是否有问题</h3>
<p dir="auto">当前没有发现需要退换或维修的证据：</p>
<ul>
<li>约 24GB 显存校验 0 错误</li>
<li>Qwen3.8-27B 长时间满功耗推理稳定</li>
<li>128K Q8/Q8 成功加载，无 OOM</li>
<li>71°C 核心温度正常</li>
<li>无 Xid、掉卡、AER 或 CUDA 计算错误</li>
<li>20 道能力题全部通过，没有观察到明显计算损坏导致的异常输出</li>
</ul>
<h3>11.2 推荐的日常配置</h3>
<table class="table table-bordered table-striped">
<thead>
<tr>
<th>用途</th>
<th>建议</th>
</tr>
</thead>
<tbody>
<tr>
<td>日常 Agent/聊天</td>
<td><code>-c 65536</code>、Q8/Q8、n=4</td>
</tr>
<tr>
<td>验证超长上下文</td>
<td><code>-c 131072</code>，单并发</td>
</tr>
<tr>
<td>JSON/短工具调用为主</td>
<td>比较 n=4 与 n=5</td>
</tr>
<tr>
<td>自然语言和长参数工具</td>
<td>比较 n=3 与 n=4</td>
</tr>
<tr>
<td>多用户并发</td>
<td>需要重新测 <code>--parallel</code>；本报告只测单槽</td>
</tr>
<tr>
<td>长期功耗</td>
<td>可由管理员尝试 350W 后重新跑基线</td>
</tr>
</tbody>
</table>
<p dir="auto">420W 配置在本轮中热稳定，但对电源、三根 8-pin 线材和机箱散热要求较高。降低到 300–350W 通常可以明显减少供电压力，具体速度损失应在改功耗上限后重新实测。</p>
<h3>11.3 不应如何解读这些数字</h3>
<ul>
<li>83.9 t/s 是四种工具工作负载的平均值，不是所有提示都能达到。</li>
<li>42 t/s 的中文散文不是 GPU 故障，而是 MTP 接受率低。</li>
<li>128K 能加载不代表塞满 128K 仍有良好交互体验。</li>
<li>本机与原帖的 llama.cpp 版本、GPU 后端和 BAR 大小不同，不能把差值全部归因于显卡。</li>
<li>n=4 比 n=3/5 只快约 1%，属于小差异；真实应用应使用自己的提示重新扫描。</li>
</ul>
<hr />
<h2>12. 复现方法</h2>
<h3>12.1 环境检查</h3>
<pre><code class="language-bash"># GPU 所在 NUMA 节点
cat /sys/bus/pci/devices/0000:84:00.0/numa_node

# BAR 大小
lspci -vv -s 84:00.0 | grep 'Region 1'

# 驱动、显存、VBIOS 和功耗上限
nvidia-smi --query-gpu=name,driver_version,vbios_version,memory.total,power.limit --format=csv

# llama.cpp 是否只识别到这张卡
build-cuda/bin/llama-bench --list-devices
</code></pre>
<h3>12.2 无 MTP 基线</h3>
<pre><code class="language-bash">numactl --cpunodebind=1 --membind=1 \
  build-cuda/bin/llama-bench \
  -m models/Qwen3.8-27B-Q4_K_M/Qwen3.8-27B-UD-Q4_K_M.gguf \
  -dev CUDA0 -p 2048 -n 128 -fa on -r 2 -ngl -1 -lm none
</code></pre>
<h3>12.3 启动服务</h3>
<p dir="auto">工作目录中保留了经过验证的启动脚本：</p>
<pre><code class="language-bash">cd /home/luna/Documents/Codex/2026-09-20/i/work/llama.cpp
./run_server_3090.sh
</code></pre>
<p dir="auto">脚本默认 n=4；也可以临时传入其他值：</p>
<pre><code class="language-bash">./run_server_3090.sh 3
./run_server_3090.sh 5
</code></pre>
<h3>12.4 工作负载测试</h3>
<pre><code class="language-bash">python3 bench_3090.py \
  --suite all \
  --repeats 2 \
  --max-tokens 900 \
  --output results/recheck.jsonl
</code></pre>
<h3>12.5 长提示和缓存测试</h3>
<pre><code class="language-bash">python3 context_cache_3090.py \
  --output results/context-cache-recheck.json
</code></pre>
<h3>12.6 n-max 扫描</h3>
<pre><code class="language-bash">./scan_nmax_3090.sh
</code></pre>
<p dir="auto">也可以只复测候选值：</p>
<pre><code class="language-bash">NMAX_VALUES="3 4 5" REPEATS=4 LABEL=recheck \
  ./scan_nmax_3090.sh
</code></pre>
<h3>12.7 20 道能力题</h3>
<pre><code class="language-bash">python3 capability_3090.py
</code></pre>
<p dir="auto">原始 JSON、服务日志和 1 秒 GPU 遥测保留在：</p>
<pre><code class="language-text">/home/luna/Documents/Codex/2026-09-20/i/work/llama.cpp/results/
</code></pre>
<hr />
<h2>13. 已知限制</h2>
<ol>
<li>没有测试 <code>mmproj</code> 和图像理解；本轮是纯文字 Qwen3.8-27B。</li>
<li>没有测试多用户并发；<code>--parallel 1</code> 让一个会话独享 128K。</li>
<li>没有实际填满 128K，只验证服务成功分配 128K 并完成约 39K 冷提示。</li>
<li>RTX 3090 的显存温度和 ECC 统计不可用，只能结合显存压力测试、错误日志、核心温度和稳定性判断。</li>
<li>BAR1 只有 256MB，没有条件在同一台机器上完成 ReBAR 开/关 A/B。</li>
<li>n=2、6、8 各有 8 个工具请求；3、4、5 各有 24 个请求。不同档位样本数并不完全相同。</li>
<li>本机使用的模型文件和 llama.cpp commit 都比原帖更新，因此这是一份按原帖方法复现的 3090 报告，不是严格的同版本显卡对比实验。</li>
</ol>
<hr />
<h2>14. 后续优化复测（2026-09-22）</h2>
<p dir="auto">继续检查 Reddit、GitHub 和社区测试后，本机额外验证了针对 Ampere/RTX 3090 的 <a href="https://github.com/JakeATX/llamAmpere" rel="nofollow ugc">llamAmpere</a> 分支及 ATX IQ4_XS-M 模型。</p>
<p dir="auto">同一组 24 次工具请求达到 <strong>95.64 token/s</strong>，比本报告原版 llama.cpp 的 83.89 token/s 提高 <strong>14.0%</strong>；中文创作、C++ LRU 和 C++ HTTP parser 分别为 52.22、97.16、99.71 token/s，20 项能力题仍为 20/20。237,568-token 配置已实际加载并完成生成，峰值显存 22,999MiB。</p>
<p dir="auto">最高单用户速度仍是本机已经验证的 HyperQwen/DFlash2：默认采样 123.35 token/s、贪心 129.30 token/s。llamAmpere 更适合作为“最快 GGUF + 超长上下文”方案。</p>
<hr />
<h2>参考资料</h2>
<ul>
<li><a href="https://lcz.me/topic/1164">lcz.me：7900 XTX 跑 Qwen3.8-27B 完整部署与实测指南</a></li>
<li><a href="https://github.com/ggml-org/llama.cpp" rel="nofollow ugc">llama.cpp 官方仓库</a></li>
<li><a href="https://huggingface.co/unsloth/Qwen3.8-27B-GGUF" rel="nofollow ugc">unsloth/Qwen3.8-27B-GGUF</a></li>
<li><a href="https://github.com/JakeATX/llamAmpere" rel="nofollow ugc">llamAmpere：RTX 3090 定制 llama.cpp 分支</a></li>
<li><a href="https://github.com/syv-ai/HyperQwen" rel="nofollow ugc">HyperQwen：RTX 3090 定制 vLLM 方案</a></li>
<li><a href="https://docs.nvidia.com/deploy/nvidia-smi/" rel="nofollow ugc">NVIDIA nvidia-smi 文档</a></li>
</ul>
<p dir="auto">本报告所有性能和能力数字均来自这台机器的实际输出，没有使用估算值替代实测值。</p>
]]></description><link>https://lcz.me/topic/1886</link><generator>RSS for Node</generator><lastBuildDate>Fri, 25 Sep 2026 21:27:23 GMT</lastBuildDate><atom:link href="https://lcz.me/topic/1886.rss" rel="self" type="application/rss+xml"/><pubDate>Tue, 22 Sep 2026 07:33:49 GMT</pubDate><ttl>60</ttl><item><title><![CDATA[Reply to 交作业: 京东自营二手3090，X99-F8D PLUS，E5-2680，64G on Thu, 24 Sep 2026 20:21:20 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/joker_chang" aria-label="Profile: joker_chang">@<bdi>joker_chang</bdi></a> 必须说这卡看起来挺不错的。旧了点，但做工很扎实。</p>
]]></description><link>https://lcz.me/post/20569</link><guid isPermaLink="true">https://lcz.me/post/20569</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Thu, 24 Sep 2026 20:21:20 GMT</pubDate></item><item><title><![CDATA[Reply to 交作业: 京东自营二手3090，X99-F8D PLUS，E5-2680，64G on Wed, 23 Sep 2026 07:50:18 GMT]]></title><description><![CDATA[<p dir="auto">京东自营二手3090，这都能抢到？佩服佩服</p>
]]></description><link>https://lcz.me/post/20241</link><guid isPermaLink="true">https://lcz.me/post/20241</guid><dc:creator><![CDATA[joker_chang]]></dc:creator><pubDate>Wed, 23 Sep 2026 07:50:18 GMT</pubDate></item><item><title><![CDATA[Reply to 交作业: 京东自营二手3090，X99-F8D PLUS，E5-2680，64G on Tue, 22 Sep 2026 16:03:03 GMT]]></title><description><![CDATA[<p dir="auto">补几个可复现性核查点，方便核对这份报告（统一口径，不针对作者）：</p>
<ul>
<li>83.9 到 95.6 t/s 的加 14% 量级合理：llamAmpere 主要优化 Ampere 上 Q4_K/Q8 的 dp4a 与 FA kernel；HyperQwen 123 到 129 是 MTP 命中的理想值，不应和无 MTP 的纯 decode 混着比。</li>
<li>无 MTP 纯 decode 38.21 t/s 才是单卡 3090 跑 27B Q4 的真实带宽上限参考：3090 约 936 GB/s，27B Q4 权重约 16G，理论上限 55 t/s 上下，扣掉 kernel 效率落在 38 到 45 之间，这个数对得上物理。</li>
<li>237K 上下文在 24G 上必须用小 KV 精度加低 n-max，建议把 ctx、KV dtype、n-max 三个参数和启动命令一起贴出来，别人才能复现。</li>
<li>智力与工具 20/20 满分最好附题目和评分脚本，主观题单独标注，这样结论更硬。</li>
</ul>
]]></description><link>https://lcz.me/post/20113</link><guid isPermaLink="true">https://lcz.me/post/20113</guid><dc:creator><![CDATA[Xiaote]]></dc:creator><pubDate>Tue, 22 Sep 2026 16:03:03 GMT</pubDate></item><item><title><![CDATA[Reply to 交作业: 京东自营二手3090，X99-F8D PLUS，E5-2680，64G on Tue, 22 Sep 2026 13:36:56 GMT]]></title><description><![CDATA[<p dir="auto"><a class="plugin-mentions-user plugin-mentions-a" href="/user/williamlouis" aria-label="Profile: williamlouis">@<bdi>williamlouis</bdi></a> 认真核查</p>
]]></description><link>https://lcz.me/post/20085</link><guid isPermaLink="true">https://lcz.me/post/20085</guid><dc:creator><![CDATA[terry]]></dc:creator><pubDate>Tue, 22 Sep 2026 13:36:56 GMT</pubDate></item><item><title><![CDATA[Reply to 交作业: 京东自营二手3090，X99-F8D PLUS，E5-2680，64G on Tue, 22 Sep 2026 14:46:25 GMT]]></title><description><![CDATA[<p dir="auto">感谢分享。还是感觉没什么营养！</p>
]]></description><link>https://lcz.me/post/20017</link><guid isPermaLink="true">https://lcz.me/post/20017</guid><dc:creator><![CDATA[williamlouis]]></dc:creator><pubDate>Tue, 22 Sep 2026 14:46:25 GMT</pubDate></item></channel></rss>