跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

J

joker_chang

@joker_chang
德高望重 劳动模范
取消关注 关注
关于
帖子
80
主题
5
分享
0
群组
2
粉丝
0
关注
1

帖子

最新 最佳 有争议的

  • 大热的3090风冷改造方案 大幅降温稳定AI大脑
    J joker_chang

    跑什么应用会这么高的温度?
    我的解决方案如下:
    86e40132-6537-43fd-96c4-1d3965cb8639-image.jpeg

    整体用下来,GPU温度从没超过80°

    AI硬件 rtx3090

  • 用llama.cpp的兄弟们记得升级
    J joker_chang

    下载了官方最新的release【llama-b9553-bin-win-cuda-12.4-x64】

    9f8c0b55-1719-408c-af90-f9a2e5f5d1d2-image.jpeg

    dd185f8a-7a35-48e7-89ac-76fe02fce979-image.jpeg

    LLM讨论区 llama.cpp

  • 来交作业了,华南金牌X99套装+RTX3090Ti+RTX3060双卡装机完毕
    J joker_chang

    上周收到华南金牌的板U套装和Z40机箱+长城1250W电源,然后用自己旧电脑上的拆机件开始装机。

    IMG_6748.PNG

    内存条4条插满(32x2+16x2),1T的SSD,3060怼上,重装全新的windows10,结果点不亮。
    不知道是不是我的3060的问题,HDMI不行,换DP亮了。

    今天收到RTX3090Ti,双卡怼上,开机😄

    IMG_6742.jpg

    开机正常,但是上周装的nividia显卡驱动丢了。重装驱动,结果发现3090不认。考虑到是不是槽位不对,将上图中两张卡的位置做了对调。重新开机,认到了3090,但是装完驱动后,显示器黑屏。插入3060的DP口,显示器正常显示。但是在任务管理器中看不到3090,只有3060。

    以为买的3090Ti翻车了,本着死马当活马医,开始怼DeepSeek......
    然后得知,要调整BIOS中的设置:
    IMG_6746.png
    IMG_6745.png

    运气不错,BIOS调整很顺利,并且开机后都没有提示我需要重装显卡驱动,就一切正常。IMG_6744.jpg

    IMG_6743.jpg

    为了尽快验证新买的卡是能用的,下载LM Studio,加载unsloth\Qwen3.6-27B-GGUF(双卡顺序加载)

    用一个我常用的测试题进行测试,结果只有不到20tokens/s

    在LM Studio中关掉3060,只用3090单卡加载Qwen3.6-27B-GGUF,同样的问题,39tokens/s

    ====================================================

    今天先到这里,明天开始折腾llama.cpp

    AI硬件 nvidia 多卡部署

  • 在线调用的最大无奈
    J joker_chang

    原计划是要用deepseek-v4 flash验证本地模型写的代码有没有bug,确实发现了隐藏的bug
    bb3b5da6-2a60-4ee8-b062-ef46202d10c4-image.jpeg

    但是再做下一步任务的时候报错了:
    25632d2a-9ec4-4e0a-91f9-21331f9b0c82-image.jpeg

    重试几次都是同样的问题,重启gateway还是错误依旧

    换成本地模型就好了,哎......

    晒一下deepseek的调用情况:
    e148f2dd-c36d-4574-9809-d42153c16abd-image.jpeg

    随便聊聊

  • Linux下显卡测试工具和脚本分享
    J joker_chang

    谢谢锤哥的脚本,我让deepseek改了两稿才能正确的在windows下执行:【import torch
    import sys
    import os

    建议开启 expandable_segments 避免碎片(对 PyTorch 1.11+ 有效)

    os.environ['PYTORCH_CUDA_ALLOC_CONF'] = 'expandable_segments:True'

    print(f"📦 正在启动英伟达消费级显存物理专项扫描...")
    if not torch.cuda.is_available():
    print("❌ 没找到 GPU 驱动")
    sys.exit(1)

    device = torch.device("cuda:0")

    获取总显存,多留一些空间给驱动和系统(这里留 3GB)

    total_mem = torch.cuda.get_device_properties(0).total_memory
    safe_margin = 3 * 1024 * 1024 * 1024 # 3 GB
    usable_mem = total_mem - safe_margin
    print(f"⚡ 物理检测到总显存: {total_mem / (10243):.2f} GB")
    print(f"🔧 预留安全边界后可用显存: {usable_mem / (1024
    3):.2f} GB")

    分块大小:每次分配 2GB 的 float32 张量(即 512M 个元素),避免一次性大块失败

    chunk_bytes = 2 * 1024 * 1024 * 1024
    chunk_elements = chunk_bytes // 4 # float32 每个 4 字节
    num_chunks = usable_mem // chunk_bytes

    print(f"🔥 采用分块扫描策略,共 {num_chunks} 块,每块 {chunk_bytes / (1024**3):.2f} GB")
    print(f"⏳ 开始物理交替位元扫雷测试(耗时较长)...\n")

    try:
    for chunk_idx in range(num_chunks):
    print(f" -> [块 {chunk_idx+1}/{num_chunks}] 写入全 0 模式并校验物理放电...")
    grid0 = torch.zeros(chunk_elements, dtype=torch.float32, device=device)
    torch.cuda.synchronize()
    if not (grid0 == 0).all():
    raise ValueError(f"块 {chunk_idx+1} 放电校验失败!")
    del grid0

        print(f" -> [块 {chunk_idx+1}/{num_chunks}] 写入全 1 模式并校验物理充电...")
        grid1 = torch.ones(chunk_elements, dtype=torch.float32, device=device)
        torch.cuda.synchronize()
        if not (grid1 == 1).all():
            raise ValueError(f"块 {chunk_idx+1} 充电校验失败!")
        del grid1
    
        print(f" -> [块 {chunk_idx+1}/{num_chunks}] 交替位元高频冲刷...")
        pattern = torch.arange(0, chunk_elements, dtype=torch.float32, device=device)
        torch.cuda.synchronize()
        # 简单校验:求和
        s = pattern.sum().item()
        del pattern
    
        torch.cuda.empty_cache()  # 每块完成后清理缓存
        print(f"     ✔ 块 {chunk_idx+1} 通过。\n")
    
    print(f"🎉【显存物理体检通过】所有魔改颗粒逐位读写 100% 正确!")
    

    except Exception as e:
    print(f"\n❌【铁证如山】显存物理颗粒扫描失败: {e}")
    sys.exit(1)】

    我x99洋垃圾上的3090和3060都检测通过:【
    D:\temp>python vram_heavy_test.py
    📦 正在启动英伟达消费级显存物理专项扫描...
    ⚡ 物理检测到总显存: 12.00 GB
    🔧 预留安全边界后可用显存: 11.00 GB
    🔥 采用分块扫描策略,共 5 块,每块 2.00 GB
    ⏳ 开始物理交替位元扫雷测试(耗时较长)...

    -> [块 1/5] 写入全 0 模式并校验物理放电...
    D:\temp\vram_heavy_test.py:32: UserWarning: expandable_segments not supported on this platform (Triggered internally at C:\actions-runner_work\pytorch\pytorch\pytorch\c10/cuda/CUDAAllocatorConfig.h:28.)
    grid0 = torch.zeros(chunk_elements, dtype=torch.float32, device=device)
    -> [块 1/5] 写入全 1 模式并校验物理充电...
    -> [块 1/5] 交替位元高频冲刷...
    ✔ 块 1 通过。

    -> [块 2/5] 写入全 0 模式并校验物理放电...
    -> [块 2/5] 写入全 1 模式并校验物理充电...
    -> [块 2/5] 交替位元高频冲刷...
    ✔ 块 2 通过。

    -> [块 3/5] 写入全 0 模式并校验物理放电...
    -> [块 3/5] 写入全 1 模式并校验物理充电...
    -> [块 3/5] 交替位元高频冲刷...
    ✔ 块 3 通过。

    -> [块 4/5] 写入全 0 模式并校验物理放电...
    -> [块 4/5] 写入全 1 模式并校验物理充电...
    -> [块 4/5] 交替位元高频冲刷...
    ✔ 块 4 通过。

    -> [块 5/5] 写入全 0 模式并校验物理放电...
    -> [块 5/5] 写入全 1 模式并校验物理充电...
    -> [块 5/5] 交替位元高频冲刷...
    ✔ 块 5 通过。

    🎉【显存物理体检通过】所有魔改颗粒逐位读写 100% 正确!

    D:\temp>python vram_heavy_test.py
    📦 正在启动英伟达消费级显存物理专项扫描...
    ⚡ 物理检测到总显存: 23.99 GB
    🔧 预留安全边界后可用显存: 20.99 GB
    🔥 采用分块扫描策略,共 10 块,每块 2.00 GB
    ⏳ 开始物理交替位元扫雷测试(耗时较长)...

    -> [块 1/10] 写入全 0 模式并校验物理放电...
    D:\temp\vram_heavy_test.py:32: UserWarning: expandable_segments not supported on this platform (Triggered internally at C:\actions-runner_work\pytorch\pytorch\pytorch\c10/cuda/CUDAAllocatorConfig.h:28.)
    grid0 = torch.zeros(chunk_elements, dtype=torch.float32, device=device)
    -> [块 1/10] 写入全 1 模式并校验物理充电...
    -> [块 1/10] 交替位元高频冲刷...
    ✔ 块 1 通过。

    -> [块 2/10] 写入全 0 模式并校验物理放电...
    -> [块 2/10] 写入全 1 模式并校验物理充电...
    -> [块 2/10] 交替位元高频冲刷...
    ✔ 块 2 通过。

    -> [块 3/10] 写入全 0 模式并校验物理放电...
    -> [块 3/10] 写入全 1 模式并校验物理充电...
    -> [块 3/10] 交替位元高频冲刷...
    ✔ 块 3 通过。

    -> [块 4/10] 写入全 0 模式并校验物理放电...
    -> [块 4/10] 写入全 1 模式并校验物理充电...
    -> [块 4/10] 交替位元高频冲刷...
    ✔ 块 4 通过。

    -> [块 5/10] 写入全 0 模式并校验物理放电...
    -> [块 5/10] 写入全 1 模式并校验物理充电...
    -> [块 5/10] 交替位元高频冲刷...
    ✔ 块 5 通过。

    -> [块 6/10] 写入全 0 模式并校验物理放电...
    -> [块 6/10] 写入全 1 模式并校验物理充电...
    -> [块 6/10] 交替位元高频冲刷...
    ✔ 块 6 通过。

    -> [块 7/10] 写入全 0 模式并校验物理放电...
    -> [块 7/10] 写入全 1 模式并校验物理充电...
    -> [块 7/10] 交替位元高频冲刷...
    ✔ 块 7 通过。

    -> [块 8/10] 写入全 0 模式并校验物理放电...
    -> [块 8/10] 写入全 1 模式并校验物理充电...
    -> [块 8/10] 交替位元高频冲刷...
    ✔ 块 8 通过。

    -> [块 9/10] 写入全 0 模式并校验物理放电...
    -> [块 9/10] 写入全 1 模式并校验物理充电...
    -> [块 9/10] 交替位元高频冲刷...
    ✔ 块 9 通过。

    -> [块 10/10] 写入全 0 模式并校验物理放电...
    -> [块 10/10] 写入全 1 模式并校验物理充电...
    -> [块 10/10] 交替位元高频冲刷...
    ✔ 块 10 通过。

    🎉【显存物理体检通过】所有魔改颗粒逐位读写 100% 正确!
    】

    AI硬件 linux

  • 来交作业了,华南金牌X99套装+RTX3090Ti+RTX3060双卡装机完毕
    J joker_chang

    折腾了几天,踩了无数坑:
    1、windows10的电源一定要用卓越性能,不然GPU的频率根本跑不起来,会被限制到180w左右
    2、cmake编译llama.cpp不要抄作业(反正我本人没搞定,自己编译的能跑但是最多不到10tokens/s),直接用官方https://github.com/ggml-org/llama.cpp/releases的版本,3090下Windows x64 (CUDA 12)
    3、官方编译的版本能Qwen3.6 27B跑到35tokens/s,不过MTP没什么效果,我跑unsloth的MTP版本Qwen3.6 27B,也就只能跑到37tokens/s

    188067d1-3762-48c0-9bee-673d2d4ab02c-image.jpeg

    02bc2f94-3075-4d19-bc06-f9df4653f2b4-image.jpeg

    AI硬件 nvidia 多卡部署

  • 我也开一个问题,虚心请教:JD买二手魔改是否有保障
    J joker_chang

    看过锤哥视频的介绍,还不如加点钱买魔改的3080

    AI硬件

  • 来交作业了,华南金牌X99套装+RTX3090Ti+RTX3060双卡装机完毕
    J joker_chang

    9a1fc078-9911-4ed1-9d7c-6a2f95cced3a-image.jpeg

    这是我自己编译的llama.cpp

    同样的模型,同样的硬件,同样的启动脚本,差别简直了......

    32ad04c9-dd7c-4a0b-adb1-b48fce5945b7-image.jpeg

    这是https://github.com/ggml-org/llama.cpp/releases/download/b9305/llama-b9305-bin-win-cuda-12.4-x64.zip的

    哎~

    AI硬件 nvidia 多卡部署

  • 来交作业了,华南金牌X99套装+RTX3090Ti+RTX3060双卡装机完毕
    J joker_chang

    @rock-shi

    @rock-shi 经过论坛大神的指点(--ubatch-size 1024),和自己不断的折腾,能达到这个值了。

    启动参数:
    --host 0.0.0.0 ^
    --port 3527 ^
    --reasoning off ^
    --n-gpu-layers -1 ^
    --ctx-size 131072 ^
    --batch-size 2048 ^
    --ubatch-size 1024 ^
    --flash-attn on ^
    --cache-type-k q4_0 ^
    --cache-type-v q4_0 ^
    --spec-type draft-mtp,ngram-mod ^
    --spec-draft-n-max 3 ^
    --spec-ngram-mod-n-max 5 ^
    --spec-ngram-mod-n-min 3 ^
    --temp 0.7 ^
    --parallel 1

    AI硬件 nvidia 多卡部署

  • 想把主機弄成縫合怪3090+3080+3060可以嗎
    J joker_chang

    我现在是X99洋垃圾,插3090Ti+3060,3090跑qwen3.6-27b(128k上下文)作为Hermes的主力模型,3060跑Gemma4-12b,作为多模态辅助模型。

    AI硬件 rtx3090 rtx3080 rtx3060

  • 被抡锤者种草后,我用 X99 + 4090D 48G 搭了一台本地 LLM 服务器
    J joker_chang

    @Ivan-Yin

    【--spec-type draft-mtp ^
    --spec-draft-n-max 3 ^】
    实施效果呢......

    我的3090跑Qwen3.6-27B-unslothMTP-Q4_K_M.gguf,Hermes coding能稳定60~70t/s;最快能到80多t/s

    当然,受限于显存大小,只能
    【
    --ctx-size 131072 ^
    --batch-size 4096^
    --ubatch-size 2048 ^
    --flash-attn on ^
    --cache-type-k q4_0 ^
    --cache-type-v q4_0 ^
    】

    d5b46d03-1270-49d8-90b9-bcbb8294483b-image.jpeg

    AI硬件 x99

  • 大热的3090风冷改造方案 大幅降温稳定AI大脑
    J joker_chang

    8cddbc82-4e47-4a8c-a7ed-81746258344c-image.jpeg

    我运行时的截屏

    AI硬件 rtx3090

  • 两块5070TI 16G 能部署什么样的本地模型,分别提供给2个人使用,相互不影响?
    J joker_chang

    我现在的用法:
    实例1(GPU 0):
    Qwen3.6-27B-MTP-GGUF\Qwen3.6-27B-unslothMTP-Q4_K_M.gguf

    实例2(GPU 1):
    REM 仅使用 RTX 3060 (12G VRAM)
    set CUDA_VISIBLE_DEVICES=1

    REM 请替换为你的实际路径
    set SERVER_PATH=.\llama-server.exe

    set MODEL_PATH=D:\MyModels\unsloth\gemma-4-12b-it-GGUF\gemma-4-12B-it-qat-UD-Q4_K_XL.gguf
    set MMProj_PATH=D:\MyModels\unsloth\gemma-4-12b-it-GGUF\mmproj-gemma-4-12B-it-F16.gguf
    set MTP_PATH=D:\MyModels\unsloth\gemma-4-12b-it-GGUF\mtp-gemma-4-12B-it.gguf

    Hermes agent中qwen3.6做主模型、gemma-4做辅助模型(主要用于知识库文档识别时多模态)

    给不同的人用,我觉得可以做参考,llama-server起两个服务运行在不同的端口,使用者通过端口来区分调用

    LLM讨论区

  • llama.cpp 双 RTX 3080 推理加速实测:Qwen3.6-27B 从 35 到 50 tok/s
    J joker_chang

    使用llama-b9329-bin-win-cuda-12.4-x64这个官方的Release
    启动参数:
    --reasoning off ^
    --n-gpu-layers -1 ^
    --ctx-size 131072 ^
    --batch-size 2048 ^
    --ubatch-size 1024 ^
    --flash-attn on ^
    --cache-type-k q4_0 ^
    --cache-type-v q4_0 ^
    --spec-type draft-mtp,ngram-mod ^
    --spec-draft-n-max 3 ^
    --spec-ngram-mod-n-max 5 ^
    --spec-ngram-mod-n-min 3 ^
    --temp 0.7 ^
    --parallel 1

    处理一个128KB的md文件,日志:【
    3.11.560.628 I srv params_from_: Chat format: peg-native
    3.11.562.098 I slot get_availabl: id 0 | task -1 | selected slot by LRU, t_last = 101040854
    3.11.562.100 I srv get_availabl: updating prompt cache
    3.11.564.872 W srv prompt_save: - saving prompt with length 12163, total state size = 411.405 MiB (draft: 47.744 MiB)
    3.11.766.865 I srv load: - looking for better prompt, base f_keep = 0.000, sim = 0.000
    3.11.766.874 I srv update: - cache state: 1 prompts, 596.347 MiB (limits: 8192.000 MiB, 131072 tokens, 167082 est)
    3.11.766.877 I srv update: - prompt 0000029F0C14B3A0: 12163 tokens, checkpoints: 1, 596.347 MiB
    3.11.766.879 I srv get_availabl: prompt cache update took 204.78 ms
    3.11.767.318 I slot launch_slot_: id 0 | task 1045 | processing task, is_child = 0
    3.11.767.333 I slot update_slots: id 0 | task 1045 | Checking checkpoint with [8996, 8996] against 2...
    3.11.767.336 W slot update_slots: id 0 | task 1045 | forcing full prompt re-processing due to lack of cache data (likely due to SWA or hybrid/recurrent memory, see https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055)
    3.11.767.340 W slot update_slots: id 0 | task 1045 | erased invalidated context checkpoint (pos_min = 8996, pos_max = 8996, n_tokens = 8997, n_swa = 0, pos_next = 0, size = 184.942 MiB)
    3.12.161.249 I slot create_check: id 0 | task 1045 | created context checkpoint 1 of 32 (pos_min = 361, pos_max = 361, n_tokens = 362, size = 151.047 MiB)
    3.15.050.013 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 4458, progress = 0.08, t = 3.28 s / 1358.04 tokens per second
    3.16.509.158 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 6506, progress = 0.12, t = 4.74 s / 1372.05 tokens per second
    3.18.007.190 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 8554, progress = 0.15, t = 6.24 s / 1370.87 tokens per second
    3.19.532.959 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 10602, progress = 0.19, t = 7.77 s / 1365.25 tokens per second
    3.21.088.746 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 12650, progress = 0.23, t = 9.32 s / 1357.09 tokens per second
    3.22.683.336 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 14698, progress = 0.26, t = 10.92 s / 1346.47 tokens per second
    3.24.307.549 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 16746, progress = 0.30, t = 12.54 s / 1335.39 tokens per second
    3.25.964.943 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 18794, progress = 0.34, t = 14.20 s / 1323.75 tokens per second
    3.27.650.395 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 20842, progress = 0.37, t = 15.88 s / 1312.22 tokens per second
    3.29.372.484 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 22890, progress = 0.41, t = 17.61 s / 1300.19 tokens per second
    3.31.133.380 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 24938, progress = 0.45, t = 19.37 s / 1287.72 tokens per second
    3.32.933.422 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 26986, progress = 0.48, t = 21.17 s / 1274.96 tokens per second
    3.34.766.091 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 29034, progress = 0.52, t = 23.00 s / 1262.42 tokens per second
    3.36.628.129 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 31082, progress = 0.56, t = 24.86 s / 1250.24 tokens per second
    3.38.523.583 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 33130, progress = 0.60, t = 26.76 s / 1238.22 tokens per second
    3.40.449.198 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 35178, progress = 0.63, t = 28.68 s / 1226.49 tokens per second
    3.42.421.302 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 37226, progress = 0.67, t = 30.65 s / 1214.39 tokens per second
    3.44.426.882 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 39274, progress = 0.71, t = 32.66 s / 1202.53 tokens per second
    3.46.471.948 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 41322, progress = 0.74, t = 34.70 s / 1190.68 tokens per second
    3.48.549.836 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 43370, progress = 0.78, t = 36.78 s / 1179.09 tokens per second
    3.50.662.193 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 45418, progress = 0.82, t = 38.89 s / 1167.71 tokens per second
    3.52.837.951 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 47466, progress = 0.85, t = 41.07 s / 1155.72 tokens per second
    3.55.019.000 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 49514, progress = 0.89, t = 43.25 s / 1144.79 tokens per second
    3.57.260.487 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 51562, progress = 0.93, t = 45.49 s / 1133.40 tokens per second
    3.59.525.014 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 53610, progress = 0.96, t = 47.76 s / 1122.54 tokens per second
    4.00.773.859 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 54644, progress = 0.98, t = 49.01 s / 1115.04 tokens per second
    4.00.916.683 I slot create_check: id 0 | task 1045 | created context checkpoint 2 of 32 (pos_min = 54643, pos_max = 54643, n_tokens = 54644, size = 364.122 MiB)
    4.02.074.532 I slot print_timing: id 0 | task 1045 | prompt processing, n_tokens = 55668, progress = 1.00, t = 50.31 s / 1106.56 tokens per second
    4.02.231.320 I slot create_check: id 0 | task 1045 | created context checkpoint 3 of 32 (pos_min = 55667, pos_max = 55667, n_tokens = 55668, size = 368.141 MiB)
    4.02.295.988 I begin: ngram_mod occupancy = 48153/4194304 (0.01)
    4.04.729.586 I slot print_timing: id 0 | task 1045 | n_decoded = 101, tg = 41.53 t/s
    4.07.759.011 I slot print_timing: id 0 | task 1045 | n_decoded = 264, tg = 48.34 t/s
    4.10.786.113 I slot print_timing: id 0 | task 1045 | n_decoded = 429, tg = 50.54 t/s
    4.13.814.218 I slot print_timing: id 0 | task 1045 | n_decoded = 567, tg = 49.23 t/s
    4.16.829.972 I slot print_timing: id 0 | task 1045 | n_decoded = 703, tg = 48.38 t/s
    4.19.845.676 I slot print_timing: id 0 | task 1045 | n_decoded = 865, tg = 49.29 t/s
    4.22.875.983 I slot print_timing: id 0 | task 1045 | n_decoded = 1008, tg = 48.98 t/s
    4.25.920.495 I slot print_timing: id 0 | task 1045 | n_decoded = 1167, tg = 49.40 t/s
    4.28.956.098 I slot print_timing: id 0 | task 1045 | n_decoded = 1326, tg = 49.74 t/s
    4.31.977.717 I slot print_timing: id 0 | task 1045 | n_decoded = 1475, tg = 49.70 t/s
    4.34.979.991 I slot print_timing: id 0 | task 1045 | n_decoded = 1619, tg = 49.54 t/s
    4.37.989.947 I slot print_timing: id 0 | task 1045 | n_decoded = 1741, tg = 48.78 t/s
    4.41.046.861 I slot print_timing: id 0 | task 1045 | n_decoded = 1864, tg = 48.10 t/s
    4.43.158.621 I slot print_timing: id 0 | task 1045 | prompt eval time = 50530.12 ms / 55672 tokens ( 0.91 ms per token, 1101.76 tokens per second)
    4.43.158.626 I slot print_timing: id 0 | task 1045 | eval time = 40860.81 ms / 1956 tokens ( 20.89 ms per token, 47.87 tokens per second)
    4.43.158.627 I slot print_timing: id 0 | task 1045 | total time = 91390.93 ms / 57628 tokens
    4.43.158.629 I slot print_timing: id 0 | task 1045 | graphs reused = 1683
    4.43.158.630 I slot print_timing: id 0 | task 1045 | draft acceptance = 0.63998 ( 1287 accepted / 2011 generated)
    4.43.158.671 I statistics ngram-mod: #calls(b,g,a) = 2 1706 2, #gen drafts = 2, #acc drafts = 2, #gen tokens = 10, #acc tokens = 6, dur(b,g,a) = 7.376, 3.912, 0.002 ms
    4.43.158.678 I statistics draft-mtp: #calls(b,g,a) = 2 1704 1704, #gen drafts = 1704, #acc drafts = 1393, #gen tokens = 5112, #acc tokens = 3364, dur(b,g,a) = 0.002, 12570.379, 3.195 ms
    4.43.160.706 I slot release: id 0 | task 1045 | stop processing: n_tokens = 57628, truncated = 0
    4.43.160.751 I srv update_slots: all slots are idle
    】

    输出Tokens速度:
    9ed8a6f4-0cee-474b-adb2-fbab913c4a5c-image.jpeg

    运行时显卡信息:
    6b05d352-6055-4012-ad97-445c19ccaf5c-image.jpeg

    LLM讨论区 nvidia rtx3080

  • 我最近对AI有点顿悟了,发现架构能力和判断能力是最重要的!
    J joker_chang

    大佬的感悟我是深有体会的,我本人因为工作需要有很多重复繁杂的工作,用AI写一些小工具是我个人最迫切的需求,同时,因为工作关系(金融单位),数据敏感,因此只能是自己本地搞。

    但是最大的好处是,不用担心AI搞出来的东西只有demo级别,本来我也就是给自己用的,demo级别够用了😄

    Mark专区

  • RTX 3090 24G 最佳 27B模型? 测试cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF
    J joker_chang

    @stxpnet 说:

    这时再跑一个简单的问答题,速率降到了53T/S

    我觉得这个速度在3090上是正常的。

    cfb0851a-4714-4153-8aed-5ae853d9628f-image.jpeg

    我用的模型和启动参数:

    unsloth\Qwen3.6-27B-MTP-GGUF\Qwen3.6-27B-unslothMTP-Q4_K_M.gguf

    --reasoning off ^
    --n-gpu-layers -1 ^
    --ctx-size 131072 ^
    --batch-size 4096^
    --ubatch-size 2048 ^
    --flash-attn on ^
    --cache-type-k q4_0 ^
    --cache-type-v q4_0 ^
    --spec-type draft-mtp ^
    --spec-draft-n-max 3 ^
    --spec-draft-n-min 1 ^
    --temp 0.7 ^
    --parallel 1 ^
    --kv-unified ^
    --mlock ^
    --jinja ^
    --threads 16 ^
    --threads-batch 16 ^
    --no-warmup
    

    华南金牌洋垃圾主板和CPU

    LLM讨论区 rtx3090

  • pro 6000 有什么好的购买渠道吗?什么价位合适?
    J joker_chang

    @Dalu-Fama 工作站版本600w?请问要配多大的电源?

    AI硬件 rtxpro6000

  • 装机翻车了,求救
    J joker_chang

    @applejuice 我是直接问的客服,沟通好了配置后,客服会发链改价再付款

    AI硬件
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组