跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

暧

暧昧光影

@暧昧光影
取消关注 关注
关于
帖子
18
主题
2
分享
0
群组
0
粉丝
0
关注
0

帖子

最新 最佳 有争议的

  • 120 tok/s Gemma 4 12B + MTP RTX-4070S 12GB
    暧 暧昧光影

    @stxpnet 直接让hermes帮我做的测试

    LLM讨论区 mtp

  • 120 tok/s Gemma 4 12B + MTP RTX-4070S 12GB
    暧 暧昧光影

    ✅ Gemma4 12B 能力测试报告

    环境: RTX 3060 (12GB) | 128K ctx | Q4_0 KV Cache | MTP n_max=2 | ~10.3GB VRAM
    
    | #   | 测试项     | 结果 | 速度       | 关键表现                    |
    |-----|------------|------|------------|-----------------------------|
    | 1   | 逻辑推理   | ✅   | 50.9 tok/s | 正确识别三段论有效性        |
    | 2   | 数学应用题 | ✅   | 53.8 tok/s | 分步计算,得出正确结论      |
    | 3   | 多轮对话   | ✅   | 49.6 tok/s | 准确记住 Alice 的名字和爱好 |
    | 4   | 长程检索   | ✅   | 29.9 tok/s | 在大量重复文本中找到答案    |
    | 5   | 代码生成   | ✅   | 52.1 tok/s | 生成 Python 回文算法        |
    | 6   | 文本摘要   | ✅   | 38.3 tok/s | 一句话准确概括              |
    | 7   | 创意写作   | ✅   | 35.9 tok/s | 写出有氛围感的微型故事      |
    
    
    
    📊 性能亮点
    
    - 128K 上下文完全可用 — 长文检索准确命中
    - 生成速度 ~35-53 tok/s — 比纯 CPU 快很多
    - 显存占用 ~10.3GB — 12GB 卡有安全余量
    - MTP 接受率正常 —  speculative decoding 工作稳定
    
    结论: Gemma4 12B 在 3060 + 128K ctx 配置下,综合能力均衡,推理、代码、长文检索均表现良好,日常使用完全没问题。
    

    速度差异好大

    LLM讨论区 mtp

  • 3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑
    暧 暧昧光影

    @comeN 现在就是保持200K上下文
    comfyui还要花时间折腾,3090ti跑模型,3060跑comfyui,跑通之后再考虑换显卡

    LLM讨论区 rtx3090 mtp

  • 3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑
    暧 暧昧光影

    @applejuice 我是双卡配置,只用单独3090ti跑llama.cpp,turbo4之后上下文最多到200k,256不行。vllm问了ai肯定不行,128k都够呛。
    如果不加多模态投影,省点显存的话,回头试试是否可以256k拉满

    LLM讨论区 rtx3090 mtp

  • 3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑
    暧 暧昧光影

    @Xiaote turbo4上下文能拉到200k,256k会oom

    LLM讨论区 rtx3090 mtp

  • 3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑
    暧 暧昧光影

    我是双显卡CUDA_VISIBLE_DEVICES=0指定运行在3090ti,另外有个问题ubuntu2404,cuda12.8,驱动是580版本。cuda0对应nvidia-smi里面的GPU1,cuda1反而是gpu0。不知道是个什么原因,问ai也解决不了。。。。@terry

    LLM讨论区 rtx3090 mtp

  • 3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑
    暧 暧昧光影

    启动参数,200K上下文,就是没办法拉满,有大神指导一下吗
    MODEL="/home/stephen/models/qwen3.6-27b-mtp/Qwen3.6-27B-Q4_K_M.gguf"
    MMR="/home/stephen/models/qwen3.6-27b-mtp/mmproj-BF16.gguf"
    LLAMA_SERVER="${LLAMA_SERVER:-/home/stephen/llama.cpp-turbo/build/bin/llama-server}"

    if [ ! -f "$LLAMA_SERVER" ]; then
    echo "ERROR: llama-server not found at $LLAMA_SERVER"
    exit 1
    fi

    CUDA_VISIBLE_DEVICES=0 "$LLAMA_SERVER"
    -m "$MODEL"
    --mmproj "$MMR"
    --spec-type draft-mtp
    --spec-draft-n-max 2
    --spec-draft-p-min 0.75
    --parallel 1
    --host 127.0.0.1
    --port 8080
    --ctx-size 200704
    --n-gpu-layers 99
    --cache-type-k turbo4
    --cache-type-v turbo4
    --flash-attn on
    --no-mmap
    --reasoning off
    --jinja
    "$@"

    LLM讨论区 rtx3090 mtp

  • 来交作业了,华南金牌X99套装+RTX3090Ti+RTX3060双卡装机完毕
    暧 暧昧光影

    @terry 老特你的视频我最近都没空看了,今天又收了一套48*2的内存,空了直接把部署到位。最近也在看什么场景能够变现

    AI硬件 nvidia 多卡部署

  • 来交作业了,华南金牌X99套装+RTX3090Ti+RTX3060双卡装机完毕
    暧 暧昧光影

    我也是3090ti+3060,目前只能周末折腾 目前只能单卡3090ti跑27B+80K上下文,还没空装Ubuntu,期待你的表现

    AI硬件 nvidia 多卡部署

  • 3080 20g 購買問題
    暧 暧昧光影

    今天看到淘宝活动价有点心动了 3000不到,刚买了3090ti活动价 来了

    随便聊聊 rtx3080

  • 运营油管对IP有要求吗?
    暧 暧昧光影

    看样子想稳定运维,还是自己买VPS比较好

    自媒体

  • 买了2张5060Ti,谁能跑最便宜的Qwen 27B?
    暧 暧昧光影

    @Vivid-Vector 3090ti有参数么?

    AI硬件

  • 油管频道起号
    暧 暧昧光影

    纯小白
    老特你啥时候讲油管赚钱的经验

    自媒体

  • 4080s 32g 涨价了
    暧 暧昧光影

    @咫尺天涯 老店我看了下4080 32G差不多12000,4080S要13400

    AI硬件 rtx4080s

  • 关于一堆3060显卡
    暧 暧昧光影

    @jenaflex 目前电竞这个板块我有了解到有运营商在卖算力,单个电竞酒店算力不太够可能。具体可以咨询更专业的人士。你的闲时显卡跑大模型是否有收益?

    随便聊聊 rtx3060

  • 请教:ASUS Ascent GX10
    暧 暧昧光影

    买nvdia的卡目前保值率还可以,后期不需要了也不会亏太多。GB10音视频输出没研究过,但是根据参数也知道不会太好。有条件的还是上5090或者PRO 6000.另外5090的主机要到不了5W。咸鱼上面的二手或者攒硬件大概4W不到可以弄一台9950x3D+64G+2T+5090的主机

    随便聊聊

  • 4080s 32g 涨价了
    暧 暧昧光影

    @Sam-Hsu 我先买3090ti了,跑通之后再考虑升级设备

    AI硬件 rtx4080s

  • 3090还是3090 *2+NVLink
    暧 暧昧光影

    看到up推荐3090,担心背面显存温度过高,加了点入了3090ti,up觉得怎么样@terry

    随便聊聊 rtx3090
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组