跳转至内容
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组
皮肤
  • 浅色
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • 深色
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • 默认(不使用皮肤)
  • 不使用皮肤
折叠
品牌标识

抡锤者

AGIA

AGI

@AGI
技术大牛 劳动模范
取消关注 关注
关于
帖子
102
主题
1
分享
0
群组
2
粉丝
1
关注
0

帖子

最新 最佳 有争议的

  • 看目前這社區越來越多人買7900XTX了,大家為了一個爽度token無限發與反應速度,這幾天折騰的過程分享給大家(win11+vulkan & ubuntu +rocm)
    AGIA AGI

    @CHIA-AN-YANG

    /usr/local/bin/llama-server \
        -m ./models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \
        --mmproj ./models/mmproj-Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-f16.gguf \
        -c 131072 \
        --parallel 1 \
        -b 2048 \
        -ub 512 \
        -fa 1 \
        -ngl 99 \
        -t 16 \
        --spec-type draft-mtp \
        --cache-type-k q5_0 \
        --cache-type-v q4_1 \
        --no-mmap \
        --temp 0.4 \
        --spec-draft-n-max 3 \
        --top-p 0.95 \
        --top-k 20 \
        --host 0.0.0.0 \
        --port 8080 \
        --tools all
    
    root@ailab:~# llama-server --version
    version: 236 (d5376cf5d)
    built with GNU 13.3.0 for Linux x86_64
    

    856683c4-bd41-4a0a-8cdd-3785b06a5bec-image.jpeg

    LLM讨论区 7900xtx rocm ubuntu

  • 洋垃圾的回乡路 —— 2x3090 + X99 + 2x2680v4
    AGIA AGI

    折腾硬件很是麻烦。两年前买的Dell T5810,没有买华南散件,因为dell的质量的确很牛,二是因为放到家里当homelab的,不需要显卡。没想到两年后,显卡和电源成了制约因素。所以前几天买了蓝宝石7900xtx和1000w电源套装,电源专供显卡供电,还需要买一个同步启动器,拼多多10块钱,只能这样凑合着,想入第二块7900xtx,还放不下了,不想外置。
    机箱盖子无法正常盖好,也挺好,llm满载的时候,把盖子挪走,温度降低10度...

    d0c6a0e8b727829c66648fdf292a9fe0.jpeg
    68bcbaad0c6426dd144aa99c4687a95a.jpeg

    AI硬件 x99 rtx3090

  • 多一個ai agent可以用了,# 終極省錢秘笈:如何用 Gemini Advanced (Pro) $20/月訂閱,暢玩 Gemini Antigravity `agy` CLI 介面
    AGIA AGI

    这个claude模型,一个用的超了,所有claude模型都需要冷却!我去年白嫖了15个月pro,上个月月初让我续订,给我的价格是1.99美元一个月,能用一年,再送三个月。感觉不错,就续订了。

    但是gemini模型实在太拉!有急事用claude,但额度少的可怜。

    我订阅的有X 普通 premium ,现在用的最多的是grok cli,效果很好。

    AI Agent

  • 7900 XTX 单卡 llama.cpp MTP 优化小记:从 47 到 51 tok/s
    AGIA AGI

    @kop-wang 这个帖子质量很高!感谢

    @terry

    命令参数如下:

    llama-server \
        -m ./models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \
        --mmproj ./models/mmproj-Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-f16.gguf \
        -c 131072 \
        --parallel 1 \
        -b 2048 \
        -ub 512 \
        -fa 1 \
        -ngl 99 \
        -t 16 \
        --cache-type-k q5_0 \
        --cache-type-v q4_1 \
        --no-mmap \
        --temp 0.4 \
        --spec-draft-n-max 3 \
        --top-p 0.95 \
        --top-k 20 \
        --host 0.0.0.0 \
        --port 8080
    

    精度提高,默认显存占用降低,上下文提高到了128k,通过了https://lcz.me/post/4295 的测试,答案都正确,上下文还剩余不到点一半。

    甜点级别的参数了相当于,后续还会测试。

    截屏2026-06-17 19.03.19.png

    按照下面这个顺序测试:
    截屏2026-06-17 19.00.47.png

    @kop-wang 这个帖子质量很高!感谢

    @terry

    命令参数如下:

    llama-server \
        -m ./models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q5_K_P.gguf \
        --mmproj ./models/mmproj-Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-f16.gguf \
        -c 131072 \
        --parallel 1 \
        -b 2048 \
        -ub 512 \
        -fa 1 \
        -ngl 99 \
        -t 16 \
        --spec-type draft-mtp
        --cache-type-k q5_0 \
        --cache-type-v q4_1 \
        --no-mmap \
        --temp 0.4 \
        --top-p 0.95 \
        --top-k 20 \
        --host 0.0.0.0 \
        --port 8080
    

    精度提高,默认显存占用降低,上下文提高到了128k,通过了https://lcz.me/post/4295 的测试,答案都正确,上下文还剩余不到点一半。

    甜点级别的参数了相当于,后续还会测试。

    截屏2026-06-17 19.03.19.png

    按照下面这个顺序测试:
    截屏2026-06-17 19.00.47.png

    LLM讨论区 amd 7900xtx

  • 多一個ai agent可以用了,# 終極省錢秘笈:如何用 Gemini Advanced (Pro) $20/月訂閱,暢玩 Gemini Antigravity `agy` CLI 介面
    AGIA AGI

    @CHIA-AN-YANG 千万别这样用,违反谷歌TOS的。谷歌对反代api是0容忍,我的所有模型使用权限被谷歌封了半个月,后来超多的用户都抱怨,因为当时tos没有写,所以特赦了一批。后来再反代的,都直接封杀。

    AI Agent

  • Codex ChatGPT 5.5 (Medium) 被它驚艷到
    AGIA AGI

    @566656661 claude完全政治化了,希望国产模型能给力。我05年本科毕业的,专业CS,毕业论文是自己写一个操作系统OS从启动到进入16位模式,我当时对操作系统非常痴迷。阅读了毛德操老师的linux kernel 2.4内核的著作,受益匪浅,还有同济大学一位老师的linux kernel 0.01源码分析。物是人非,孩子明年都该高考了。现在从事完全不相干的工作,对AI仅仅是自己的爱好。98年我就开始用VB写程序了,感觉像是昨天。

    作者名字刚才写错了,然后翻了下书柜,居然还在

    2ZCMckewDomLfzYXxYP9PzYOAlQg5L1h.webp

    AI Agent codex gpt

  • Codex官方支持接入任何模型
    AGIA AGI

    https://x.com/i/status/2067181377028538431

    OpenAI也在逐渐的open

    资讯 codex

  • 请教大神,如何让Hermes可以群聊?
    AGIA AGI

    我理解的你说的他们互相沟通,就是两个的上下文,必须要给第三个,然后第三个的上下文必须能装得下,然后由第三个给出结论?我去年正价同时订阅了chatgpt和claude,用github上的项目这么做过,效果很好,相当于左右互搏。有两个repo你参考下,都是基于mcp协议的,但是都好久没有更新了:
    https://github.com/RaiAnsar/claude_code-multi-AI-MCP
    https://github.com/BeehiveInnovations/pal-mcp-server
    应该有更好的,两个不同ai左右互搏,这种想法很好。

    AI Agent hermes

  • 看目前這社區越來越多人買7900XTX了,大家為了一個爽度token無限發與反應速度,這幾天折騰的過程分享給大家(win11+vulkan & ubuntu +rocm)
    AGIA AGI

    @CHIA-AN-YANG 说:

    Vulkan 版在 Linux 上 MTP 幾乎無效(GitHub issue #22842)

    有效果啊,接受率70%+

    LLM讨论区 7900xtx rocm ubuntu

  • 我这样的需求,有必要折腾本地7900XTX主机吗?
    AGIA AGI

    工作上没必要,个人喜欢的话,就上,折腾这是一种享受,

    LLM讨论区 7900xtx

  • 7900 XTX + Qwen3.6-27B:Ubuntu + ROCm / Vulkan / MTP 64/128/256K 全部實測整理
    AGIA AGI

    感谢测试,论坛里的组合几乎都测试了!我的卡6.1才能到,就按照你这个帖子来部署!我也打算部署双卡,可惜机箱放不下了……,外置不知道怎样

    LLM讨论区 7900xtx mtp rocm

  • 7900 XTX + Qwen3.6-27B:Ubuntu + ROCm / Vulkan / MTP 64/128/256K 全部實測整理
    AGIA AGI

    显卡刚到24小时,折腾起来了,根据这篇帖子,加上Gemini,参数如下:

    llama-server   -m /root/models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf   -c 65536   -b 2048   -ub 256   -fa 1   -ngl 99  
     -t 22   --cache-type-k q8_0   --cache-type-v q8_0   --spec-type draft-mtp   --spec-draft-n-max 2   --no-mmap   --tensor-split 0   --temp 1.0   --top-p 
    0.95   --top-k 20   --host 0.0.0.0   --port 8080
    

    webui显示token速度在60左右。

    又测试了几轮,不是很稳定速度,大概在46左右,足够快了感觉。

    LLM讨论区 7900xtx mtp rocm

  • RTX 2060 Super 8G 部署 Qwen3.6-35B-A3B 极限参数定稿报告
    AGIA AGI

    折腾劲很值得鼓励,但是意义不大!算是社区甜点了!值得有更大显存的继续折腾!这个社区精神就是折腾!

    LLM讨论区 rtx2060

  • 7900 XTX + Qwen3.6-27B:Ubuntu + ROCm / Vulkan / MTP 64/128/256K 全部實測整理
    AGIA AGI

    把--spec-draft-n-max 2修改为3以后,又测试了下:

    截屏2026-06-07 13.18.44.png

    128k n-max=3 d120000 Benchmark

    LLM Command

    llama-server \
      -m /root/models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf \
      --mmproj /root/models/mmproj-Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-f16.gguf \
      -c 131072 \
      --parallel 1 \
      -b 2048 \
      -ub 256 \
      -fa 1 \
      -ngl 99 \
      -t 22 \
      --cache-type-k q8_0 \
      --cache-type-v q4_0 \
      --spec-type draft-mtp \
      --spec-draft-n-max 3 \
      --no-mmap \
      --temp 1.0 \
      --top-p 0.95 \
      --top-k 20 \
      --host 0.0.0.0 \
      --port 8080
    

    Test Command

    uvx llama-benchy \
      --base-url "http://127.0.0.1:8080/v1" \
      --model "Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf" \
      --tokenizer "Qwen/Qwen3-32B" \
      --pp 2048 \
      --tg 480 \
      --depth 120000 \
      --runs 1 \
      --latency-mode generation \
      --skip-coherence \
      --concurrency 1 \
      --save-result /root/bench-results/qwen36-27b-llamacpp-amd-rx7900xtx-128k-nmax3-d120000.md \
      --format md
    

    Benchmark Result

    test t/s peak t/s ttfr est_ppt e2e_ttft
    pp2048 @ d120000 353.80 352493.90 ms 352253.89 ms 352493.90 ms
    tg480 @ d120000 35.26 48.00

    Server Timing

    prompt eval time = 351710.86 ms / 124629 tokens
    prompt speed     = 354.35 tokens/s
    
    eval time        = 13601.37 ms / 480 tokens
    generation speed = 35.29 tokens/s
    
    total time       = 365312.23 ms / 125109 tokens
    
    draft acceptance = 0.70961
    accepted/generated = 325 / 458
    
    truncated = 0
    

    写代码开始速度能上70+,稳定在50+,很满足了

    LLM讨论区 7900xtx mtp rocm

  • 7900 XTX + Qwen3.6-27B:Ubuntu + ROCm / Vulkan / MTP 64/128/256K 全部實測整理
    AGIA AGI

    @566656661 又测试了下128K上下文的,也是稳稳过:

      llama-server \
        -m /root/models/Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf \
        --mmproj /root/models/mmproj-Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-f16.gguf \
        -c 131072 \
        --parallel 1 \
        -b 2048 \
        -ub 256 \
        -fa 1 \
        -ngl 99 \
        -t 22 \
        --cache-type-k q8_0 \
        --cache-type-v q4_0 \
        --spec-type draft-mtp \
        --spec-draft-n-max 2 \
        --no-mmap \
        --tensor-split 0 \
        --temp 1.0 \
        --top-p 0.95 \
        --top-k 20 \
        --host 0.0.0.0 \
        --port 8080
    

    测试命令:

      uvx llama-benchy \
        --base-url "http://127.0.0.1:8080/v1" \
        --model "Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf" \
        --tokenizer "Qwen/Qwen3-32B" \
        --pp 2048 \
        --tg 480 \
        --depth 0 1000 5000 10000 20000 40000 60000 80000 100000 120000 \
        --runs 1 \
        --latency-mode generation \
        --skip-coherence \
        --concurrency 1 \
        --save-result /root/bench-results/qwen36-27b-llamacpp-amd-rx7900xtx-128k.md \
        --format md
    

    结果:

    model test t/s peak t/s ttfr (ms) est_ppt (ms) e2e_ttft (ms)
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf pp2048 680.59 ± 0.00 3338.06 ± 0.00 3098.77 ± 0.00 3338.06 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf tg480 54.05 ± 0.00 64.00 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf pp2048 @ d1000 653.98 ± 0.00 5002.45 ± 0.00 4763.16 ± 0.00 5002.45 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf tg480 @ d1000 56.33 ± 0.00 69.00 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf pp2048 @ d5000 651.71 ± 0.00 11268.68 ± 0.00 11029.39 ± 0.00 11268.68 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf tg480 @ d5000 54.48 ± 0.00 66.00 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf pp2048 @ d10000 640.50 ± 0.00 19474.35 ± 0.00 19235.06 ± 0.00 19474.35 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf tg480 @ d10000 43.98 ± 0.00 65.00 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf pp2048 @ d20000 603.14 ± 0.00 37515.97 ± 0.00 37276.68 ± 0.00 37515.97 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf tg480 @ d20000 50.28 ± 0.00 61.00 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf pp2048 @ d40000 531.14 ± 0.00 80935.83 ± 0.00 80696.54 ± 0.00 80935.83 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf tg480 @ d40000 48.03 ± 0.00 56.00 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf pp2048 @ d60000 471.59 ± 0.00 134568.39 ± 0.00 134329.10 ± 0.00 134568.39 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf tg480 @ d60000 43.79 ± 0.00 54.00 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf pp2048 @ d80000 423.74 ± 0.00 197853.56 ± 0.00 197614.27 ± 0.00 197853.56 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf tg480 @ d80000 37.63 ± 0.00 46.00 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf pp2048 @ d100000 384.01 ± 0.00 271566.90 ± 0.00 271327.61 ± 0.00 271566.90 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf tg480 @ d100000 32.81 ± 0.00 42.00 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf pp2048 @ d120000 351.21 ± 0.00 355123.65 ± 0.00 354884.35 ± 0.00 355123.65 ± 0.00
    Qwen3.6-27B-Uncensored-HauhauCS-Balanced-MTP-Q4_K_P.gguf tg480 @ d120000 32.44 ± 0.00 39.00 ± 0.00
    LLM讨论区 7900xtx mtp rocm

  • AI生成了一个LLM GPU显存计算器
    AGIA AGI

    Key和value可以用不同的量化,这个可以优化下,我key一般8bit, value用4bit

    LLM讨论区

  • 🚀 Lucebox DFlash + Huihui:7900 XTX 上真·无审查 + 极速推理完全折腾纪实
    AGIA AGI

    @kos-or 搜索下grok2api,我就这么用的,网上有人分享sso,我导入了几百个,能用,但是不稳定,我就是推动hermes的,和deepseek flash轮流使用

    LLM讨论区 7900xtx dflash

  • 用於電商搭建自運營的模型選擇qwen3.6 27b 用Q4還是Q8合適
    AGIA AGI

    看你硬件,q4相比q8有些许差距,幻觉会多一些,q6是甜品级别的,不行就上q5,看你硬件。lm studio和llama.cpp差距较大,用llama.cpp吧,论坛很多帖子。

    你要说你的硬件,你的参数

    LLM讨论区

  • 看目前這社區越來越多人買7900XTX了,大家為了一個爽度token無限發與反應速度,這幾天折騰的過程分享給大家(win11+vulkan & ubuntu +rocm)
    AGIA AGI

    @terry 你的性格也太直了,看Ytb能感觉出来,但是既然大家都来了,感觉可以允许有不同意见,这个ui丑,又不是你的过错,解释清楚就可以了。

    LLM讨论区 7900xtx rocm ubuntu

  • 各位大神你們用的系統是ubuntu server還是desktop版呢?
    AGIA AGI

    Server版本的,家里软路由,能省资源就省。

    LLM讨论区 ubuntu
  • 登录

  • 没有帐号? 注册

  • 登录或注册以进行搜索。
  • 第一个帖子
    最后一个帖子
0
  • 版块
  • 最新
  • 标签
  • 热门
  • 用户
  • 群组