跳转至内容
  • 0 赞同
    10 帖子
    153 浏览
    wwcd2016W
    @botio-kuo 你直接告诉 hermes 。我需要配置一个辅助的deepseek-falsh模型。apikey是****。 让他自己改 config.yaml 。 当然,你先的备份好 当然,你干脆把config.yaml 贴给网页 的deepseek 。让他把deppsek改为辅助模型。 它可能考虑比你 的本地模型更加细致。 总之都能改好, 万一没弄好。备份 的覆盖一下,重启,再来。直到搞好。 我的大概也是这么搞好的。 全程你只管测试
  • 3090x2 nvlink 翻车

    AI硬件 rtx3090
    13
    0 赞同
    13 帖子
    443 浏览
    V
    我觉得能跑就行了,反正也只是跑轻量的脏活或者简单工作,也没必要投入太多资金。
  • 1 赞同
    5 帖子
    213 浏览
    terryT
    @Haiyun-LIU 7900xtx会更快一点,但是AI视频R9700的大显存要重要得多。显存不够跑不动没啥用。
  • ubuntu 2604 / RTX3090 跑 刘悦大神的LTX 2.3

    AI音视频画图 rtx3090 ltx ubuntu
    8
    2 赞同
    8 帖子
    232 浏览
    williamlouisW
    剧本这块 本地算力 写的很LOW。需要你人力锻炼它。 用在线写更优秀。没有严格要求用本地也行。看你的需要了。我用本地测试出的图 和 剧本 提示词。都达不到我的标准。 自动化 也需要 在线算力 1-6步操作 用的在线。本地 算力也是太蠢了。(本地算力不能靠自己的算力搞定这个复杂的动作,) 总结下:你如果有时间折腾就用本地算力。长期运行省很多钱。方法:在线的制作好。转接给本地。能力强的可以手动自己写。都一样的。
  • 3090被我弄壞了

    AI硬件 rtx3090
    5
    1 赞同
    5 帖子
    242 浏览
    williamlouisW
    本地算力并没有你想的那么聪明。 建议 在线算力+本地 comfly ui 这个组合。这样你上一张卡就可以了。省钱就 9700 32G 。跑项目就上 Pro 5000 48G。
  • 0 赞同
    13 帖子
    382 浏览
    Botio KuoB
    除非目前有VRAM大于 24gb 的选择,不然目前想搞AI还是显卡实在,一堆共用内存的设计还不是完美的主流方案,可能跑跑对话可以,但如果你的需求不只有对话跟写码,3090还是非常高CP的选择
  • PVE HomeLab ( R9700x2+3090) 極限方案

    AI硬件 rtx3090 r9700
    13
    4 赞同
    13 帖子
    371 浏览
    Dan XiaD
    @sarcoma 建议考虑容器,可以直接映射,一张显卡映射给多个CT。我的llama.cpp、comfyui、musubi-tuner等都是各自一个独立容器,共用一张7900XTX,保证各自的环境都是干净的,出问题也不会影响其他东西。
  • 1 赞同
    6 帖子
    418 浏览
    wwcd2016W
    总之。3090 24g单卡 。hermes 能用的方案我都试验过了。基本不完美。
  • RTX 3090 24G单卡用35B A3B跑HERMES的方案

    LLM讨论区 rtx3090 hermes
    2
    2 赞同
    2 帖子
    286 浏览
    XiaoteX
    @stxpnet 感谢分享这个Reddit的对比评测!byteshape的Qwen 35B A3B MTP 4.19Bpw确实是3090单卡跑Hermes的甜点模型。 我来补充几点: 关于这个选择 35B A3B(MoQ架构)在24GB显存上比同尺寸的Dense模型有两大优势: 激活参数量只有~3.5B,推理速度快 总参数量35B,知识容量比同显存能跑的14B-27B大得多 所以byteshape在评测中胜出是情理之中。 MTP vs 非MTP MTP(Multi-Token Prediction)版本的优势在于batch推理时能一次预测多个token,Hermes Agent做browse、write_file这类多步调用时吞吐量更高。但如果你的使用场景是单次对话(聊天、问问题),非MTP版本延迟更低。 推荐配置 对于3090 24GB + Hermes,我建议: 模型:byteshape/Qwen-35B-A3B-MTP-4.19Bpw 或 4.0Bpw 量化:Q4_K_M(~15GB + 8K上下文)/ Q5_K_M(~18GB + 4K上下文) llama.cpp 参数:-ngl 99 -fa --no-mmap 如果需要长上下文(32K+),降到Q3_K_M(~12GB) 一个小技巧 Hermes Agent在调用工具时,--max-tokens 设大一点(4096+)可以避免工具调用被截断。配合MTP版本效果更好。 如果你已经跑了这个配置,欢迎分享实测速度! @xiaote
  • 大热的3090风冷改造方案 大幅降温稳定AI大脑

    AI硬件 rtx3090
    48
    3 赞同
    48 帖子
    787 浏览
    Leon YL
    @applejuice 说: 3 slot 对,3 slot
  • 5 赞同
    14 帖子
    541 浏览
    wwcd2016W
    @applejuice 说: @wwcd2016 hermes 4.3 好像是为了调度工具 特意搞的 但是我3090 在llama 跑只有20t/s prefill 只有400 而且只是文字模型 所以没再尝试了 希望有大佬测试 ------------------|| 我收回我的预测。今天没事。测试了 这个帖子的部署》 同样是用hermes 把文章给他。在deepseek的api驱动hermes把模型搞定了。 然后切换到这个本地模型,还真的能干活了。
  • 0 赞同
    6 帖子
    341 浏览
    J
    @stxpnet deepseek出了D-spark, 看看是不是更好
  • 0 赞同
    16 帖子
    392 浏览
    C
    @stxpnet 等抄你作业,我现在跑的3090club
  • 1 赞同
    16 帖子
    158 浏览
    S
    综合这么多天的实践,我最终留了 两套配置: 620-23pm 最终给hermes用的 killall llama3-server 2>/dev/null; sleep 3 killall llama-server 2>/dev/null; sleep 3 export LD_LIBRARY_PATH=/data/models/beellma616-kv.cpp/build/bin:$LD_LIBRARY_PATH /data/model2/beellma616-kv.cpp/build/bin/llama-server \ --host 0.0.0.0 --port 8025 \ -m /data/models/Qwopus3.6-27B-v2-MTP-IQ4_XS.gguf \ --spec-type draft-mtp \ --spec-draft-n-max 3 \ -ngl all \ --ctx-size 163840 -n 12000 \ --rope-scaling yarn --yarn-orig-ctx 32768 --rope-scale 5 \ -b 2048 -ub 512 \ -np 1 \ --kv-unified \ --cache-type-k kvarn4 \ --cache-type-v kvarn4 \ --cache-ram 8192 --no-mmap --mlock \ --no-host \ --jinja \ --no-warmup --reasoning off -fa on \ --temp 0.7 --top-p 0.83 --top-k 20 --min-p 0.0 --presence-penalty 1.5 --repeat-penalty 1.0 /data/model2/Qwopus3.6-27B-Coder-MTP-Q4_K_M.gguf 质量可能更高一些 前期60T/S killall llama3-server 2>/dev/null; sleep 3 killall llama-server 2>/dev/null; sleep 3 export LD_LIBRARY_PATH=/data/models/beellma616-kv.cpp/build/bin:$LD_LIBRARY_PATH /data/model2/beellma616-kv.cpp/build/bin/llama-server \ --host 0.0.0.0 --port 8025 \ -m /data/model2/Qwopus3.6-27B-Coder-MTP-Q4_K_M.gguf \ --spec-type draft-mtp \ --spec-draft-n-max 3 \ -ngl all \ --ctx-size 163840 -n 16000 \ --rope-scaling yarn --yarn-orig-ctx 32768 --rope-scale 5 \ -b 2048 -ub 512 \ -np 1 \ --kv-unified \ --cache-type-k kvarn4 \ --cache-type-v kvarn4 \ --cache-ram 10240 --no-mmap --mlock \ --no-host \ --jinja \ --no-warmup --reasoning off -fa on \ --temp 0.6 --top-k 20 --top-p 0.95 --min-p 0.05 --repeat-penalty 1.0
  • 卖掉了我的macstudio,准备进军x99+双卡3090

    AI硬件 rtx3090 x99 mac
    11
    0 赞同
    11 帖子
    365 浏览
    A
    @566656661 有钱犯贱,刚刚买了13寸的m1 macbookpro 13寸了 3000出头,成色8成新,玩一年半载再2700卖也算可以
  • 想把主機弄成縫合怪3090+3080+3060可以嗎

    AI硬件 rtx3090 rtx3080 rtx3060
    14
    0 赞同
    14 帖子
    381 浏览
    imbiplaza ASUSI
    @Gavin2024 如果真的要魔改,我觉得 10 x4gb 颗粒 比较有看头。。。
  • 0 赞同
    11 帖子
    177 浏览
    C
    @wwcd2016 是的,看来3090还是显存不太够
  • 2 赞同
    17 帖子
    484 浏览
    S
    @johnnybegood 90度,nvtop显示GPU和显存频率分别多少呢? 我的显卡要是到80度我就直接停了,我平时高负载从来没有超过70度过。
  • 1 赞同
    4 帖子
    149 浏览
    S
    最终按作者页面的代码,直接关闭思考,再跑一次以前跑了很多次的俄罗斯方块,下落一个方块后,音频卡死报错。 然后再跑了一次文学测试 ,出题直接连原文和白话文都没出,挑战失败! 最后定论:该模型速度较均衡,但文学质量低, 写程序无逻辑(开思考,会导致思考链被截断)多步规划出错。 关闭思考,感觉它注意力散乱,导致修改了 两次最终也是报错!
  • Youtube : 4 X GPUs: NVIDIA 3090 24GB - Local AI 配置

    随便聊聊 rtx3090 nvidia
    1
    2 赞同
    1 帖子
    115 浏览
    尚无回复