感谢分享,有可能的话可以测测长会话生成精度、质量如何,这个也很重要
-
2x3090 NVLink 王者配置再度进化——SGLang dev507 + DFLASH2 全面复测,并发 249 t/s 新高峰 -
京东自营上架二手3090,标价8699,近期有自建本地AI算力的玩家可以给东哥走个面,单卡或者双卡TP都很有CP值,比7900XTX新卡更好!@terry 是的,多卡的话主板+电源都得换,我用双3080跑双comfyUI工作流(miniMax-H3)还行的。
-
京东自营上架二手3090,标价8699,近期有自建本地AI算力的玩家可以给东哥走个面,单卡或者双卡TP都很有CP值,比7900XTX新卡更好!@johnnybegood 现在已经是双3080了,可惜主板不能插3张,不然倒想试试,现在即使4张3080也才一张4080S的价格。
-
DeepSeek Harness 開源 11 天爆 5 洞:AI 讀個網頁就被控,有人 API 額度被盜刷我的webSearch和webFetch之前都改成了自己的mcp(因为不知道收不收费,也不想在第三方留下记录),歪打正着了
-
京东自营上架二手3090,标价8699,近期有自建本地AI算力的玩家可以给东哥走个面,单卡或者双卡TP都很有CP值,比7900XTX新卡更好!3090涨价以后3080的性价比进一步飙升了,80%的性能,40%的价格,多一个很好的选择。
-
DeepSeek Harness,能否跟微信和TL连接?企业微信可以,微信不怕封号也可以。
-
Qwen3.8-27B 关掉推理~效率快太多 成果差不多关掉推理,连一些基本的测试题都过不了的,稍微复杂点的工具调用也会出错。
-
【一个Agent两个大语言模型,一个学徒工,一个老师傅】@George-Suen 这样得情况AGNETS.md优化得好能提高成功率。
-
【一个Agent两个大语言模型,一个学徒工,一个老师傅】我觉得本地模型最大的短板是知识面不够,大局观不够。
所以只让agent在项目设计和遇到难题时才去与线上模型讨论,这样应该能省些上下文,并且要限制轮数。
还有个方案就是线上模型的回答不要直接喂给agent,因为线上模型经常长篇大论,中间可以加一个小模型总结摘要以后再喂给agent。
这两个也可以综合起来用。 -
4080S 32G 跑 Qwen3.8-27B:llama.cpp 优化全记录 + SGLang 探索踩坑感觉4080s没有比3080/3090强很多的样子呢
-
双 3090 NVLink 从vLLM 换到 SGLang 跑 Qwen3.8-27B:实测 108 t/s,262K 上下文全开精彩的分享
mamba-full-memory-ratio 官方默认为0.9,对于个人使用非常浪费显存。
最佳值需要根据mem-fraction-static和max-running-requests的值结合日志来看。
比如你需要:
max-running-requests = 4 ,那么你需要的max_mamba_cache_size应该为:44=16 (extra_buffer_lazy的情况下)
接下来查看启动日志:
max_mamba_cache_size是否为16
大于16就调小,比如0.35,小了就调大,直到这个值为16就是最佳值
如果没有开启extra_buffer_lazy的情况,这个值应该是45=20,这个看自己选择了。
另外
MTP+HiCache 目前确实性能冲突,推理速度腰斩是可能的。
只是开启HiCache的情况下,我的测试中推理速度影响为5%左右。
在内存配置为kv缓存1.5倍以上时,多会话能大幅减少prefill,减少首字吐字延迟。
如果配置了NVME,重启sglang可以完美命中之前会话的kv缓存。 -
原有一张3090,可以搭配一张2080ti 22g吗?玩qwen3.8 27b q4km@fafafa 建议不要隔代组多卡,可以用3080,同代兼容性会好很多,而且性能提高一级,2080已经快要被移除厂商兼容列表了。
-
4080s,32g魔改版与R9700价钱接近,怎么选,本地跑大模型魔改的如果没有可靠质保小心为上哦
-
试图通过小爱音箱和本地LLM通话 (未完成)用手机作为前端也是一个可行的方案
-
SGlang开启hicache L2/L3 kv缓存@terry 可以这么理解,多会话,多并发更顺畅了,prefill减少,效率变高,会话切换不用等。
-
SGlang开启hicache L2/L3 kv缓存SGlang开启hicache L2/L3 kv缓存
1. 开启hicache有什么用?
显存里的 KV Cache 放不下,就把暂时不用的 KV Cache“搬到内存/磁盘”,需要时再取回来,从而让超长上下文、多个会话能够复用之前算过的 KV,而不必重新 Prefill。
你可以把它理解成 “显存 → 内存 → 磁盘”的 KV Cache 多级缓存。
L1 -> VRAM
L2 -> RAM
L3 -> NVME2.如何开启
-
开启RAM缓存
--enable-hierarchical-cache --hicache-size 32 -
开启NVME缓存
--hicache-storage-backend file
3. 测试
-
缓存启用成功

-
重启sglang,开启对话,之前会话的190K上下文直接加载,不用prefill

-
-
DeepSeek Harness会成为第一Agent?全面盘点Codex、Hermes、OpenClaw、OpenCode、Trae等.用了以后,觉得DSH确实牛B,而且刚发布没多久,插件也挺丰富了,想到的基本都有。
-
加3080 20G 还是 7900XTX 24G?@zhenyu-huang 1000W ,功率限制到75%,不会亏,当然不限也够用。
-
加3080 20G 还是 7900XTX 24G?我的是双3080 20G pcie4.0 8+8,说说感受给你参考:
1、这套跑llama.cpp\vllm\sglang目前都没问题,4bit量化,单并发推理50+t/s,加MTP,80t/s左右,prefill在1200上下。
2、用Qwen-image\minMax H3 生图和生视频都可以,分开用,跑两个comfyUI工作流进程,有效率。
说说缺点,prefill慢,散热需要到位。
没用过7900XTX,不好评论。
如果后面升级,我应该会考虑双4080 32G或4090 48G,提升才大。 -
双3090,哪个qwen 3.8 模型才是最好的呢?