谢谢评测,非常详尽!
请问 RTX 5060 Ti 16GB 这个卡可以期待 NVFP4 (Blackwell 專用) 版吗?
C
coolstar
@coolstar
-
RTX 5070 Ti 16GB 跑 Qwen3.8-27B:16G 卡量化選擇、啟動配置與基準數據 -
Kimi K3编程,SVG绘图,Agent能力实测,能力不错,但成本较高,过度思考,风格很像Claude,能够做到国产平替,但是不如Deepseek等有性价比!@terry 嗯,就像奢侈品,质量、用途也完全配不上其价格。
-
Kimi K3编程,SVG绘图,Agent能力实测,能力不错,但成本较高,过度思考,风格很像Claude,能够做到国产平替,但是不如Deepseek等有性价比!同意老特的观点, 不过kimi顶多算个高仿。
-
12G 及以下显存的朋友可以试试这个,号称Qwen3.6-35B-A3B专家模型 在4g 显存能跑19t/s -
12G 及以下显存的朋友可以试试这个,号称Qwen3.6-35B-A3B专家模型 在4g 显存能跑19t/s我在12g 显存上实测 256k上下文 + mmproj 能到40t/s,干点普通活感觉可以用了。
原帖:
https://www.reddit.com/r/LocalLLM/comments/1unmzqc/surprisingly_fast_qwen3635ba3b_on_a_4_gb_vram/
他的脚本参数:
/opt/llama.cpp/build/bin/llama-server \ -m /opt/llama.cpp/models/Qwen3.6-35B-A3B-UDT-Q4_K_XL_MTP.gguf \ --host 0.0.0.0 \ --port 8080 \ -c 64000 \ -ngl 999 \ --override-tensor "blk\..*\.ffn_(gate_up|gate|up|down)_exps\.weight=CPU" --flash-attn on \ --cache-type-k q8_0 \ --cache-type-v q8_0 \ --mlock \ -b 3072 \ --ubatch-size 3072 \ -ctxcp 128 \ --reasoning off \ --parallel 1 \ -t 6 \ -tb 12 \ --cache-ram 16384 \ --swa-full \ --no-kv-unified \ --spec-type none \ --cache-reuse 256 \ -
关于 Hermes 干活的, 严!重!警!告!!!一直弄不太清楚Agent和它挂接的LLM,哪个在这种事情上的责任多一些。
我用Opencode挂DeepSeek, 似乎也觉得它挺放飞自我的,其他模型感觉好些,不知道是不是心理作用。