@stxpnet 直接让hermes帮我做的测试
暧昧光影
-
120 tok/s Gemma 4 12B + MTP RTX-4070S 12GB -
120 tok/s Gemma 4 12B + MTP RTX-4070S 12GB
Gemma4 12B 能力测试报告环境: RTX 3060 (12GB) | 128K ctx | Q4_0 KV Cache | MTP n_max=2 | ~10.3GB VRAM | # | 测试项 | 结果 | 速度 | 关键表现 | |-----|------------|------|------------|-----------------------------| | 1 | 逻辑推理 | ✅ | 50.9 tok/s | 正确识别三段论有效性 | | 2 | 数学应用题 | ✅ | 53.8 tok/s | 分步计算,得出正确结论 | | 3 | 多轮对话 | ✅ | 49.6 tok/s | 准确记住 Alice 的名字和爱好 | | 4 | 长程检索 | ✅ | 29.9 tok/s | 在大量重复文本中找到答案 | | 5 | 代码生成 | ✅ | 52.1 tok/s | 生成 Python 回文算法 | | 6 | 文本摘要 | ✅ | 38.3 tok/s | 一句话准确概括 | | 7 | 创意写作 | ✅ | 35.9 tok/s | 写出有氛围感的微型故事 | 📊 性能亮点 - 128K 上下文完全可用 — 长文检索准确命中 - 生成速度 ~35-53 tok/s — 比纯 CPU 快很多 - 显存占用 ~10.3GB — 12GB 卡有安全余量 - MTP 接受率正常 — speculative decoding 工作稳定 结论: Gemma4 12B 在 3060 + 128K ctx 配置下,综合能力均衡,推理、代码、长文检索均表现良好,日常使用完全没问题。速度差异好大
-
3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑@comeN 现在就是保持200K上下文
comfyui还要花时间折腾,3090ti跑模型,3060跑comfyui,跑通之后再考虑换显卡 -
3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑@applejuice 我是双卡配置,只用单独3090ti跑llama.cpp,turbo4之后上下文最多到200k,256不行。vllm问了ai肯定不行,128k都够呛。
如果不加多模态投影,省点显存的话,回头试试是否可以256k拉满 -
3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑@Xiaote turbo4上下文能拉到200k,256k会oom
-
3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑我是双显卡CUDA_VISIBLE_DEVICES=0指定运行在3090ti,另外有个问题ubuntu2404,cuda12.8,驱动是580版本。cuda0对应nvidia-smi里面的GPU1,cuda1反而是gpu0。不知道是个什么原因,问ai也解决不了。。。。@terry
-
3090ti部署qwen3.6-27B-MTP-q4_K-M的疑惑启动参数,200K上下文,就是没办法拉满,有大神指导一下吗
MODEL="/home/stephen/models/qwen3.6-27b-mtp/Qwen3.6-27B-Q4_K_M.gguf"
MMR="/home/stephen/models/qwen3.6-27b-mtp/mmproj-BF16.gguf"
LLAMA_SERVER="${LLAMA_SERVER:-/home/stephen/llama.cpp-turbo/build/bin/llama-server}"if [ ! -f "$LLAMA_SERVER" ]; then
echo "ERROR: llama-server not found at $LLAMA_SERVER"
exit 1
fiCUDA_VISIBLE_DEVICES=0 "$LLAMA_SERVER"
-m "$MODEL"
--mmproj "$MMR"
--spec-type draft-mtp
--spec-draft-n-max 2
--spec-draft-p-min 0.75
--parallel 1
--host 127.0.0.1
--port 8080
--ctx-size 200704
--n-gpu-layers 99
--cache-type-k turbo4
--cache-type-v turbo4
--flash-attn on
--no-mmap
--reasoning off
--jinja
"$@" -
来交作业了,华南金牌X99套装+RTX3090Ti+RTX3060双卡装机完毕@terry 老特你的视频我最近都没空看了,今天又收了一套48*2的内存,空了直接把部署到位。最近也在看什么场景能够变现
-
来交作业了,华南金牌X99套装+RTX3090Ti+RTX3060双卡装机完毕我也是3090ti+3060,目前只能周末折腾 目前只能单卡3090ti跑27B+80K上下文,还没空装Ubuntu,期待你的表现
-
3080 20g 購買問題今天看到淘宝活动价有点心动了 3000不到,刚买了3090ti活动价 来了
-
运营油管对IP有要求吗?看样子想稳定运维,还是自己买VPS比较好
-
买了2张5060Ti,谁能跑最便宜的Qwen 27B?@Vivid-Vector 3090ti有参数么?
-
油管频道起号纯小白
老特你啥时候讲油管赚钱的经验 -
4080s 32g 涨价了@咫尺天涯 老店我看了下4080 32G差不多12000,4080S要13400
-
关于一堆3060显卡@jenaflex 目前电竞这个板块我有了解到有运营商在卖算力,单个电竞酒店算力不太够可能。具体可以咨询更专业的人士。你的闲时显卡跑大模型是否有收益?
-
请教:ASUS Ascent GX10买nvdia的卡目前保值率还可以,后期不需要了也不会亏太多。GB10音视频输出没研究过,但是根据参数也知道不会太好。有条件的还是上5090或者PRO 6000.另外5090的主机要到不了5W。咸鱼上面的二手或者攒硬件大概4W不到可以弄一台9950x3D+64G+2T+5090的主机
-
4080s 32g 涨价了@Sam-Hsu 我先买3090ti了,跑通之后再考虑升级设备
-
3090还是3090 *2+NVLink看到up推荐3090,担心背面显存温度过高,加了点入了3090ti,up觉得怎么样@terry