@kaifan 可以试试qwen3.8-flash-next-fp8了。 对这个有些期待,虽然暂时这个3.8-27b还是相当香的。
-
两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。 -
买了俩条 7900XTX白金版 ,其他的配件希望各位大神推荐一下 ,完整上线我过来交作业!@yi-song 小风扇霸气! 哇哈哈哈。帅~
-
DSH感觉很有前途啊@terry 这个和你有同样的想法。 DSH是有了’后发的先天性优势‘
-
DSH感觉很有前途啊@terry 有不少这种二手倒爷,没啥刷子,拿着agent去改个skill就上去了。参差不齐。官方的插件的这个模式,应该志不在此。再等等吧。 梁请来了自己的老师。不知道会咋样发展。 期待。
-
两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。@applejuice 小黄鱼渠道。基本全新。不到8000,带保修。不香?~
-
两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。@张光璞 想多了。
-
两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。我把评测的信息发给他们, 过了不到2分钟,大牛给了我新的代码, 直接FP8下边128K的上下文。3条线也可以满128K的上下文了....
技术好,果然可以为所欲为.....
export VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 export VLLM_WORKER_MULTIPROC_METHOD=spawn export VLLM_OFFLOAD_WEIGHTS_BEFORE_QUANT=1 vllm serve \ --port 8000 \ --host 0.0.0.0 \ --gpu-memory-utilization 0.90 \ --max-num-batched-tokens 8192 \ --max-model-len 131072 \ --block-size 64 \ --dtype float16 \ --api-key "ww@lw" \ --model models/LLM/Qwen3.8-27B-Uncensored-FP8/ \ --served-model-name Qwen3.8-27B-FP8 \ --tensor-parallel-size 2 \ --quantization fp8 \ --enforce-eager \ --trust-remote-code \ --enable-prefix-caching \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen3 \ --limit-mm-per-prompt image=4,video=1 \ > vllm-qwen3.8-27b.log 2>&1 & -
两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。容易崩溃,现在调整一下。 我不知道是不是我限制了卡的功率问题?...费解中。
ZE_AFFINITY_MASK="1,2" vllm serve \ --port 8989 \ --host 0.0.0.0 \ --gpu-memory-utilization 0.95 \ --max-num-batched-tokens 8192 \ --max-model-len 81920 \ --block-size 64 \ --dtype float16 \ --model models/LLM/Qwen3.8-27B-Uncensored-FP8 \ --served-model-name Qwen3.8-27B-FP8 \ --tensor-parallel-size 2 \ --quantization fp8 \ --enforce-eager \ --trust-remote-code \ --enable-prefix-caching \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen3 \ --limit-mm-per-prompt image=4,video=1 -
DSH感觉很有前途啊它就是个毛坯房,但太火了,这刚几天,插件已经几千个了... 比前几个月的龙虾和爱马仕还火。
-
两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。昨天晚上用了两个复杂任务,去跑了整夜的任务。 上边的参数设置的还是有些保守 ,于是修改了参数:
增加上下文大小,调整预留显存比例,指定同时处理的图片的个数。这个模型我也不知道这算聪明还是傻,我发给它张图片,它直接调取了我的上下文然后发现我还有另一台带视频解析的模型,直接去调用了另一台机器做了图片OCR... 于是又调整了这个参数。
这个二货模型整的我哭笑不得~~~ZE_AFFINITY_MASK="1,2" vllm serve \ --port 8989 \ --host 0.0.0.0 \ --gpu-memory-utilization **0.95** \ --max-num-batched-tokens 8192 \ --max-model-len **98304** \ --block-size 64 \ --dtype float16 \ --model models/LLM/Qwen3.8-27B-Uncensored-FP8 \ --served-model-name Qwen3.8-27B-FP8 \ --tensor-parallel-size 2 \ --quantization fp8 \ --enforce-eager \ --trust-remote-code \ --enable-prefix-caching \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen3 \ **--limit-mm-per-prompt image=4,video=1** -
两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。@terry 我限制了频率。 因为是涡轮扇,还是声音不小的。虽然是原厂的卡,但还是听着不舒服,尤其是多卡的时候.....
-
請問這樣好嗎? 賣2張手上的5060TI 16G 換成1張R9700 32G单张32G会更好。 并不是1+1=2,好多时候。1+1=1.5甚至更少,尤其是在comfyui。
但是! 如果你想一张用来本地llm,一张用来comfyui,那两张更灵活。
再者: NV下边的comfyui加速的lora啥的会比AMD和INTEL要多很多,尤其是SG加速,帅的很。 好多官方也只出NV的加速方案。所以综合来说只有一个问题:你究竟想用它来做啥。
-
两张Intel B70 共64G显存 vllm 部署 QWEN3.8-27B FP8 的过程及数据。最近比较忙,一直没时间来去测试这个。 今天下午抽出时间来。想测试一下 qwen3.8-27B 的性能。 我看网上都是推荐 Q4/5/6/8 的精度的。 既然INTEL 的这个显存这么NB。 我又向他们里边人问了问,说是直接4卡部署吧,可我的其它两张卡还要用comfyui..... 于是: 两张卡来试试部署。直接部署 FP8吧。
过程:
- 操作系统: UBUNTU24.04
- intel 为 vllm 出了docker,这就简单多了,起码不用太多折腾了,代码:
docker pull intel/llm-scaler-vllm:0.21.0-b3.1- DOCKER 有15个G,为了更快和更稳.... 可以尝试用win下边的 docker desktop 加上科学上网然后拽下来之后再倒到ubuntu下边吧,因为WIN下边的科学上网貌似会稳定点? 还是我个人的感觉问题? win下边的 docker desktop 下载完之后,打个包到文件里,命令行:
docker save -o D:\llm-scaler-vllm-b3.1.tar intel/llm-scaler-vllm:0.21.0-b3.1-
下载大模型文件到相应地址,这个不多谈。
-
部署配置
ZE_AFFINITY_MASK="**1,2**" vllm serve \ --port 8989 \ --host 0.0.0.0 \ --gpu-memory-utilization 0.9 \ --max-num-batched-tokens 8192 \ --max-model-len **65536** \ --block-size 64 \ --dtype float16 \ --model models/LLM/Qwen3.8-27B-Uncensored-FP8 \ --served-model-name Qwen3.8-27B-FP8 \ --tensor-parallel-size 2 \ --quantization fp8 \ --enforce-eager \ --trust-remote-code \ --enable-prefix-caching \ --enable-auto-tool-choice \ **--tool-call-parser qwen3_coder \ --reasoning-parser qwen3**之后就直接起来了。
这里的标粗部分的解释:
1,2 这是说用哪张卡,是从0号开始,所以显示我用的第2、3张。
max-model-len 这个数值,如果弄的比较小,比如40K,那可能敏捷些,但用hermess 这些agent 的话,可能会‘拒绝服务’ 。综合试着,先这个64K吧,后续如果把图片反推/视频反推等功能用起来之后再加大到128K。- 下午一直在忙,同时进行着几个业务,既然只剩下电费钱了,索性放开吧:3台局域网内的电脑 每一台都开着 codex/opencode,其中两台还开着 hermess 和 workbuddy ,全部都在跑着任务。我把这些全部都配置上局域网内的这个QWEN3.8-27B的API了,同时,我还用hermes 调用着 remotion 在调整视频。 下边是我从微信上让hermes 来返回的数据截图

调用着 remotion 的截图

我的机器的截图

另外!! 机器太吵了,为了降低噪音,我像老特一样,限制了频率只有80%。以上是8成的频率跑出来的数据。
说说使用感受: 比ds4flash 速度慢。 智商不够,但反应速度和智商我个人觉得完全满足了我本地调用的这些需求了。 如果要‘创造型’或者更深推理型的需求,那还是别难为自己, DSV4哪怕是PRO 也没几个钱的。 大家也看到了我部署的是什么模型,其实我只是想搞一个可以完全离线的本地可以肆无忌惮的模型测试一下而已。纯粹学术研究~~
另外就是.... 最近听说有个可以离线运行的桌面陪伴女友.... 代码我好像有来着。不知道本地运行咋样....
-
OxAlpha是GLM5.3?实测编程很强,强于Qwen 27B和DeepSeek V4 Flash,不如V4 Pro! 1M上下文翻车,召回准确率不够!@terry 准备用INTEL 的B70部署 3.8-27B,我想试试单卡部署的性能。到时候写教程贴出来。
H3 在B70上用着还是相当不错的,只是针对NV的加速的啥的没办法用上。
-
OxAlpha是GLM5.3?实测编程很强,强于Qwen 27B和DeepSeek V4 Flash,不如V4 Pro! 1M上下文翻车,召回准确率不够!小米的没用过。不清楚咋样。 这个OX现在吹的很厉害, 国内不少UP主之前就有了内测权限然后也有不少软文出来。
-
关于显卡的购买。@terry 你还少说了AMD和NV......

有意思吗? 擦~ 谁还不认识个一人半个人的.....
-
关于显卡的购买。@stxpnet 哇哈哈哈,就是这样,200多个企业,从利益的角度去考虑问题。 其它的几个有AI的关上了门。
-
关于显卡的购买。前天开始,NV/AMD甚至INTEL的显卡都开始疯狂涨价。
但我个人建议大家可以淡定一些。 纯粹个人建议。
因为我个人感觉,AI... 可能要崩掉了。 好多个点儿都很....诡异。
看几个点儿吧。 土耳其,亚马逊。
个人同意老特的那个观点--很快,就会有‘大船靠岸’。 个人也觉得,因为NV要推动产品更新,所以有些硬件,虽然很不爽,但ZZZ确的也必须去更新的。 原来我还以为国内的有些大厂会去批量购买这些卡,直到上次和字节的人沟通了一下才发现,低维护和损耗率以及稳定的可遇见性可控性才是他们所关注的。 所以,这些大厂是不会买这些大船货的。
只是随便聊聊。 个人建议,不够成参考。
PS. 和人沟通以后我才知道,现在全球才留内存颗粒/存储颗粒(硬盘)最大的居然不是我认为的亚马逊和谷歌,而是字节跳动,而且字节跳动的购买量居然是后边几个的...总量加起来还要多.... 太NB了。
-
新手双卡r9700 ai pro交作业带的动和安全不一样概念, 目前,在PC这块,我还没见过不虚标的电源。
-
新手双卡r9700 ai pro交作业看干啥吧,做视频的话,可能内存少了点儿。试试呗。 墙裂建议电源加到2000.