@kos-or
哦,我的是r9700,没有试Q5以下的版本,Q5反正挺好用
-
我换回3.6 35B了 -
我换回3.6 35B了@benton-yi
哈哈Ornith加一,那天我还想我说这个玩意儿Qwen3.8都出来了,怎么还不更新?结果一上官网官网把1.5的版本刚刚推出来两个小时。
现在它是我的独力模型,其实日常的使用完全够了,不管是配合dsh还是Hermes。dsh的话体感会好一些,配了deepseek的API以后搜索能力会比较强。 -
双RTX5070TI在llama.cpp环境下运行Qwen3.8-27B的效果没有测试这一套的长输入,比如16/32/64K输入下的prefill速度么?相比单卡5070ti有提升吗?
-
7900XTX双卡跑VLLM跑 Qwen3.8 27b实录勇气可嘉!我在R9700上面折腾过,体验不太好,太慢了,可能vLLM对7900XTX的支持更好些吧。我当时折腾下来是PP速度大概是llamacpp的一半,TP直接个位数,几乎没法用

-
RTX 5070 Ti 16GB 跑 Qwen3.8-27B:16G 卡量化選擇、啟動配置與基準數據不要用iQ4的换iQ3系列的,32K的上下文只能聊天。接Agent完全不能用。
3.6时代我自己测试iQ3_xxs和iQ4没有可以感知的区别,但是上下文多很多。你看看吧。 -
准备装机@Tony-Wang
是啊,简直疯了。
AI这个破玩意,生产力没见得有啥质提升,倒是给物价催起来了!哎 -
deepseek-v4-pro 0813已经放出(更新artificialanalysis.ai跑分)欧洲衰落是因为欧洲人的劣根性,尤其意大利,殖民时代靠抢积累的原始资金,后来就躺着不动了。现在不能抢了,衰落是正常的,不衰落才不正常。
古罗马人可能很牛逼,但是当代意大利人就是垃圾。 -
准备装机@Tony-Wang
大容量的HDD更疯!我去年买的20T东芝企业盘,当时680澳元,现在已经到1700刀了。 -
R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下@alan.lgv60
对啊,这就对了,因为他本来pp也快,然后吐字也快,开思考模式以后效果稳很多的。 -
R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下但是不管怎么说,Ornith比原版的35B在这些场景下就是要强很多。
-
R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下@alan.lgv60
感觉你这有点儿为难本地模型了,就是之前特别火的那个简单的一个洗车问题,连头部模型基本也都翻车了。我感觉本地模型不是干这个活的料。我的使用场景主要是资料搜索研究加那个我homelab的运维,有十几个docker服务,挂了我的网站,开票和交付系统等等。在这样的场景下,27b和35b(Ornith Q5)几乎没有区别。
毕竟还是个小模型,能力边界就在那了。 -
如何用Hermes安裝在docker裏面仍然能操作我的docker服務器和NAS?这也算是个问题吗?
Docker本身相当于是一台电脑啊,直接用ssh登录宿主机就好了。你要在你的记忆或者其他地方告诉模型怎么做 -
【AI 视频生成工具】做了一个全本地的 AI 视频生成工具,想听听大家意见下一步怎么走睡不着,看了一下马航的那个。
这个太AI了,就是感觉挺空洞的,再加上配音也有点儿奇怪,也很很慢。这种没啥前途,YouTube现在封杀纯AI生成的内容。这种批量的应该没啥前途,还是需要人工介入,提升内容质量才行,这个工作流我也跑通了。第一阶段是千万的文生图,然后第二阶段才是图生视频,最后剪切到一起。流程跑通了,但是我感觉我还是会放弃,因为关键点根本就不再做出来,尤其在这个AI时代,要花心思在选题和分镜脚本上。内容质量永远是王道,你一键生成的,那别人也会一键划走。 -
【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s@terry
可惜只有AI的,没有日本的 -
R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下@andyfay
值得一试,这个东西不绑定特定模型,相当于大模型领域的Linux,这一点很好的。 -
【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s@terry
帮主开玩笑了, 不过我兼职是做摄影的. 这个头像是Qwen生图模型生成地
,正好我注册论坛那天有这个图片就用了 -
Strix Halo本地部署 DeepSeek V4 Flash — 環境、失效、可行與技術總結 -
请问这个视频中 Qwen3.6 35b a3b 25token/s 是个什么水平?@crazypeace
没什么卵用,在Windows系统下和Linux下只要是个8g以上的显卡就能跑到这个速度,因为这个时候的速tp度是PCIe限制死的。如果是麦克的话是被显存带宽限制死的。顶多就是能跑起来而已,但是跑不顺。
Agent时代输入普遍很大,而输出比较少。PP速度慢了,除了纯聊天的场景,你不会想用下去的。 -
R9700 本地模型「智力」实测:35B MoE vs 27B dense,顺便跟云 API 比了下@alan.lgv60
我不知道你这个测试里面的题目,尤其数学题目测的是什么内容,但是嗯数学这种需要言语逻辑推理的应该还是挺吃模型的底子的,本地小模型这个方面应该是没有办法弥补的,27b也没办法。
什么样的工具让他干什么样的活就可以了,没有必要强求。本地模型目前感觉用下来还是驱动agent是最有用的,真正考验知识和硬核能力的和云端模型还是没得比。V4flash在没有升级之前,感觉和本地的27b的使用体感智商方面是差的不太多的,但是知识还是有明显的区别。这次一升级以后,那已经跟本地模型,哪怕是27b已经没有可比性了。
个人感觉玩本地话,还是要搞清楚他的能力边界在哪里,不要有不切实际的期待就好。 -
【实测】7900xtx使用Qwen3.6-35B-A3B速度稳定在80+t/s@nami-ryuu
哦,不是老师,我只是也是个普通玩家。
对,35b的大部分呃版本都有死循环的问题,尤其是上下文稍微长一点以后。你用的话就用Ornith原版的q5/q6的版本,因为我是有双开的需求,所以就用了Q5,你如果显存够放Q6的话,Q6的效果更好,接近无损。这个版本是唯一不会死循环的,当然也不绝对,极偶尔的情况下,我也碰到过几次,那就制止了再换一下提示词就行。