结合deepseek,算是明白你们说的东西了,感谢各位答疑解惑!
lanyue yang 0
@lanyue yang 0
-
关于笔记本电脑(32G内存)+显卡扩展坞搭载3090(24G显存),运行Qwen3.8 27B Q4_K_M的一点问题 -
关于笔记本电脑(32G内存)+显卡扩展坞搭载3090(24G显存),运行Qwen3.8 27B Q4_K_M的一点问题请教各位大哥关于笔记本电脑(32G内存)+显卡扩展坞搭载3090(24G显存),运行Qwen3.8 27B Q4_K_M的一点问题。
本人折腾本地模型搭配Agent不久,最近这段时间才安上deepseek harness(以下简称DSH),并通过Ollama成功配上本地Qwen3.8 27B Q4_K_M模型,整体效果还是不错,但我用了几次后慢慢发型每轮会话的长度相较于我用DSH调用在线大模型的会话长度短了不是一星半点,经常开启一轮新会话让它做点小任务时第一轮会话就可能上下文占满,
甚至出现图中“已达到输出 token 上限回答被截断,已有输出保留在对话中。发送“继续”可让模型接着输出。”这种情况。
当然后续我通过咨询deepseek V4 flash将以上问题做了相应处理,稍有缓解,但我想问下像我这种硬件配置运行Qwen 27B这种级别的大模型这种情况是否属于正常现象?
那就意味着每轮会话即便再怎么压缩上下文,会话长度都很有限吧,那确实相较于之前用3090玩comfyUI生图的趣味性降低了不少啊
-
MiniMax H3 Director Cut Studio 教程(教程更新在第5楼)好货!好货!好货!好货!