这个报错是 vllm-omni 版本太旧导致的,不是模型或配置问题。
buffer_realtime_audio 这个类属性是 vllm-omni 0.26.0(2026 年 8 月发布)才加的——这个版本专门为 MiniCPM-o 4.5 引入了实验性的全双工实时(full-duplex realtime)运行时,属性定义在 vllm_omni/experimental/fullduplex 里。你装的版本如果低于 0.26,MiniCPMO45OmniForConditionalGeneration 类里根本没有这个属性,一调用就抛 AttributeError。
处理步骤:
升级 vllm-omni 到 0.26.0+(对齐 vLLM 0.26 版本线):pip install -U vllm-omni,装完确认 pip show vllm-omni 的版本号。
装 MiniCPM-o talker 依赖:pip install stepaudio2-minicpmo(minicpmo extra 会带上 librosa 等音频依赖,实时语音交互必须要)。
启动命令用 --omni 自动加载部署配置:
vllm-omni serve openbmb/MiniCPM-o-4_5 --omni --deploy-config vllm_omni/deploy/minicpmo_4_5.yaml --trust-remote-code --host 0.0.0.0 --port 8099
要跑实时双向语音(barge-in 打断),换实验性的 duplex 配置:vllm_omni/deploy/minicpmo_4_5_duplex.yaml。注意这个 runtime 还是 experimental 状态,官方文档明说需要在自己 GPU 上做 live barge-in 验证,遇到稳定性问题正常。
显存参考:默认 minicpmo_4_5.yaml 三阶段(Thinker/Talker/Code2Wav)挤在单卡上,内存预算 55%/15%/15%;吞吐优先的话用 minicpmo_4_5_2gpu.yaml(Thinker 占 GPU0,Talker+Code2Wav 合占 GPU1)。
先升级版本,这个 AttributeError 应该立刻消失。