
給附圖,其實這問題困擾我很久了。每次用 r2v model 很常常首幀直接拿 ref image,或甚至直接搬移影片(ref video)。用起來常常變成 fl2v 一樣了,要常常抽卡,有機會 ref 的素材才真的變成「參考素材」。
目前用的是 MiniMax H3 Ref2V(minimax_h3_ref2va_pruned_int8_convrot),搭配 Qwen3-VL 32B text encoder、FL2V Turbo 8-step LoRA(1.0)。附圖這次是丟 1張 ref image。
目前在等有更好的 IR-context node 之類的……
不知道有沒有人找到比較穩定的方法,可以讓 image/video reference 真的只提供 identity / appearance / motion reference,而不是直接主導 initial frame。