[ICLR2026] MLLM に対して R1 ライクな強化学習を効果的に活用する方法を探求した初の論文であり、コールドスタート初期化と強化学習トレーニングを活用して推論能力を引き出す推論型 MLLM「Vision-R1」を導入します。
このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。