[ICLR2026] 这是第一篇探讨如何有效将类似 R1 的强化学习应用于 MLLM 的论文,并推出了 Vision-R1,这是一个利用冷启动初始化与强化学习训练来激发推理能力的推理型 MLLM。
radar 追踪的来源里还没有出现过这个 repo。收集器按计划运行——等它覆盖到这个 repo 再回来看看。