Osilly/Vision-R1
@Osilly[ICLR2026] Premier article explorant l'utilisation efficace de l'apprentissage par renforcement (RL) de type R1 pour les MLLM, introduisant Vision-R1, un MLLM de raisonnement utilisant l'initialisation à froid et l'entraînement par RL pour stimuler les capacités de raisonnement.
Étoiles
1 571
Bifurcations
27
Langage
Python
Licence
—
Dernier push
il y a 5 mois
Intel associée (0)
Aucune intel associée pour le moment
Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.