Aller au contenu principal
buildradar
Sign in

Osilly/Vision-R1

@Osilly

[ICLR2026] Premier article explorant l'utilisation efficace de l'apprentissage par renforcement (RL) de type R1 pour les MLLM, introduisant Vision-R1, un MLLM de raisonnement utilisant l'initialisation à froid et l'entraînement par RL pour stimuler les capacités de raisonnement.

Étoiles
1 571
Bifurcations
27
Langage
Python
Licence
Dernier push
il y a 5 mois
Python

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.