walkinglabs/hands-on-modern-rl
@walkinglabsUn programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.
Étoiles
4 199
Bifurcations
303
Langage
Python
Licence
NOASSERTION
Dernier push
il y a 2 semaines
Intel associée (0)
Aucune intel associée pour le moment
Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.