Aller au contenu principal
buildradar
Se connecter

walkinglabs/hands-on-modern-rl

@walkinglabs

Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.

Étoiles
4 199
Bifurcations
303
Langage
Python
Licence
NOASSERTION
Dernier push
il y a 2 semaines
Pythonagentllmrlpytorchtutorialagentic-aireinforcement-learningagenticrlhfppoagentic-rlgrpodposftreinforcementllm-alignment

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.