rl
Dépôts open source suivis étiquetés rl, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de rl sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés rl.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Communauté chinoise Llama, regroupant en temps réel les dernières ressources d'apprentissage Llama, construisant le meilleur écosystème open source pour le grand modèle Llama en chinois, entièrement open source et commercialisable.
★ 14 740+1Évolution des étoiles sur les 7 derniers jours - #2★ 10 945+11Évolution des étoiles sur les 7 derniers jours
- #3
Dopamine est un framework de recherche pour le prototypage rapide d'algorithmes d'apprentissage par renforcement.
★ 10 901+4Évolution des étoiles sur les 7 derniers jours - #4
Agent Reinforcement Trainer : entraînez des agents multi-étapes pour des tâches réelles via GRPO. Offrez une formation en cours d'emploi à vos agents. Apprentissage par renforcement pour Qwen3.6, GPT-OSS, Llama et plus encore.
★ 10 679+57Évolution des étoiles sur les 7 derniers jours - #5★ 5 703+19Évolution des étoiles sur les 7 derniers jours
- #6
EasyR1 : un framework d'entraînement RL multimodal, efficace et évolutif, basé sur veRL.
★ 5 136+10Évolution des étoiles sur les 7 derniers jours - #7
Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.
★ 4 145+94Évolution des étoiles sur les 7 derniers jours - #8
agent-sandbox permet une gestion simplifiée de charges de travail isolées, avec état et singleton, idéal pour les runtimes d'agents IA et l'apprentissage par renforcement (RL).
★ 3 678+92Évolution des étoiles sur les 7 derniers jours - #9
Une implémentation de l'algorithme AlphaZero pour le Gomoku (également appelé Gobang ou Puissance 5).
★ 3 625+2Évolution des étoiles sur les 7 derniers jours - #10
Une bibliothèque PyTorch modulaire, axée sur les primitives et Python, pour l'apprentissage par renforcement.
★ 3 540+12Évolution des étoiles sur les 7 derniers jours - #11
Un framework d'entraînement pour les agents d'apprentissage par renforcement Stable Baselines3, incluant l'optimisation des hyperparamètres et des agents pré-entraînés.
★ 2 872+3Évolution des étoiles sur les 7 derniers jours - #12
Implémentation d'articles de recherche en 100 lignes de code.
★ 2 867+8Évolution des étoiles sur les 7 derniers jours - #13
MuZero
★ 2 863+4Évolution des étoiles sur les 7 derniers jours - #14
Une étude sur l'apprentissage par renforcement pour les grands modèles de raisonnement
★ 2 481+2Évolution des étoiles sur les 7 derniers jours - #15
Implémentation simplifiée de tous les algorithmes d'apprentissage par renforcement (RL).
★ 1 922+7Évolution des étoiles sur les 7 derniers jours - #16
Solution d'apprentissage par renforcement (RL) évolutive pour le raisonnement avancé des modèles de langage
★ 1 872+3Évolution des étoiles sur les 7 derniers jours - #17
[ICLR 2026] SimpleVLA-RL : Mise à l'échelle de l'entraînement VLA via l'apprentissage par renforcement.
★ 1 839+9Évolution des étoiles sur les 7 derniers jours - #18
Dernières avancées sur le raisonnement de type System-2.
★ 1 353+1Évolution des étoiles sur les 7 derniers jours - #19
Comprendre l'entraînement de type R1-Zero : une perspective critique
★ 1 274+1Évolution des étoiles sur les 7 derniers jours - #20
Cours systématique sur la construction de grands modèles de langage (LLM) couvrant l'ingénierie des données de pré-entraînement, Tokenizer, Transformer, MoE, programmation GPU (CUDA/Triton), entraînement distribué, lois d'échelle, optimisation de l'inférence et alignement (SFT/RLHF/GRPO), avec 6 exercices progressifs axés sur le code.
★ 1 260+22Évolution des étoiles sur les 7 derniers jours - #21
[NeurIPS 2025] TTRL : Apprentissage par renforcement en temps de test (Test-Time Reinforcement Learning).
★ 1 121+5Évolution des étoiles sur les 7 derniers jours - #22★ 1 111+3Évolution des étoiles sur les 7 derniers jours
- #23★ 1 080+8Évolution des étoiles sur les 7 derniers jours
- #24
La stack d'amélioration continue pour les agents. Nos données d'environnement et nos évaluations alimentent l'amélioration et la surveillance des agents.
★ 1 058+1Évolution des étoiles sur les 7 derniers jours - #25
Tensorlake est un runtime serverless pour les sandboxes et le déploiement d'applications d'agents en arrière-plan
★ 995+1Évolution des étoiles sur les 7 derniers jours - #26
Systèmes d'intelligence des risques natifs pour l'IA, OpenDeRisk : votre gestionnaire intelligent des risques applicatifs assure une protection complète et approfondie 24h/24 et 7j/7.
★ 968+3Évolution des étoiles sur les 7 derniers jours - #27
Bibliothèque Python pour l'apprentissage par renforcement.
★ 944+1Évolution des étoiles sur les 7 derniers jours - #28
AI-Compass guide la communauté à travers l'océan des technologies IA, offrant des parcours pour les débutants comme pour les développeurs avancés. Il vise à aider les développeurs à comprendre systématiquement les concepts fondamentaux, les technologies dominantes et les tendances de l'IA, tout en maîtrisant le passage de la théorie à la pratique.
★ 926+12Évolution des étoiles sur les 7 derniers jours - #29
Plateforme de robot humanoïde open source imprimée en 3D pour le sim-to-real et l'apprentissage par renforcement
★ 820+1Évolution des étoiles sur les 7 derniers jours - #30
MobileGym : une plateforme de simulation vérifiable et hautement parallèle pour la recherche sur les agents d'interface graphique mobile, simulateur Android hébergé dans le navigateur, évaluation vérifiable, entraînement RL en ligne évolutif.
★ 777+10Évolution des étoiles sur les 7 derniers jours