ppo
Dépôts open source suivis étiquetés ppo, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de ppo sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés ppo.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Tutoriel d'apprentissage par renforcement en chinois (Livre Champignon 🍄), lecture en ligne : https://datawhalechina.github.io/easy-rl/
★ 14 592+28Évolution des étoiles sur les 7 derniers jours - #2★ 10 945+11Évolution des étoiles sur les 7 derniers jours
- #3
Implémentation haute qualité en fichier unique d'algorithmes d'apprentissage par renforcement profond avec des fonctionnalités adaptées à la recherche (PPO, DQN, C51, DDPG, TD3, SAC, PPG).
★ 10 339+36Évolution des étoiles sur les 7 derniers jours - #4
Tutoriels simples d'apprentissage par renforcement, enseignement de l'IA en chinois par MorvanPython
★ 9 510+7Évolution des étoiles sur les 7 derniers jours - #5
Dépôt pour le programme Nanodegree en Deep Reinforcement Learning
★ 5 176+0Évolution des étoiles sur les 7 derniers jours - #6★ 4 357+1Évolution des étoiles sur les 7 derniers jours
- #7
Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.
★ 4 145+94Évolution des étoiles sur les 7 derniers jours - #8
FinRL-X : Une infrastructure modulaire nativement IA pour le trading quantitatif.
★ 3 607+25Évolution des étoiles sur les 7 derniers jours - #9★ 3 449+2Évolution des étoiles sur les 7 derniers jours
- #10
Implémentation PyTorch propre, robuste et unifiée d'algorithmes populaires d'apprentissage par renforcement profond (DRL) (Q-learning, Duel DDQN, PER, C51, Noisy DQN, PPO, DDPG, TD3, SAC, ASL)
★ 3 437+4Évolution des étoiles sur les 7 derniers jours - #11
Implémentation minimale de l'algorithme PPO (Proximal Policy Optimization) avec objectif écrêté en PyTorch
★ 2 376+0Évolution des étoiles sur les 7 derniers jours - #12★ 2 088+2Évolution des étoiles sur les 7 derniers jours
- #13
Framework modulaire d'apprentissage par renforcement profond en PyTorch. Bibliothèque compagnon du livre "Foundations of Deep Reinforcement Learning".
★ 1 362-1Évolution des étoiles sur les 7 derniers jours - #14
Une implémentation PPO simple et élégante, basée sur ma série Medium.
★ 1 269+3Évolution des étoiles sur les 7 derniers jours - #15
Entraînement d'un robot humanoïde à la locomotion par apprentissage par renforcement
★ 1 209+1Évolution des étoiles sur les 7 derniers jours - #16★ 1 100+2Évolution des étoiles sur les 7 derniers jours
- #17
XuanCe : une bibliothèque d'apprentissage par renforcement profond complète et unifiée
★ 1 082+1Évolution des étoiles sur les 7 derniers jours - #18
Une bibliothèque avec des implémentations extensibles de DPO, KTO, PPO, ORPO et d'autres fonctions de perte centrées sur l'humain (HALO).
★ 910+0Évolution des étoiles sur les 7 derniers jours - #19
Fichiers de démarrage en RL pour entraîner, visualiser et évaluer immédiatement un agent sans écrire la moindre ligne de code
★ 728+1Évolution des étoiles sur les 7 derniers jours - #20
Ce dépôt contient la plupart des implémentations PyTorch des algorithmes classiques d'apprentissage par renforcement profond, notamment : DQN, DDQN, Dueling Network, DDPG, SAC, A2C, PPO, TRPO. (D'autres algorithmes sont en cours de développement)
★ 696+0Évolution des étoiles sur les 7 derniers jours - #21
🌾 OAT : un cadre de recherche convivial pour l'alignement en ligne des LLM, incluant l'apprentissage par renforcement, l'apprentissage des préférences, etc.
★ 670-1Évolution des étoiles sur les 7 derniers jours - #22
Une bibliothèque PyTorch pour la construction d'agents d'apprentissage profond par renforcement.
★ 657+1Évolution des étoiles sur les 7 derniers jours - #23
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent : RL open source pour les LLM et les scénarios d'agents
★ 627+1Évolution des étoiles sur les 7 derniers jours - #24
Fine-tuning simple et efficace de LLM (prise en charge de LLaMA, LLaMA2, LLaMA3, Qwen, Baichuan, GLM, Falcon). Entraînement et déploiement de quantification efficace pour grands modèles.
★ 621+0Évolution des étoiles sur les 7 derniers jours - #25
Une liste de documents sélectionnés sur l'apprentissage par renforcement pour la génération de vidéo
★ 591+2Évolution des étoiles sur les 7 derniers jours - #26
Apprentissage par renforcement profond (PPO) dans la conduite autonome (Carla) [depuis zéro]
★ 564+1Évolution des étoiles sur les 7 derniers jours