reinforcement-learning
Dépôts open source suivis étiquetés reinforcement-learning, triés par étoiles.
- #151
ReSearch : Apprendre à raisonner avec la recherche pour les LLM via l'apprentissage par renforcement & ReCall : Apprendre à raisonner avec l'appel d'outils pour les LLM via l'apprentissage par renforcement.
★ 1 432+1Évolution des étoiles sur les 7 derniers jours - #152
Algorithmes concis et élégants écrits en Julia
★ 1 426+0Évolution des étoiles sur les 7 derniers jours - #153
Une liste organisée de ressources exceptionnelles sur l'apprentissage par renforcement basé sur des modèles (mise à jour continue).
★ 1 393+0Évolution des étoiles sur les 7 derniers jours - #154★ 1 385+2Évolution des étoiles sur les 7 derniers jours
- #155
Un chat robotique programmable et hautement manœuvrable pour l'éducation STEM et les services assistés par IA.
★ 1 372+1Évolution des étoiles sur les 7 derniers jours - #156★ 1 367+1Évolution des étoiles sur les 7 derniers jours
- #157
Apprentissage par renforcement profond pour la navigation de robots mobiles dans le simulateur ROS Gazebo. En utilisant le réseau de neurones TD3 (Twin Delayed Deep Deterministic Policy Gradient), un robot apprend à naviguer vers un point cible aléatoire dans un environnement simulé tout en évitant les obstacles.
★ 1 362+2Évolution des étoiles sur les 7 derniers jours - #158
Framework modulaire d'apprentissage par renforcement profond en PyTorch. Bibliothèque compagnon du livre "Foundations of Deep Reinforcement Learning".
★ 1 362+0Évolution des étoiles sur les 7 derniers jours - #159
Implémentation PyTorch de Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet, etc.
★ 1 359+1Évolution des étoiles sur les 7 derniers jours - #160
Un écosystème vivant où des agents IA accomplissent des tâches via des boucles de workflow, s'améliorent par exécution itérative, sont évalués par des agents mentors ou des humains, et transforment le travail accompli en expérience et données réutilisables pour optimiser les futurs agents.
★ 1 334+0Évolution des étoiles sur les 7 derniers jours - #161
Implémentations minimales de Deep Q Learning (DQN & DDQN) avec Keras
★ 1 329+1Évolution des étoiles sur les 7 derniers jours - #162
Format standard pour les jeux de données d'apprentissage par renforcement hors ligne, avec des jeux de données de référence populaires et des utilitaires associés.
★ 1 294+3Évolution des étoiles sur les 7 derniers jours - #163
Notes de lecture sur le Deep Learning et le Machine Learning
★ 1 270+0Évolution des étoiles sur les 7 derniers jours - #164
Une implémentation PPO simple et élégante, basée sur ma série Medium.
★ 1 269+1Évolution des étoiles sur les 7 derniers jours - #165
Recherche en apprentissage par renforcement (RL) sur appareils Android.
★ 1 240+0Évolution des étoiles sur les 7 derniers jours - #166
Génération d'ensembles de facteurs boursiers alpha (prédictifs) via l'apprentissage par renforcement
★ 1 213+8Évolution des étoiles sur les 7 derniers jours - #167
Entraînement d'un robot humanoïde à la locomotion par apprentissage par renforcement
★ 1 210+3Évolution des étoiles sur les 7 derniers jours - #168
Notes de cours, exercices pratiques avec solutions et vidéos en ligne pour le cours d'apprentissage par renforcement de l'Université de Paderborn
★ 1 192+1Évolution des étoiles sur les 7 derniers jours - #169★ 1 188+0Évolution des étoiles sur les 7 derniers jours
- #170
[ECCV 2026] MixGRPO : Libérer l'efficacité du GRPO basé sur les flux avec des ODE-SDE mixtes
★ 1 177+0Évolution des étoiles sur les 7 derniers jours - #171★ 1 155+7Évolution des étoiles sur les 7 derniers jours
- #172
Évaluation et reproduction de politiques de manipulation robotique en conditions réelles (ex: RT-1, RT-1-X, Octo) en simulation sous des configurations courantes (ex: Google Robot, WidowX+Bridge) (CoRL 2024)
★ 1 153+3Évolution des étoiles sur les 7 derniers jours - #173
JMLR : OmniSafe est un framework infrastructurel destiné à accélérer la recherche en SafeRL.
★ 1 150+1Évolution des étoiles sur les 7 derniers jours - #174
Bibliothèque de calcul évolutionnaire avancée construite directement sur PyTorch, créée par NNAISENSE.
★ 1 144+1Évolution des étoiles sur les 7 derniers jours - #175
École de formation à l'apprentissage par renforcement multi-agents évolutif pour la conduite autonome.
★ 1 134+0Évolution des étoiles sur les 7 derniers jours - #176
Apprenez à faire apprendre les machines pour ne plus avoir à lutter pour les programmer ; la liste ultime
★ 1 128+0Évolution des étoiles sur les 7 derniers jours - #177
Un simulateur de robot léger basé sur Python, conçu pour la navigation, le contrôle et l'apprentissage.
★ 1 125+6Évolution des étoiles sur les 7 derniers jours - #178
Plongements de compétences adverses pour l'entraînement de contrôleurs réutilisables destinés à des personnages simulés physiquement.
★ 1 119+1Évolution des étoiles sur les 7 derniers jours - #179★ 1 114+3Évolution des étoiles sur les 7 derniers jours
- #180
Nous présentons le jeu de données Audio Logical Reasoning (ALR), composé de 6 446 échantillons texte-audio annotés, spécifiquement conçus pour des tâches de raisonnement complexe. En nous appuyant sur cette ressource, nous proposons SoundMind, un algorithme d'apprentissage par renforcement (RL) basé sur des règles, conçu pour doter les modèles de langage audio (ALM) de capacités de raisonnement bimodal approfondies.
★ 1 113+0Évolution des étoiles sur les 7 derniers jours