Aller au contenu principal
buildradar
Sign in
Sujet · reinforcement-learning

reinforcement-learning

Dépôts open source suivis étiquetés reinforcement-learning, triés par étoiles.

304 dépôts
  • ReCall@Agent-RL

    ReSearch : Apprendre à raisonner avec la recherche pour les LLM via l'apprentissage par renforcement & ReCall : Apprendre à raisonner avec l'appel d'outils pour les LLM via l'apprentissage par renforcement.

    1 432+1Évolution des étoiles sur les 7 derniers jours
  • Algorithmes concis et élégants écrits en Julia

    1 426+0Évolution des étoiles sur les 7 derniers jours
  • Une liste organisée de ressources exceptionnelles sur l'apprentissage par renforcement basé sur des modèles (mise à jour continue).

    1 393+0Évolution des étoiles sur les 7 derniers jours
  • rl_games@Denys88

    Implémentations d'apprentissage par renforcement (RL)

    1 385+2Évolution des étoiles sur les 7 derniers jours
  • OpenCat-Old@PetoiCamp

    Un chat robotique programmable et hautement manœuvrable pour l'éducation STEM et les services assistés par IA.

    1 372+1Évolution des étoiles sur les 7 derniers jours
  • smac@oxwhirl

    SMAC : Le défi multi-agents StarCraft.

    1 367+1Évolution des étoiles sur les 7 derniers jours
  • DRL-robot-navigation@reiniscimurs

    Apprentissage par renforcement profond pour la navigation de robots mobiles dans le simulateur ROS Gazebo. En utilisant le réseau de neurones TD3 (Twin Delayed Deep Deterministic Policy Gradient), un robot apprend à naviguer vers un point cible aléatoire dans un environnement simulé tout en évitant les obstacles.

    1 362+2Évolution des étoiles sur les 7 derniers jours
  • SLM-Lab@kengz

    Framework modulaire d'apprentissage par renforcement profond en PyTorch. Bibliothèque compagnon du livre "Foundations of Deep Reinforcement Learning".

    1 362+0Évolution des étoiles sur les 7 derniers jours
  • Popular-RL-Algorithms@quantumiracle

    Implémentation PyTorch de Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet, etc.

    1 359+1Évolution des étoiles sur les 7 derniers jours
  • agent-apprenticeship@ray-r-ren

    Un écosystème vivant où des agents IA accomplissent des tâches via des boucles de workflow, s'améliorent par exécution itérative, sont évalués par des agents mentors ou des humains, et transforment le travail accompli en expérience et données réutilisables pour optimiser les futurs agents.

    1 334+0Évolution des étoiles sur les 7 derniers jours
  • Implémentations minimales de Deep Q Learning (DQN & DDQN) avec Keras

    1 329+1Évolution des étoiles sur les 7 derniers jours
  • Minari@Farama-Foundation

    Format standard pour les jeux de données d'apprentissage par renforcement hors ligne, avec des jeux de données de référence populaires et des utilitaires associés.

    1 294+3Évolution des étoiles sur les 7 derniers jours
  • Learning-Deep-Learning@patrick-llgc

    Notes de lecture sur le Deep Learning et le Machine Learning

    1 270+0Évolution des étoiles sur les 7 derniers jours
  • PPO-for-Beginners@ericyangyu

    Une implémentation PPO simple et élégante, basée sur ma série Medium.

    1 269+1Évolution des étoiles sur les 7 derniers jours
  • android_env@google-deepmind

    Recherche en apprentissage par renforcement (RL) sur appareils Android.

    1 240+0Évolution des étoiles sur les 7 derniers jours
  • alphagen@ICT-FinD-Lab

    Génération d'ensembles de facteurs boursiers alpha (prédictifs) via l'apprentissage par renforcement

    1 213+8Évolution des étoiles sur les 7 derniers jours
  • LearningHumanoidWalking@rohanpsingh

    Entraînement d'un robot humanoïde à la locomotion par apprentissage par renforcement

    1 210+3Évolution des étoiles sur les 7 derniers jours
  • Notes de cours, exercices pratiques avec solutions et vidéos en ligne pour le cours d'apprentissage par renforcement de l'Université de Paderborn

    1 192+1Évolution des étoiles sur les 7 derniers jours
  • flow@flow-project

    Cadre de calcul pour l'apprentissage par renforcement dans le contrôle du trafic

    1 188+0Évolution des étoiles sur les 7 derniers jours
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO : Libérer l'efficacité du GRPO basé sur les flux avec des ODE-SDE mixtes

    1 177+0Évolution des étoiles sur les 7 derniers jours
  • Gym@NVIDIA-NeMo

    Évaluer et améliorer les modèles et agents à l'aide d'environnements

    1 155+7Évolution des étoiles sur les 7 derniers jours
  • SimplerEnv@simpler-env

    Évaluation et reproduction de politiques de manipulation robotique en conditions réelles (ex: RT-1, RT-1-X, Octo) en simulation sous des configurations courantes (ex: Google Robot, WidowX+Bridge) (CoRL 2024)

    1 153+3Évolution des étoiles sur les 7 derniers jours
  • omnisafe@PKU-Alignment

    JMLR : OmniSafe est un framework infrastructurel destiné à accélérer la recherche en SafeRL.

    1 150+1Évolution des étoiles sur les 7 derniers jours
  • evotorch@nnaisense

    Bibliothèque de calcul évolutionnaire avancée construite directement sur PyTorch, créée par NNAISENSE.

    1 144+1Évolution des étoiles sur les 7 derniers jours
  • SMARTS@huawei-noah

    École de formation à l'apprentissage par renforcement multi-agents évolutif pour la conduite autonome.

    1 134+0Évolution des étoiles sur les 7 derniers jours
  • Apprenez à faire apprendre les machines pour ne plus avoir à lutter pour les programmer ; la liste ultime

    1 128+0Évolution des étoiles sur les 7 derniers jours
  • ir-sim@hanruihua

    Un simulateur de robot léger basé sur Python, conçu pour la navigation, le contrôle et l'apprentissage.

    1 125+6Évolution des étoiles sur les 7 derniers jours
  • ASE@nv-tlabs

    Plongements de compétences adverses pour l'entraînement de contrôleurs réutilisables destinés à des personnages simulés physiquement.

    1 119+1Évolution des étoiles sur les 7 derniers jours
  • ARPO@RUC-NLPIR

    [ICLR 2026] Agentic Reinforced Policy Optimization (ARPO).

    1 114+3Évolution des étoiles sur les 7 derniers jours
  • SoundMind@xid32

    Nous présentons le jeu de données Audio Logical Reasoning (ALR), composé de 6 446 échantillons texte-audio annotés, spécifiquement conçus pour des tâches de raisonnement complexe. En nous appuyant sur cette ressource, nous proposons SoundMind, un algorithme d'apprentissage par renforcement (RL) basé sur des règles, conçu pour doter les modèles de langage audio (ALM) de capacités de raisonnement bimodal approfondies.

    1 113+0Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets