reinforcement-learning
Dépôts open source suivis étiquetés reinforcement-learning, triés par étoiles.
- #241
Une collection d'articles récents sur la création d'agents autonomes, couvrant deux sujets : les agents basés sur l'apprentissage par renforcement (RL) et sur les LLM.
★ 760+2Évolution des étoiles sur les 7 derniers jours - #242
Environnements Gymnasium multi-objectifs pour l'apprentissage par renforcement.
★ 760+0Évolution des étoiles sur les 7 derniers jours - #243★ 737+1Évolution des étoiles sur les 7 derniers jours
- #244
Package de contribution pour Stable-Baselines3 - Code expérimental d'apprentissage par renforcement (RL)
★ 736+1Évolution des étoiles sur les 7 derniers jours - #245★ 730+1Évolution des étoiles sur les 7 derniers jours
- #246
Projet d'algorithme d'évitement d'obstacles autonome pour drone basé sur l'apprentissage par renforcement profond
★ 730+0Évolution des étoiles sur les 7 derniers jours - #247
Code d'accompagnement pour la publication Nature « Discovering State-of-the-art Reinforcement Algorithms »
★ 729+2Évolution des étoiles sur les 7 derniers jours - #248★ 726-1Évolution des étoiles sur les 7 derniers jours
- #249
Une liste de ressources exceptionnelles sur l'exploration en RL (mise à jour continue)
★ 723+0Évolution des étoiles sur les 7 derniers jours - #250
Moteur de poker pour le développement d'IA de poker en Python
★ 723+2Évolution des étoiles sur les 7 derniers jours - #251
Code pour l'article "Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach"
★ 722+1Évolution des étoiles sur les 7 derniers jours - #252
Environnement de poker Texas Hold'em OpenAI Gym avec apprentissage par renforcement basé sur keras-rl. Inclut le rendu virtuel et Monte-Carlo pour le calcul d'équité.
★ 722+0Évolution des étoiles sur les 7 derniers jours - #253
[COLM’25] DeepRetrieval — 🔥 Entraînement d'un agent de recherche par RLVR avec résultat de récupération
★ 719+2Évolution des étoiles sur les 7 derniers jours - #254
Une liste organisée d'articles sur la recherche arborescente de Monte Carlo avec implémentations.
★ 715+0Évolution des étoiles sur les 7 derniers jours - #255
Plateforme de recherche en IA pour l'apprentissage par renforcement à partir d'images panoramiques réelles.
★ 713-1Évolution des étoiles sur les 7 derniers jours - #256
Apprentissage par renforcement avec commande prédictive par modèle
★ 710+1Évolution des étoiles sur les 7 derniers jours - #257
Une collection frontend et un état de l'art complets des articles et modèles vision-langage sur GitHub. Mises à jour continues.
★ 709+3Évolution des étoiles sur les 7 derniers jours - #258
Algorithmes MARL affinés sur SMAC (taux de victoire de 100 % sur la plupart des scénarios)
★ 709-1Évolution des étoiles sur les 7 derniers jours - #259
ns3-gym - L'environnement d'expérimentation pour l'apprentissage par renforcement dans la recherche sur les réseaux
★ 695+2Évolution des étoiles sur les 7 derniers jours - #260
Cadre unifié pour l'apprentissage par renforcement facile dans les modèles Flow-Matching
★ 693+5Évolution des étoiles sur les 7 derniers jours - #261
Implémentation d'algorithmes d'apprentissage par renforcement inverse (IRL) en Python/Tensorflow. Deep MaxEnt, MaxEnt, LPIRL
★ 681+0Évolution des étoiles sur les 7 derniers jours - #262
Simulateur Hearthstone utilisant C++ avec un certain apprentissage par renforcement
★ 680+0Évolution des étoiles sur les 7 derniers jours - #263
Un framework C++ pour les MDPs et les POMDPs avec des liaisons Python
★ 671+0Évolution des étoiles sur les 7 derniers jours - #264
BenchMARL est une bibliothèque de benchmarking pour l'apprentissage par renforcement multi-agents (MARL). BenchMARL permet de comparer rapidement différents algorithmes MARL, tâches et modèles, tout en étant systématiquement fondé sur ses deux principes fondamentaux : la reproductibilité et la standardisation.
★ 659+5Évolution des étoiles sur les 7 derniers jours - #265
Une bibliothèque PyTorch pour la construction d'agents d'apprentissage profond par renforcement.
★ 657+0Évolution des étoiles sur les 7 derniers jours - #266
Cycle de vie complet d'un projet de science des données.
★ 653+0Évolution des étoiles sur les 7 derniers jours - #267
Un paquet d'apprentissage par renforcement pour Julia
★ 652-1Évolution des étoiles sur les 7 derniers jours - #268
Dernières avancées sur le raisonnement à longue chaîne de pensée (Long Chain-of-Thought)
★ 647-1Évolution des étoiles sur les 7 derniers jours - #269★ 644+2Évolution des étoiles sur les 7 derniers jours
- #270
Page de projet pour "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement"
★ 640+1Évolution des étoiles sur les 7 derniers jours