reinforcement-learning
Dépôts open source suivis étiquetés reinforcement-learning, triés par étoiles.
- #31
Vowpal Wabbit est un système d'apprentissage automatique qui repousse les limites du domaine grâce à des techniques telles que l'apprentissage en ligne, le hachage, allreduce, les réductions, learning2search, ainsi que l'apprentissage actif et interactif.
★ 8 708+2Évolution des étoiles sur les 7 derniers jours - #32★ 8 309+2Évolution des étoiles sur les 7 derniers jours
- #33
Implémentation de RLHF (Apprentissage par renforcement à partir de rétroaction humaine) basée sur l'architecture PaLM. En somme, un équivalent de ChatGPT utilisant PaLM.
★ 7 866-2Évolution des étoiles sur les 7 derniers jours - #34
Devenez un chercheur/ingénieur IA/ML chevronné avec ce manuel non conventionnel couvrant les mathématiques, l'informatique et le ML par l'intuition.
★ 7 400+28Évolution des étoiles sur les 7 derniers jours - #35
Liste de lecture pour les sujets de recherche en apprentissage automatique multimodal.
★ 6 926+0Évolution des étoiles sur les 7 derniers jours - #36
Une collection d'articles, de blogs et de projets sur les LLM, avec un accent sur OpenAI o1 🍓 et les techniques de raisonnement.
★ 6 902+3Évolution des étoiles sur les 7 derniers jours - #37
Un cours sur l'apprentissage par renforcement en conditions réelles
★ 6 566+2Évolution des étoiles sur les 7 derniers jours - #38
Une liste organisée de LLM, stratégies et outils de deep learning pour le marché financier.
★ 6 475+31Évolution des étoiles sur les 7 derniers jours - #39
Mooncake est la plateforme de service pour Kimi, un service LLM de premier plan fourni par Moonshot AI.
★ 6 470+70Évolution des étoiles sur les 7 derniers jours - #40
Liste organisée de méthodes d'auto-apprentissage (self-supervised) de référence.
★ 6 414+1Évolution des étoiles sur les 7 derniers jours - #41★ 6 321+15Évolution des étoiles sur les 7 derniers jours
- #42★ 6 018+3Évolution des étoiles sur les 7 derniers jours
- #43★ 5 813+9Évolution des étoiles sur les 7 derniers jours
- #44★ 5 712+16Évolution des étoiles sur les 7 derniers jours
- #45
OpenSpiel est une collection d'environnements et d'algorithmes destinés à la recherche en apprentissage par renforcement général, ainsi qu'à la recherche et à la planification dans les jeux.
★ 5 452+15Évolution des étoiles sur les 7 derniers jours - #46
Un framework de robot quadrupède open source pour développer des robots à quatre pattes de style Boston Dynamics, idéal pour l'éducation STEM, la robotique, l'IoT, les services d'IA appliquée, la recherche et le développement de kits de robotique DIY.
★ 5 246+26Évolution des étoiles sur les 7 derniers jours - #47
Un moteur d'entraînement de nouvelle génération conçu pour les modèles MoE ultra-larges
★ 5 188+5Évolution des étoiles sur les 7 derniers jours - #48
Dépôt pour le programme Nanodegree en Deep Reinforcement Learning
★ 5 176+0Évolution des étoiles sur les 7 derniers jours - #49
EasyR1 : un framework d'entraînement RL multimodal, efficace et évolutif, basé sur veRL.
★ 5 141+11Évolution des étoiles sur les 7 derniers jours - #50
Implémenter un LLM de raisonnement en PyTorch à partir de zéro, étape par étape.
★ 5 138+67Évolution des étoiles sur les 7 derniers jours - #51
Ce dépôt contient le cours d'apprentissage par renforcement profond de Hugging Face.
★ 5 006+10Évolution des étoiles sur les 7 derniers jours - #52
🌟 100+ schémas originaux sur les LLM / RL 📚, présentés par l'auteur de « Algorithmes de grands modèles » ! 💥
★ 4 838+16Évolution des étoiles sur les 7 derniers jours - #53
Un dépôt pour l'entraînement distribué de modèles de langage avec RLHF (Reinforcement Learning via Human Feedback).
★ 4 754-1Évolution des étoiles sur les 7 derniers jours - #54
RLinf : Infrastructure d'apprentissage par renforcement pour l'IA incarnée et agentique.
★ 4 705+44Évolution des étoiles sur les 7 derniers jours - #55
Pile logicielle de Google DeepMind pour la simulation physique et les environnements d'apprentissage par renforcement, utilisant MuJoCo.
★ 4 681+9Évolution des étoiles sur les 7 derniers jours - #56
[ICML 2021] DouZero : Maîtriser le DouDizhu avec l'apprentissage par renforcement profond en auto-jeu | IA pour DouDizhu.
★ 4 659+7Évolution des étoiles sur les 7 derniers jours - #57
Une implémentation propre basée sur AlphaZero pour n'importe quel jeu dans n'importe quel framework + tutoriel + Othello/Gobang/TicTacToe/Connect4 et plus.
★ 4 512+6Évolution des étoiles sur les 7 derniers jours - #58
Une liste organisée de ressources sur l'apprentissage par renforcement à partir de rétroaction humaine (mise à jour continue).
★ 4 424+2Évolution des étoiles sur les 7 derniers jours - #59★ 4 359+4Évolution des étoiles sur les 7 derniers jours
- #60
Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.
★ 4 199+69Évolution des étoiles sur les 7 derniers jours