reinforcement-learning
Erfasste Open-Source-Repos mit dem Tag reinforcement-learning, sortiert nach Sternen.
- #91
🤖 Leitfaden für Machine Learning Summer Schools
★ 3.033+3Sterne-Änderung der letzten 7 Tage - #92
TF-Agents: Eine zuverlässige, skalierbare und benutzerfreundliche TensorFlow-Bibliothek für Contextual Bandits und Reinforcement Learning.
★ 3.026+0Sterne-Änderung der letzten 7 Tage - #93
Forschungsarbeiten und Code zu Deep Learning und Deep Reinforcement Learning
★ 3.026+2Sterne-Änderung der letzten 7 Tage - #94★ 2.960+82Sterne-Änderung der letzten 7 Tage
- #95
Ein vollständig quelloffener humanoider Arm für die physische KI-Forschung und den Einsatz in kontaktintensiven Umgebungen.
★ 2.919+23Sterne-Änderung der letzten 7 Tage - #96
Ein Trainings-Framework für Reinforcement-Learning-Agenten von Stable Baselines3, einschließlich Hyperparameter-Optimierung und vortrainierten Agenten.
★ 2.873+1Sterne-Änderung der letzten 7 Tage - #97
Implementierung von wissenschaftlichen Arbeiten in 100 Zeilen Code.
★ 2.870+3Sterne-Änderung der letzten 7 Tage - #98
MuZero
★ 2.865+2Sterne-Änderung der letzten 7 Tage - #99
Einfache und umfassende Tutorials zu TensorFlow
★ 2.841+0Sterne-Änderung der letzten 7 Tage - #100
Eine Bibliothek von KI-Agenten auf Unternehmensebene, die künstliche Intelligenz demokratisieren und kostenlose Open-Source-Alternativen zu überbewerteten Y Combinator-Startups bieten soll.
★ 2.806+7Sterne-Änderung der letzten 7 Tage - #101
RAGEN nutzt Reinforcement Learning, um LLM-Reasoning-Agenten in interaktiven, stochastischen Umgebungen zu trainieren.
★ 2.786+6Sterne-Änderung der letzten 7 Tage - #102★ 2.657+3Sterne-Änderung der letzten 7 Tage
- #103
PPO x Family DRL Tutorial-Kurs
★ 2.616+2Sterne-Änderung der letzten 7 Tage - #104
Ausgewählte Deep-Learning-Paper für industrielle Suche, Empfehlung und Werbung. Sie konzentrieren sich auf Embedding, Matching, Pre-Ranking, Ranking, Post-Ranking, Relevanz, LLM und RL. Bitte zitieren Sie unser Paper „Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives“ (TOIS 2026).
★ 2.589+0Sterne-Änderung der letzten 7 Tage - #105
robosuite: Ein modulares Simulationsframework und Benchmark für Roboterlernen
★ 2.586+4Sterne-Änderung der letzten 7 Tage - #106
Awesome Reasoning LLM Tutorial/Survey/Guide
★ 2.533+6Sterne-Änderung der letzten 7 Tage - #107
Lösungen zu Reinforcement Learning, An Introduction
★ 2.433+3Sterne-Änderung der letzten 7 Tage - #108
Eine modulare RL-Bibliothek zur Feinabstimmung von Sprachmodellen auf menschliche Präferenzen
★ 2.395+1Sterne-Änderung der letzten 7 Tage - #109
Die einfachste, flexibelste und umfassendste OpenAI-Gym-Trading-Umgebung (von OpenAI Gym genehmigt)
★ 2.387+0Sterne-Änderung der letzten 7 Tage - #110
Minimale Implementierung von PPO (Proximal Policy Optimization) mit gekappter Zielfunktion in PyTorch
★ 2.381+6Sterne-Änderung der letzten 7 Tage - #111
ProtoMotions ist ein GPU-beschleunigtes Simulations- und Lernframework zum Trainieren physikalisch simulierter digitaler Menschen und humanoider Roboter.
★ 2.359+10Sterne-Änderung der letzten 7 Tage - #112
ICCV2019 – Learning to Paint With Model-based Deep Reinforcement Learning
★ 2.308+2Sterne-Änderung der letzten 7 Tage - #113★ 2.293+0Sterne-Änderung der letzten 7 Tage
- #114
Eine leichtgewichtige Suite von Bewegungsimitationsmethoden zum Trainieren von Controllern.
★ 2.280+15Sterne-Änderung der letzten 7 Tage - #115
verl-agent ist eine Erweiterung von veRL, entwickelt für das Training von LLM/VLM-Agenten mittels RL. verl-agent ist zudem der offizielle Code zum Paper „Group-in-Group Policy Optimization for LLM Agent Training“.
★ 2.274+17Sterne-Änderung der letzten 7 Tage - #116
Eine Sammlung von Industrie-Klassikern und bahnbrechenden Papers aus den Bereichen Empfehlung, Werbung und Suche.
★ 2.188-1Sterne-Änderung der letzten 7 Tage - #117
PyBullet Gymnasium-Umgebungen für das Single- und Multi-Agenten-Reinforcement-Learning zur Quadcopter-Steuerung
★ 2.119-2Sterne-Änderung der letzten 7 Tage - #118
[RSS 2025] „ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills“
★ 2.107+3Sterne-Änderung der letzten 7 Tage - #119
DIAMOND (DIffusion As a Model Of eNvironment Dreams) ist ein Reinforcement-Learning-Agent, trainiert in einem Diffusions-Weltmodell. NeurIPS 2024 Spotlight.
★ 2.100+1Sterne-Änderung der letzten 7 Tage - #120
Reinforcement-Learning-Umgebungen basierend auf dem Spiel Doom von 1993 :godmode:
★ 2.065+0Sterne-Änderung der letzten 7 Tage