reinforcement-learning
Erfasste Open-Source-Repos mit dem Tag reinforcement-learning, sortiert nach Sternen.
- #151
ReSearch: Erlernen des Schlussfolgerns mit Suche für LLMs durch Reinforcement Learning & ReCall: Erlernen des Schlussfolgerns mit Tool-Aufrufen für LLMs durch Reinforcement Learning
★ 1.432+1Sterne-Änderung der letzten 7 Tage - #152
Prägnante und schöne Algorithmen, geschrieben in Julia
★ 1.426+0Sterne-Änderung der letzten 7 Tage - #153
Eine kuratierte Liste fantastischer modellbasierter RL-Ressourcen (laufend aktualisiert)
★ 1.393+0Sterne-Änderung der letzten 7 Tage - #154★ 1.385+2Sterne-Änderung der letzten 7 Tage
- #155
Eine programmierbare und äußerst manövrierfähige Roboterkatze für die STEM-Bildung und KI-erweiterte Dienste.
★ 1.372+1Sterne-Änderung der letzten 7 Tage - #156★ 1.367+1Sterne-Änderung der letzten 7 Tage
- #157
Modulares Deep-Reinforcement-Learning-Framework in PyTorch. Begleitbibliothek zum Buch "Foundations of Deep Reinforcement Learning".
★ 1.362+0Sterne-Änderung der letzten 7 Tage - #158
Deep Reinforcement Learning für die Navigation von mobilen Robotern im ROS Gazebo Simulator. Mithilfe eines neuronalen Netzwerks mit Twin Delayed Deep Deterministic Policy Gradient (TD3) lernt ein Robot, in einer simulierten Umgebung zu einem zufälligen Zielpunkt zu navigieren und dabei Hindernissen auszuweichen.
★ 1.362+2Sterne-Änderung der letzten 7 Tage - #159
PyTorch-Implementierung von Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet..
★ 1.359+1Sterne-Änderung der letzten 7 Tage - #160
Das lebendige Ökosystem, in dem KI-Agenten Aufgaben durch Workflow-Schleifen erledigen, sich durch iterative Ausführung verbessern, von Mentor-Agenten oder Menschen bewertet werden und abgeschlossene Arbeit in wiederverwendbare Berufserfahrung und Daten umwandeln, um zukünftige Agenten zu verbessern.
★ 1.334+0Sterne-Änderung der letzten 7 Tage - #161
Minimale Deep Q Learning (DQN & DDQN) Implementierungen in Keras
★ 1.329+1Sterne-Änderung der letzten 7 Tage - #162
Ein Standardformat für Offline-Reinforcement-Learning-Datensätze mit gängigen Referenzdatensätzen und zugehörigen Hilfsprogrammen
★ 1.294+3Sterne-Änderung der letzten 7 Tage - #163
Notizen zum Lesen von Fachliteratur über Deep Learning und Machine Learning
★ 1.270+0Sterne-Änderung der letzten 7 Tage - #164
Eine einfache und gut strukturierte PPO-Implementierung. Basiert auf meiner Medium-Serie: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.
★ 1.269+1Sterne-Änderung der letzten 7 Tage - #165
RL-Forschung auf Android-Geräten.
★ 1.240+0Sterne-Änderung der letzten 7 Tage - #166
Generierung von Sätzen formelhafter Alpha-Aktienfaktoren (prädiktiv) mittels Reinforcement Learning.
★ 1.213+8Sterne-Änderung der letzten 7 Tage - #167
Training eines humanoiden Roboters für die Fortbewegung mittels Reinforcement Learning
★ 1.210+3Sterne-Änderung der letzten 7 Tage - #168
Vorlesungsunterlagen, Übungsaufgaben inklusive Lösungen sowie Online-Videos für den Kurs zum bestärkenden Lernen (Reinforcement Learning) an der Universität Paderborn
★ 1.192+1Sterne-Änderung der letzten 7 Tage - #169★ 1.188+0Sterne-Änderung der letzten 7 Tage
- #170
[ECCV 2026] MixGRPO: Erschließung der Flow-basierten GRPO-Effizienz mit Mixed ODE-SDE
★ 1.177+0Sterne-Änderung der letzten 7 Tage - #171★ 1.155+7Sterne-Änderung der letzten 7 Tage
- #172
Evaluierung und Reproduktion realer Roboter-Manipulationsrichtlinien (z. B. RT-1, RT-1-X, Octo) in der Simulation unter gängigen Setups (z. B. Google Robot, WidowX+Bridge) (CoRL 2024)
★ 1.153+3Sterne-Änderung der letzten 7 Tage - #173
JMLR: OmniSafe ist ein Infrastruktur-Framework zur Beschleunigung der SafeRL-Forschung.
★ 1.150+1Sterne-Änderung der letzten 7 Tage - #174
Fortgeschrittene Bibliothek für evolutionäre Berechnungen direkt auf Basis von PyTorch, entwickelt bei NNAISENSE.
★ 1.144+1Sterne-Änderung der letzten 7 Tage - #175★ 1.134+0Sterne-Änderung der letzten 7 Tage
- #176
:computer: Lernen Sie, Maschinen das Lernen beizubringen, damit Sie sie nicht mühsam programmieren müssen; Die ultimative Liste
★ 1.128+0Sterne-Änderung der letzten 7 Tage - #177
Ein Python-basierter, leichtgewichtiger Robotersimulator für Navigation, Steuerung und Lernen
★ 1.125+6Sterne-Änderung der letzten 7 Tage - #178
Adversarial Skill-Embeddings zum Trainieren wiederverwendbarer Controller für physikalisch simulierte Charaktere
★ 1.119+1Sterne-Änderung der letzten 7 Tage - #179★ 1.114+3Sterne-Änderung der letzten 7 Tage
- #180
Wir stellen den Datensatz „Audio Logical Reasoning (ALR)“ vor, der aus 6.446 text-audio-annotierten Stichproben besteht, die speziell für komplexe Reasoning-Aufgaben entwickelt wurden. Basierend auf dieser Ressource schlagen wir SoundMind vor, einen regelbasierten Reinforcement-Learning-Algorithmus (RL), der Audiolanguage-Modelle (ALMs) mit tiefen bimodalen Reasoning-Fähigkeiten ausstattet.
★ 1.113+0Sterne-Änderung der letzten 7 Tage