rl
Erfasste Open-Source-Repos mit dem Tag rl, sortiert nach Sternen.
- #31
MobileGym: Eine verifizierbare und hochparallele Simulationsplattform für die Forschung zu mobilen GUI-Agenten · Im Browser laufender Android-Emulator · Browser-hosted Android Simulator · Verifizierbare Evaluierung · Skalierbares Online-RL-Training
★ 786+10Sterne-Änderung der letzten 7 Tage - #32
Contrib-Paket für Stable-Baselines3 – Experimenteller Reinforcement-Learning-Code (RL)
★ 736+5Sterne-Änderung der letzten 7 Tage - #33
Eine kuratierte Liste von Monte-Carlo-Tree-Search-Papern mit Implementierungen.
★ 715+1Sterne-Änderung der letzten 7 Tage - #34
KI-Forschungsplattform für Reinforcement Learning aus echten Panoramabildern.
★ 713+1Sterne-Änderung der letzten 7 Tage - #35
Offizielles Repository für DR Tulu: Reinforcement Learning mit evolvierenden Rubriken für Deep Research
★ 704+4Sterne-Änderung der letzten 7 Tage - #36
Implementierung von Algorithmen für Inverse Reinforcement Learning (IRL) in Python/Tensorflow. Deep MaxEnt, MaxEnt, LPIRL
★ 681+2Sterne-Änderung der letzten 7 Tage - #37
Hearthstone-Simulator in C++ mit etwas Reinforcement Learning
★ 680+1Sterne-Änderung der letzten 7 Tage - #38
BenchMARL ist eine Bibliothek für Benchmarking im Bereich Multi-Agent Reinforcement Learning (MARL). BenchMARL ermöglicht den schnellen Vergleich verschiedener MARL-Algorithmen, -Aufgaben und -Modelle, gestützt auf die zwei Kernprinzipien: Reproduzierbarkeit und Standardisierung.
★ 656+2Sterne-Änderung der letzten 7 Tage - #39
Neueste Fortschritte beim Long Chain-of-Thought Reasoning
★ 647-1Sterne-Änderung der letzten 7 Tage - #40
[NeurIPS 2022] 🛒WebShop: Auf dem Weg zu skalierbarer Web-Interaktion in der realen Welt mit Grounded Language Agents.
★ 589+3Sterne-Änderung der letzten 7 Tage - #41
ROS2-Control-Implementierungen für Quadruped-Roboter, einschließlich Sim2Real
★ 567+3Sterne-Änderung der letzten 7 Tage - #42
Meta Agents Research Environments ist eine umfassende Plattform zur Evaluierung von KI-Agenten in dynamischen, realistischen Szenarien. Im Gegensatz zu statischen Benchmarks bietet diese Plattform sich entwickelnde Umgebungen, in denen Agenten ihre Strategien bei neuen Informationen anpassen müssen, um reale Herausforderungen abzubilden.
★ 551+3Sterne-Änderung der letzten 7 Tage - #43
Implementierungen von Multi-Objective Reinforcement Learning Algorithmen.
★ 533+1Sterne-Änderung der letzten 7 Tage - #44
DeepThinkVLA: Verbesserung der Schlussfolgerungsfähigkeit von Vision-Language-Action-Modellen
★ 529+0Sterne-Änderung der letzten 7 Tage - #45★ 506+1Sterne-Änderung der letzten 7 Tage
- #46
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Sterne-Änderung der letzten 7 Tage