reinforcement-learning
Erfasste Open-Source-Repos mit dem Tag reinforcement-learning, sortiert nach Sternen.
- #271★ 638+1Sterne-Änderung der letzten 7 Tage
- #272
Dieses Repository sammelt Code zur Implementierung gängiger Algorithmen im Bereich des maschinellen Lernens. Die meisten basieren auf Numpy, Pandas oder Torch. Sie können Ihr Verständnis vertiefen oder den Code an Ihre Bedürfnisse anpassen.
★ 635+0Sterne-Änderung der letzten 7 Tage - #273
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: Open-Source-RL für LLMs und Agentenszenarien
★ 634+9Sterne-Änderung der letzten 7 Tage - #274★ 633+0Sterne-Änderung der letzten 7 Tage
- #275
API zum Ausführen von VirtualHome, einem Multi-Agenten-Haushaltssimulator
★ 632+2Sterne-Änderung der letzten 7 Tage - #276★ 631+0Sterne-Änderung der letzten 7 Tage
- #277
Implementierung des walk-these-ways-Projekts auf Unitree Go2
★ 623+3Sterne-Änderung der letzten 7 Tage - #278
Erkunden Sie den multimodalen „Aha-Moment“ am 2B-Modell.
★ 623+0Sterne-Änderung der letzten 7 Tage - #279
Veröffentlicht in Nature Machine Intelligence! Der erste echte Roboter (Quadrokopter) auf Basis von differenzierbarem Physik-Training.
★ 614+9Sterne-Änderung der letzten 7 Tage - #280
Kursnotizen zur Vorlesung Machine Learning 2021 Spring von Professor Hung-yi Lee an der National Taiwan University (NTU).
★ 603+3Sterne-Änderung der letzten 7 Tage - #281
[ICLR 2026] ReCogDrive: Ein verstärktes kognitives Framework für End-to-End autonomes Fahren.
★ 599+4Sterne-Änderung der letzten 7 Tage - #282
Relevante Fachartikel zum Thema Reinforcement Learning, einschließlich klassischer Publikationen und aktueller Beiträge von Top-Konferenzen.
★ 595+0Sterne-Änderung der letzten 7 Tage - #283
Eine asynchrone Reinforcement-Learning-Engine für skaliertes Omni-Modal Post-Training.
★ 592+11Sterne-Änderung der letzten 7 Tage - #284
Eine kuratierte Liste von Forschungsarbeiten zu Reinforcement Learning für die Videogenerierung
★ 591+1Sterne-Änderung der letzten 7 Tage - #285
[ICML 2026] Offizielle Ressourcen zu Graph-R1: Ein Framework für agentisches GraphRAG mittels End-to-End Reinforcement Learning.
★ 591+1Sterne-Änderung der letzten 7 Tage - #286
AAAI 2024 Papers: Eine umfassende Sammlung innovativer Forschungsarbeiten einer der führenden Konferenzen für künstliche Intelligenz, inklusive Code-Implementierungen.
★ 591+1Sterne-Änderung der letzten 7 Tage - #287★ 586+0Sterne-Änderung der letzten 7 Tage
- #288
NeurIPS 2023: Safety-Gymnasium: Ein einheitlicher Benchmark für sicheres Reinforcement Learning.
★ 580+1Sterne-Änderung der letzten 7 Tage - #289★ 578+3Sterne-Änderung der letzten 7 Tage
- #290
Implementierung von ChatGPT RLHF (Reinforcement Learning with Human Feedback) auf jedem Generierungsmodell in Huggingfaces Transformer (blommz-176B/bloom/gpt/bart/T5/MetaICL)
★ 564+0Sterne-Änderung der letzten 7 Tage - #291
Deep Reinforcement Learning (PPO) im autonomen Fahren (Carla) [von Grund auf]
★ 563-1Sterne-Änderung der letzten 7 Tage - #292
Meta Agents Research Environments ist eine umfassende Plattform zur Evaluierung von KI-Agenten in dynamischen, realistischen Szenarien. Im Gegensatz zu statischen Benchmarks bietet diese Plattform sich entwickelnde Umgebungen, in denen Agenten ihre Strategien bei neuen Informationen anpassen müssen, um reale Herausforderungen abzubilden.
★ 551+3Sterne-Änderung der letzten 7 Tage - #293
Eine kuratierte Liste von Ressourcen zur künstlichen Intelligenz (Kurse, Tools, Apps, Open-Source-Projekte)
★ 548-1Sterne-Änderung der letzten 7 Tage - #294
[NeurIPS 2025 Spotlight] LLM-Post-Training-Suite – mit ReasonFlux, ReasonFlux-PRM und ReasonFlux-Coder.
★ 542+0Sterne-Änderung der letzten 7 Tage - #295
MuJoCo-Modell eines Fruchtfliegenkörpers und Aufgaben für Reinforcement Learning zur Fortbewegung
★ 539+2Sterne-Änderung der letzten 7 Tage - #296
UMI on Legs: Mobilität für Manipulationsrichtlinien durch manipulationszentrierte Ganzkörper-Controller
★ 536+3Sterne-Änderung der letzten 7 Tage - #297
Kuratierte Liste öffentlich zugänglicher Machine-Learning-Kurse von CalTech, Columbia, Berkeley, MIT und Stanford.
★ 535+1Sterne-Änderung der letzten 7 Tage - #298
Implementierungen von Multi-Objective Reinforcement Learning Algorithmen.
★ 533+1Sterne-Änderung der letzten 7 Tage - #299
[CVPR 2025 Highlight] InterMimic: Auf dem Weg zur universellen Ganzkörpersteuerung für physikbasierte Mensch-Objekt-Interaktionen.
★ 528+1Sterne-Änderung der letzten 7 Tage - #300
Ein universeller, flexibler und benutzerfreundlicher Simulator sowie eine OpenAI Gym-Handelsumgebung für die MetaTrader 5-Plattform (von OpenAI Gym genehmigt).
★ 524+0Sterne-Änderung der letzten 7 Tage