Zum Hauptinhalt springen
buildradar
Sign in
Thema · reinforcement-learning

reinforcement-learning

Erfasste Open-Source-Repos mit dem Tag reinforcement-learning, sortiert nach Sternen.

304 Repos
  • ReCall@Agent-RL

    ReSearch: Erlernen des Schlussfolgerns mit Suche für LLMs durch Reinforcement Learning & ReCall: Erlernen des Schlussfolgerns mit Tool-Aufrufen für LLMs durch Reinforcement Learning

    1.432+1Sterne-Änderung der letzten 7 Tage
  • Prägnante und schöne Algorithmen, geschrieben in Julia

    1.426+0Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste fantastischer modellbasierter RL-Ressourcen (laufend aktualisiert)

    1.393+0Sterne-Änderung der letzten 7 Tage
  • rl_games@Denys88

    RL-Implementierungen

    1.385+2Sterne-Änderung der letzten 7 Tage
  • OpenCat-Old@PetoiCamp

    Eine programmierbare und äußerst manövrierfähige Roboterkatze für die STEM-Bildung und KI-erweiterte Dienste.

    1.372+1Sterne-Änderung der letzten 7 Tage
  • smac@oxwhirl

    SMAC: Die StarCraft Multi-Agent Challenge

    1.367+1Sterne-Änderung der letzten 7 Tage
  • SLM-Lab@kengz

    Modulares Deep-Reinforcement-Learning-Framework in PyTorch. Begleitbibliothek zum Buch "Foundations of Deep Reinforcement Learning".

    1.362+0Sterne-Änderung der letzten 7 Tage
  • DRL-robot-navigation@reiniscimurs

    Deep Reinforcement Learning für die Navigation von mobilen Robotern im ROS Gazebo Simulator. Mithilfe eines neuronalen Netzwerks mit Twin Delayed Deep Deterministic Policy Gradient (TD3) lernt ein Robot, in einer simulierten Umgebung zu einem zufälligen Zielpunkt zu navigieren und dabei Hindernissen auszuweichen.

    1.362+2Sterne-Änderung der letzten 7 Tage
  • Popular-RL-Algorithms@quantumiracle

    PyTorch-Implementierung von Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet..

    1.359+1Sterne-Änderung der letzten 7 Tage
  • agent-apprenticeship@ray-r-ren

    Das lebendige Ökosystem, in dem KI-Agenten Aufgaben durch Workflow-Schleifen erledigen, sich durch iterative Ausführung verbessern, von Mentor-Agenten oder Menschen bewertet werden und abgeschlossene Arbeit in wiederverwendbare Berufserfahrung und Daten umwandeln, um zukünftige Agenten zu verbessern.

    1.334+0Sterne-Änderung der letzten 7 Tage
  • Minimale Deep Q Learning (DQN & DDQN) Implementierungen in Keras

    1.329+1Sterne-Änderung der letzten 7 Tage
  • Minari@Farama-Foundation

    Ein Standardformat für Offline-Reinforcement-Learning-Datensätze mit gängigen Referenzdatensätzen und zugehörigen Hilfsprogrammen

    1.294+3Sterne-Änderung der letzten 7 Tage
  • Learning-Deep-Learning@patrick-llgc

    Notizen zum Lesen von Fachliteratur über Deep Learning und Machine Learning

    1.270+0Sterne-Änderung der letzten 7 Tage
  • PPO-for-Beginners@ericyangyu

    Eine einfache und gut strukturierte PPO-Implementierung. Basiert auf meiner Medium-Serie: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.

    1.269+1Sterne-Änderung der letzten 7 Tage
  • android_env@google-deepmind

    RL-Forschung auf Android-Geräten.

    1.240+0Sterne-Änderung der letzten 7 Tage
  • alphagen@ICT-FinD-Lab

    Generierung von Sätzen formelhafter Alpha-Aktienfaktoren (prädiktiv) mittels Reinforcement Learning.

    1.213+8Sterne-Änderung der letzten 7 Tage
  • LearningHumanoidWalking@rohanpsingh

    Training eines humanoiden Roboters für die Fortbewegung mittels Reinforcement Learning

    1.210+3Sterne-Änderung der letzten 7 Tage
  • Vorlesungsunterlagen, Übungsaufgaben inklusive Lösungen sowie Online-Videos für den Kurs zum bestärkenden Lernen (Reinforcement Learning) an der Universität Paderborn

    1.192+1Sterne-Änderung der letzten 7 Tage
  • flow@flow-project

    Rechenrahmen für Reinforcement Learning in der Verkehrssteuerung

    1.188+0Sterne-Änderung der letzten 7 Tage
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: Erschließung der Flow-basierten GRPO-Effizienz mit Mixed ODE-SDE

    1.177+0Sterne-Änderung der letzten 7 Tage
  • Gym@NVIDIA-NeMo

    Modelle und Agenten mithilfe von Umgebungen evaluieren und verbessern

    1.155+7Sterne-Änderung der letzten 7 Tage
  • SimplerEnv@simpler-env

    Evaluierung und Reproduktion realer Roboter-Manipulationsrichtlinien (z. B. RT-1, RT-1-X, Octo) in der Simulation unter gängigen Setups (z. B. Google Robot, WidowX+Bridge) (CoRL 2024)

    1.153+3Sterne-Änderung der letzten 7 Tage
  • omnisafe@PKU-Alignment

    JMLR: OmniSafe ist ein Infrastruktur-Framework zur Beschleunigung der SafeRL-Forschung.

    1.150+1Sterne-Änderung der letzten 7 Tage
  • evotorch@nnaisense

    Fortgeschrittene Bibliothek für evolutionäre Berechnungen direkt auf Basis von PyTorch, entwickelt bei NNAISENSE.

    1.144+1Sterne-Änderung der letzten 7 Tage
  • SMARTS@huawei-noah

    Skalierbare Multi-Agenten-RL-Schulungsumgebung für das autonome Fahren

    1.134+0Sterne-Änderung der letzten 7 Tage
  • :computer: Lernen Sie, Maschinen das Lernen beizubringen, damit Sie sie nicht mühsam programmieren müssen; Die ultimative Liste

    1.128+0Sterne-Änderung der letzten 7 Tage
  • ir-sim@hanruihua

    Ein Python-basierter, leichtgewichtiger Robotersimulator für Navigation, Steuerung und Lernen

    1.125+6Sterne-Änderung der letzten 7 Tage
  • ASE@nv-tlabs

    Adversarial Skill-Embeddings zum Trainieren wiederverwendbarer Controller für physikalisch simulierte Charaktere

    1.119+1Sterne-Änderung der letzten 7 Tage
  • ARPO@RUC-NLPIR

    [ICLR 2026] Agentic Reinforced Policy Optimization (ARPO)

    1.114+3Sterne-Änderung der letzten 7 Tage
  • SoundMind@xid32

    Wir stellen den Datensatz „Audio Logical Reasoning (ALR)“ vor, der aus 6.446 text-audio-annotierten Stichproben besteht, die speziell für komplexe Reasoning-Aufgaben entwickelt wurden. Basierend auf dieser Ressource schlagen wir SoundMind vor, einen regelbasierten Reinforcement-Learning-Algorithmus (RL), der Audiolanguage-Modelle (ALMs) mit tiefen bimodalen Reasoning-Fähigkeiten ausstattet.

    1.113+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen