rl
Erfasste Open-Source-Repos mit dem Tag rl, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit rl am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit rl getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
Llama-Community auf Chinesisch, die in Echtzeit die neuesten Llama-Lernmaterialien zusammenfasst und das beste chinesische Llama-Open-Source-Ökosystem aufbaut, vollständig Open Source und kommerziell nutzbar
★ 14.743+0Sterne-Änderung der letzten 7 Tage - #2★ 10.955+0Sterne-Änderung der letzten 7 Tage
- #3
Dopamine ist ein Forschungsrahmenwerk für das schnelle Prototyping von Reinforcement-Learning-Algorithmen.
★ 10.909+0Sterne-Änderung der letzten 7 Tage - #4
Agent Reinforcement Trainer: Trainieren Sie mehrstufige Agenten für reale Aufgaben mit GRPO. Geben Sie Ihren Agenten ein On-the-Job-Training. Reinforcement Learning für Qwen3.6, GPT-OSS, Llama und mehr!
★ 10.689+0Sterne-Änderung der letzten 7 Tage - #5
Die RL-Brücke für LLM-basierte Agentenanwendungen. Einfach und flexibel gestaltet.
★ 5.712+0Sterne-Änderung der letzten 7 Tage - #6
EasyR1: Ein effizientes, skalierbares, multimodales RL-Trainingsframework basierend auf veRL
★ 5.141+0Sterne-Änderung der letzten 7 Tage - #7
🚀 Ein Open-Source-Praxislehrplan, der die Lücke von grundlegenden RL-Konzepten bis hin zu LLM-Alignment, RLVR und fortgeschrittenen Agentensystemen schließt.
★ 4.199+0Sterne-Änderung der letzten 7 Tage - #8
Agent-Sandbox ermöglicht die einfache Verwaltung isolierter, zustandsbehafteter Singleton-Workloads, ideal für Anwendungsfälle wie KI-Agenten-Runtimes und Reinforcement Learning (RL).
★ 3.719+0Sterne-Änderung der letzten 7 Tage - #9
Eine Implementierung des AlphaZero-Algorithmus für Gomoku (auch Fünf in einer Reihe genannt).
★ 3.627+0Sterne-Änderung der letzten 7 Tage - #10
Eine modulare, primitive-first, python-first PyTorch-Bibliothek für Reinforcement Learning.
★ 3.545+0Sterne-Änderung der letzten 7 Tage - #11
Ein Trainings-Framework für Reinforcement-Learning-Agenten von Stable Baselines3, einschließlich Hyperparameter-Optimierung und vortrainierten Agenten.
★ 2.873+0Sterne-Änderung der letzten 7 Tage - #12
Implementierung von wissenschaftlichen Arbeiten in 100 Zeilen Code.
★ 2.870+0Sterne-Änderung der letzten 7 Tage - #13
MuZero
★ 2.865+0Sterne-Änderung der letzten 7 Tage - #14
Eine Übersicht über Reinforcement Learning für große Reasoning-Modelle
★ 2.483+0Sterne-Änderung der letzten 7 Tage - #15
Einfachere Implementierung aller RL-Algorithmen
★ 1.929+0Sterne-Änderung der letzten 7 Tage - #16★ 1.871+0Sterne-Änderung der letzten 7 Tage
- #17
[ICLR 2026] SimpleVLA-RL: Skalierung des VLA-Trainings durch Reinforcement Learning
★ 1.844+0Sterne-Änderung der letzten 7 Tage - #18
Neueste Fortschritte beim System-2-Reasoning.
★ 1.353+0Sterne-Änderung der letzten 7 Tage - #19
🎓 Systematischer Kurs zum Aufbau von Large Language Models | 🛠️ Abdeckung von Vortraining-Data-Engineering, Tokenizer, Transformer, MoE, GPU-Programmierung (CUDA/Triton),分布式训练 (verteiltes Training), Scaling Laws, Inferenzoptimierung und Alignment (SFT/RLHF/GRPO) | 🚀 6 progressive Aufgaben + codegetrieben, Aufbau eines Full-Stack-LLM-Wissensstands
★ 1.276+0Sterne-Änderung der letzten 7 Tage - #20
R1-Zero-ähnliches Training verstehen: Eine kritische Perspektive
★ 1.274+0Sterne-Änderung der letzten 7 Tage - #21★ 1.123+2Sterne-Änderung der letzten 7 Tage
- #22★ 1.117+4Sterne-Änderung der letzten 7 Tage
- #23★ 1.093+10Sterne-Änderung der letzten 7 Tage
- #24
Der Continuous-Improvement-Stack für Agenten. Unsere Umgebungsdaten und Evaluierungen treiben die Verbesserung und Überwachung von Agenten voran.
★ 1.060+1Sterne-Änderung der letzten 7 Tage - #25
Tensorlake ist eine serverlose Laufzeiteinführung für Sandboxes und das Bereitstellen von Hintergrund-Agenten-Anwendungen.
★ 996-1Sterne-Änderung der letzten 7 Tage - #26
KI-native Risikointelligenzsysteme, OpenDeRisk – Ihr intelligenter Manager für Anwendungssystemrisiken bietet 24/7 umfassenden und tiefgehenden Schutz.
★ 971+1Sterne-Änderung der letzten 7 Tage - #27
Python-Bibliothek für Reinforcement Learning.
★ 944+0Sterne-Änderung der letzten 7 Tage - #28
„AI-Compass“ weist der Community den Weg im Ozean der KI-Technologien. Egal ob Anfänger oder fortgeschrittener Entwickler, hier findet jeder den Pfad zu den verschiedenen KI-Richtungen. Ziel ist es, Entwicklern zu helfen, die Kernkonzepte, Mainstream-Technologien und Zukunftstrends von KI systematisch zu verstehen und den gesamten Prozess von der Theorie bis zur Praxis durch Übung zu meistern.
★ 937+7Sterne-Änderung der letzten 7 Tage - #29
3D-gedruckte Open-Source-humanoide Roboterplattform für Sim-to-Real und RL
★ 823+2Sterne-Änderung der letzten 7 Tage - #30
Eine kuratierte Sammlung von Artikeln, technischen Berichten, Frameworks und Tools zur On-Policy-Distillation (OPD) von großen Sprachmodellen
★ 803+32Sterne-Änderung der letzten 7 Tage