Zum Hauptinhalt springen
buildradar
Anmelden
Thema · rl

rl

Erfasste Open-Source-Repos mit dem Tag rl, sortiert nach Sternen.

Repos
46
Sterne gesamt
113.768
Sterne im Schnitt
2.473
Anteil
0,01%

Themen, die häufig gemeinsam mit rl am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit rl getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • Llama-Chinese@LlamaChinese

    Llama-Community auf Chinesisch, die in Echtzeit die neuesten Llama-Lernmaterialien zusammenfasst und das beste chinesische Llama-Open-Source-Ökosystem aufbaut, vollständig Open Source und kommerziell nutzbar

    14.743+0Sterne-Änderung der letzten 7 Tage
  • tianshou@thu-ml

    Eine elegante PyTorch-Bibliothek für Deep Reinforcement Learning.

    10.955+0Sterne-Änderung der letzten 7 Tage
  • dopamine@google

    Dopamine ist ein Forschungsrahmenwerk für das schnelle Prototyping von Reinforcement-Learning-Algorithmen.

    10.909+0Sterne-Änderung der letzten 7 Tage
  • ART@OpenPipe

    Agent Reinforcement Trainer: Trainieren Sie mehrstufige Agenten für reale Aufgaben mit GRPO. Geben Sie Ihren Agenten ein On-the-Job-Training. Reinforcement Learning für Qwen3.6, GPT-OSS, Llama und mehr!

    10.689+0Sterne-Änderung der letzten 7 Tage
  • AReaL@areal-project

    Die RL-Brücke für LLM-basierte Agentenanwendungen. Einfach und flexibel gestaltet.

    5.712+0Sterne-Änderung der letzten 7 Tage
  • EasyR1@hiyouga

    EasyR1: Ein effizientes, skalierbares, multimodales RL-Trainingsframework basierend auf veRL

    5.141+0Sterne-Änderung der letzten 7 Tage
  • hands-on-modern-rl@walkinglabs

    🚀 Ein Open-Source-Praxislehrplan, der die Lücke von grundlegenden RL-Konzepten bis hin zu LLM-Alignment, RLVR und fortgeschrittenen Agentensystemen schließt.

    4.199+0Sterne-Änderung der letzten 7 Tage
  • agent-sandbox@kubernetes-sigs

    Agent-Sandbox ermöglicht die einfache Verwaltung isolierter, zustandsbehafteter Singleton-Workloads, ideal für Anwendungsfälle wie KI-Agenten-Runtimes und Reinforcement Learning (RL).

    3.719+0Sterne-Änderung der letzten 7 Tage
  • AlphaZero_Gomoku@junxiaosong

    Eine Implementierung des AlphaZero-Algorithmus für Gomoku (auch Fünf in einer Reihe genannt).

    3.627+0Sterne-Änderung der letzten 7 Tage
  • rl@pytorch

    Eine modulare, primitive-first, python-first PyTorch-Bibliothek für Reinforcement Learning.

    3.545+0Sterne-Änderung der letzten 7 Tage
  • Ein Trainings-Framework für Reinforcement-Learning-Agenten von Stable Baselines3, einschließlich Hyperparameter-Optimierung und vortrainierten Agenten.

    2.873+0Sterne-Änderung der letzten 7 Tage
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    Implementierung von wissenschaftlichen Arbeiten in 100 Zeilen Code.

    2.870+0Sterne-Änderung der letzten 7 Tage
  • muzero-general@werner-duvaud

    MuZero

    2.865+0Sterne-Änderung der letzten 7 Tage
  • Awesome-RL-for-LRMs@TsinghuaC3I

    Eine Übersicht über Reinforcement Learning für große Reasoning-Modelle

    2.483+0Sterne-Änderung der letzten 7 Tage
  • all-rl-algorithms@FareedKhan-dev

    Einfachere Implementierung aller RL-Algorithmen

    1.929+0Sterne-Änderung der letzten 7 Tage
  • PRIME@PRIME-RL

    Skalierbare RL-Lösung für fortgeschrittenes Reasoning von Sprachmodellen

    1.871+0Sterne-Änderung der letzten 7 Tage
  • SimpleVLA-RL@PRIME-RL

    [ICLR 2026] SimpleVLA-RL: Skalierung des VLA-Trainings durch Reinforcement Learning

    1.844+0Sterne-Änderung der letzten 7 Tage
  • Neueste Fortschritte beim System-2-Reasoning.

    1.353+0Sterne-Änderung der letzten 7 Tage
  • diy-llm@datawhalechina

    🎓 Systematischer Kurs zum Aufbau von Large Language Models | 🛠️ Abdeckung von Vortraining-Data-Engineering, Tokenizer, Transformer, MoE, GPU-Programmierung (CUDA/Triton),分布式训练 (verteiltes Training), Scaling Laws, Inferenzoptimierung und Alignment (SFT/RLHF/GRPO) | 🚀 6 progressive Aufgaben + codegetrieben, Aufbau eines Full-Stack-LLM-Wissensstands

    1.276+0Sterne-Änderung der letzten 7 Tage
  • understand-r1-zero@sail-sg

    R1-Zero-ähnliches Training verstehen: Eine kritische Perspektive

    1.274+0Sterne-Änderung der letzten 7 Tage
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL: Test-Time Reinforcement Learning

    1.123+2Sterne-Änderung der letzten 7 Tage
  • ARPO@RUC-NLPIR

    [ICLR 2026] Agentic Reinforced Policy Optimization (ARPO)

    1.117+4Sterne-Änderung der letzten 7 Tage
  • SDPO@lasgroup

    Reinforcement Learning via Self-Distillation (SDPO)

    1.093+10Sterne-Änderung der letzten 7 Tage
  • judgeval@JudgmentLabs

    Der Continuous-Improvement-Stack für Agenten. Unsere Umgebungsdaten und Evaluierungen treiben die Verbesserung und Überwachung von Agenten voran.

    1.060+1Sterne-Änderung der letzten 7 Tage
  • tensorlake@tensorlakeai

    Tensorlake ist eine serverlose Laufzeiteinführung für Sandboxes und das Bereitstellen von Hintergrund-Agenten-Anwendungen.

    996-1Sterne-Änderung der letzten 7 Tage
  • OpenDerisk@derisk-ai

    KI-native Risikointelligenzsysteme, OpenDeRisk – Ihr intelligenter Manager für Anwendungssystemrisiken bietet 24/7 umfassenden und tiefgehenden Schutz.

    971+1Sterne-Änderung der letzten 7 Tage
  • mushroom-rl@MushroomRL

    Python-Bibliothek für Reinforcement Learning.

    944+0Sterne-Änderung der letzten 7 Tage
  • AI-Compass@tingaicompass

    „AI-Compass“ weist der Community den Weg im Ozean der KI-Technologien. Egal ob Anfänger oder fortgeschrittener Entwickler, hier findet jeder den Pfad zu den verschiedenen KI-Richtungen. Ziel ist es, Entwicklern zu helfen, die Kernkonzepte, Mainstream-Technologien und Zukunftstrends von KI systematisch zu verstehen und den gesamten Prozess von der Theorie bis zur Praxis durch Übung zu meistern.

    937+7Sterne-Änderung der letzten 7 Tage
  • zeroth-bot@zeroth-robotics

    3D-gedruckte Open-Source-humanoide Roboterplattform für Sim-to-Real und RL

    823+2Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Sammlung von Artikeln, technischen Berichten, Frameworks und Tools zur On-Policy-Distillation (OPD) von großen Sprachmodellen

    803+32Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen