Zum Hauptinhalt springen
buildradar
Sign in
Thema · grpo

grpo

Erfasste Open-Source-Repos mit dem Tag grpo, sortiert nach Sternen.

Repos
20
Sterne gesamt
81.418
Sterne im Schnitt
4.071
Anteil
0,00%

Themen, die häufig gemeinsam mit grpo am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit grpo getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • ms-swift@modelscope

    Verwenden Sie PEFT oder Vollparameter für CPT/SFT/DPO/GRPO von über 600 LLMs und über 300 MLLMs (AAAI 2025).

    15.488+88Sterne-Änderung der letzten 7 Tage
  • AI-Research-SKILLs@Orchestra-Research

    Umfangreiche Open-Source-Bibliothek für KI-Forschungs- und Ingenieurskompetenzen für jedes KI-Modell. Verpacken Sie die Fähigkeiten und Ihr claude code/codex/gemini Agent wird zu einem KI-Forschungsagenten mit voller Leistung. Gewartet von Orchestra Research.

    12.256+104Sterne-Änderung der letzten 7 Tage
  • ART@OpenPipe

    Agent Reinforcement Trainer: Trainieren Sie mehrstufige Agenten für reale Aufgaben mit GRPO. Geben Sie Ihren Agenten ein On-the-Job-Training. Reinforcement Learning für Qwen3.6, GPT-OSS, Llama und mehr!

    10.689+10Sterne-Änderung der letzten 7 Tage
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | AI-Agent-Entwicklungsleitfaden | LangGraph-Praxis | Fortgeschrittene RAG | Einstieg in Large Language Models | LLM-Vorstellungsgespräche | Algorithmus-Ingenieur | Fragenkatalog für Vorstellungsgespräche | Reinforcement Learning | Datensynthese

    9.116+169Sterne-Änderung der letzten 7 Tage
  • VLM-R1@om-ai-lab

    Visuelles Verstehen mit RL-basierten VLMs lösen

    6.018+4Sterne-Änderung der letzten 7 Tage
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: Trainieren Sie jeden Agenten einfach durch Sprache

    5.665+7Sterne-Änderung der letzten 7 Tage
  • reasoning-from-scratch@rasbt

    Implementierung eines begründenden LLM in PyTorch von Grund auf, Schritt für Schritt

    5.138+49Sterne-Änderung der letzten 7 Tage
  • hands-on-modern-rl@walkinglabs

    🚀 Ein Open-Source-Praxislehrplan, der die Lücke von grundlegenden RL-Konzepten bis hin zu LLM-Alignment, RLVR und fortgeschrittenen Agentensystemen schließt.

    4.199+54Sterne-Änderung der letzten 7 Tage
  • Skywork-R1V@SkyworkAI

    Skywork-R1V ist eine von Skywork AI entwickelte, fortschrittliche multimodale KI-Modellserie, die auf Vision-Language-Reasoning spezialisiert ist.

    3.168+0Sterne-Änderung der letzten 7 Tage
  • verl-agent@langfengQ

    verl-agent ist eine Erweiterung von veRL, entwickelt für das Training von LLM/VLM-Agenten mittels RL. verl-agent ist zudem der offizielle Code zum Paper „Group-in-Group Policy Optimization for LLM Agent Training“.

    2.274+17Sterne-Änderung der letzten 7 Tage
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: Erschließung der Flow-basierten GRPO-Effizienz mit Mixed ODE-SDE

    1.177+0Sterne-Änderung der letzten 7 Tage
  • judgeval@JudgmentLabs

    Der Continuous-Improvement-Stack für Agenten. Unsere Umgebungsdaten und Evaluierungen treiben die Verbesserung und Überwachung von Agenten voran.

    1.060+2Sterne-Änderung der letzten 7 Tage
  • verl-omni@verl-project

    Multimodales RL-Trainingsframework für Diffusions- und Omni-Modelle

    959+60Sterne-Änderung der letzten 7 Tage
  • oat@sail-sg

    OAT: Ein forschungsfreundliches Framework für das Online-Alignment von LLMs, einschließlich Reinforcement Learning, Präferenzlernen usw.

    669-1Sterne-Änderung der letzten 7 Tage
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA: Ein Vision-Language-Action-Modell für autonomes End-to-End-Fahren mit adaptivem Reasoning und Reinforcement Fine-Tuning

    640+6Sterne-Änderung der letzten 7 Tage
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: Open-Source-RL für LLMs und Agentenszenarien

    632+9Sterne-Änderung der letzten 7 Tage
  • VisualThinker-R1-Zero@turningpoint-ai

    Erkunden Sie den multimodalen „Aha-Moment“ am 2B-Modell.

    623+0Sterne-Änderung der letzten 7 Tage
  • Relax@redai-studio

    Eine asynchrone Reinforcement-Learning-Engine für skaliertes Omni-Modal Post-Training.

    591+10Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste von Forschungsarbeiten zu Reinforcement Learning für die Videogenerierung

    591+1Sterne-Änderung der letzten 7 Tage
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen