grpo
Erfasste Open-Source-Repos mit dem Tag grpo, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit grpo am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit grpo getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
Verwenden Sie PEFT oder Vollparameter für CPT/SFT/DPO/GRPO von über 600 LLMs und über 300 MLLMs (AAAI 2025).
★ 15.488+88Sterne-Änderung der letzten 7 Tage - #2
Umfangreiche Open-Source-Bibliothek für KI-Forschungs- und Ingenieurskompetenzen für jedes KI-Modell. Verpacken Sie die Fähigkeiten und Ihr claude code/codex/gemini Agent wird zu einem KI-Forschungsagenten mit voller Leistung. Gewartet von Orchestra Research.
★ 12.256+104Sterne-Änderung der letzten 7 Tage - #3
Agent Reinforcement Trainer: Trainieren Sie mehrstufige Agenten für reale Aufgaben mit GRPO. Geben Sie Ihren Agenten ein On-the-Job-Training. Reinforcement Learning für Qwen3.6, GPT-OSS, Llama und mehr!
★ 10.689+10Sterne-Änderung der letzten 7 Tage - #4
https://adongwanai.github.io/AgentGuide | AI-Agent-Entwicklungsleitfaden | LangGraph-Praxis | Fortgeschrittene RAG | Einstieg in Large Language Models | LLM-Vorstellungsgespräche | Algorithmus-Ingenieur | Fragenkatalog für Vorstellungsgespräche | Reinforcement Learning | Datensynthese
★ 9.116+169Sterne-Änderung der letzten 7 Tage - #5★ 6.018+4Sterne-Änderung der letzten 7 Tage
- #6
OpenClaw-RL: Trainieren Sie jeden Agenten einfach durch Sprache
★ 5.665+7Sterne-Änderung der letzten 7 Tage - #7
Implementierung eines begründenden LLM in PyTorch von Grund auf, Schritt für Schritt
★ 5.138+49Sterne-Änderung der letzten 7 Tage - #8
🚀 Ein Open-Source-Praxislehrplan, der die Lücke von grundlegenden RL-Konzepten bis hin zu LLM-Alignment, RLVR und fortgeschrittenen Agentensystemen schließt.
★ 4.199+54Sterne-Änderung der letzten 7 Tage - #9
Skywork-R1V ist eine von Skywork AI entwickelte, fortschrittliche multimodale KI-Modellserie, die auf Vision-Language-Reasoning spezialisiert ist.
★ 3.168+0Sterne-Änderung der letzten 7 Tage - #10
verl-agent ist eine Erweiterung von veRL, entwickelt für das Training von LLM/VLM-Agenten mittels RL. verl-agent ist zudem der offizielle Code zum Paper „Group-in-Group Policy Optimization for LLM Agent Training“.
★ 2.274+17Sterne-Änderung der letzten 7 Tage - #11
[ECCV 2026] MixGRPO: Erschließung der Flow-basierten GRPO-Effizienz mit Mixed ODE-SDE
★ 1.177+0Sterne-Änderung der letzten 7 Tage - #12
Der Continuous-Improvement-Stack für Agenten. Unsere Umgebungsdaten und Evaluierungen treiben die Verbesserung und Überwachung von Agenten voran.
★ 1.060+2Sterne-Änderung der letzten 7 Tage - #13★ 959+60Sterne-Änderung der letzten 7 Tage
- #14
OAT: Ein forschungsfreundliches Framework für das Online-Alignment von LLMs, einschließlich Reinforcement Learning, Präferenzlernen usw.
★ 669-1Sterne-Änderung der letzten 7 Tage - #15
[NeurIPS 2025] AutoVLA: Ein Vision-Language-Action-Modell für autonomes End-to-End-Fahren mit adaptivem Reasoning und Reinforcement Fine-Tuning
★ 640+6Sterne-Änderung der letzten 7 Tage - #16
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: Open-Source-RL für LLMs und Agentenszenarien
★ 632+9Sterne-Änderung der letzten 7 Tage - #17
Erkunden Sie den multimodalen „Aha-Moment“ am 2B-Modell.
★ 623+0Sterne-Änderung der letzten 7 Tage - #18
Eine asynchrone Reinforcement-Learning-Engine für skaliertes Omni-Modal Post-Training.
★ 591+10Sterne-Änderung der letzten 7 Tage - #19
Eine kuratierte Liste von Forschungsarbeiten zu Reinforcement Learning für die Videogenerierung
★ 591+1Sterne-Änderung der letzten 7 Tage - #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Sterne-Änderung der letzten 7 Tage