grpo
Repositorios de código abierto monitorizados etiquetados con grpo, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a grpo en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con grpo.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Usa PEFT o parámetros completos para CPT/SFT/DPO/GRPO en más de 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) y más de 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).
★ 15.488+88Variación de estrellas de los últimos 7 días - #2
Biblioteca integral de código abierto de habilidades de investigación e ingeniería de IA para cualquier modelo de IA. Empaqueta las habilidades y tu agente de claude code/codex/gemini será un agente de investigación de IA con toda su potencia. Mantenido por Orchestra Research.
★ 12.256+104Variación de estrellas de los últimos 7 días - #3
Agent Reinforcement Trainer: entrena agentes multipaso para tareas del mundo real utilizando GRPO. Dale a tus agentes entrenamiento práctico. ¡Aprendizaje por refuerzo para Qwen3.6, GPT-OSS, Llama y más!
★ 10.689+10Variación de estrellas de los últimos 7 días - #4
https://adongwanai.github.io/AgentGuide | Guía de desarrollo de AI Agent | LangGraph en la práctica | RAG avanzado | Transición a LLM | Entrevistas de LLM | Ingeniero de algoritmos | Banco de preguntas de entrevistas | Aprendizaje por refuerzo | Síntesis de datos
★ 9116+169Variación de estrellas de los últimos 7 días - #5★ 6018+4Variación de estrellas de los últimos 7 días
- #6
OpenClaw-RL: Entrena cualquier agente simplemente hablando
★ 5665+7Variación de estrellas de los últimos 7 días - #7
Implementa un LLM de razonamiento en PyTorch desde cero, paso a paso
★ 5138+49Variación de estrellas de los últimos 7 días - #8
🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.
★ 4199+54Variación de estrellas de los últimos 7 días - #9
Skywork-R1V es una serie avanzada de modelos de IA multimodal desarrollada por Skywork AI, especializada en razonamiento de visión-lenguaje.
★ 3168+0Variación de estrellas de los últimos 7 días - #10
verl-agent es una extensión de veRL, diseñada para entrenar agentes LLM/VLM mediante RL. verl-agent es también el código oficial del artículo "Group-in-Group Policy Optimization for LLM Agent Training".
★ 2274+17Variación de estrellas de los últimos 7 días - #11
[ECCV 2026] MixGRPO: Desbloqueo de la eficiencia de GRPO basado en flujos con ODE-SDE mixtas
★ 1177+0Variación de estrellas de los últimos 7 días - #12
La pila de mejora continua para agentes. Nuestros datos de entorno y evaluaciones potencian la mejora y el monitoreo de agentes.
★ 1060+2Variación de estrellas de los últimos 7 días - #13
Framework de entrenamiento de aprendizaje por refuerzo multimodal para modelos de difusión y omnimodales
★ 955+60Variación de estrellas de los últimos 7 días - #14
🌾 OAT: Un marco de trabajo amigable para la investigación de alineación en línea de LLM, que incluye aprendizaje por refuerzo, aprendizaje de preferencias, etc.
★ 669-1Variación de estrellas de los últimos 7 días - #15
[NeurIPS 2025] AutoVLA: Un modelo de visión-lenguaje-acción para conducción autónoma de extremo a extremo con razonamiento adaptativo y ajuste fino por refuerzo.
★ 640+6Variación de estrellas de los últimos 7 días - #16
RLAnything (ICML 2026) y AutoTool (ICML 2026), DemyAgent: RL de código abierto para LLMs y escenarios de agentes
★ 632+9Variación de estrellas de los últimos 7 días - #17
Explora el momento "Aha" multimodal en un modelo de 2B.
★ 623+0Variación de estrellas de los últimos 7 días - #18
Un motor de aprendizaje por refuerzo asíncrono para el post-entrenamiento omnimodal a gran escala.
★ 591+10Variación de estrellas de los últimos 7 días - #19
Una lista curada de artículos sobre aprendizaje por refuerzo para la generación de video
★ 591+1Variación de estrellas de los últimos 7 días - #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Variación de estrellas de los últimos 7 días