Saltar al contenido principal
buildradar
Sign in
Tema · grpo

grpo

Repositorios de código abierto monitorizados etiquetados con grpo, ordenados por estrellas.

Repositorios
20
Estrellas totales
81.418
Estrellas de media
4071
Proporción
0,00%

Temas que aparecen con frecuencia junto a grpo en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con grpo.

No hay repositorios nuevos con este tema en los últimos 90 días.

  • ms-swift@modelscope

    Usa PEFT o parámetros completos para CPT/SFT/DPO/GRPO en más de 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) y más de 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).

    15.488+88Variación de estrellas de los últimos 7 días
  • AI-Research-SKILLs@Orchestra-Research

    Biblioteca integral de código abierto de habilidades de investigación e ingeniería de IA para cualquier modelo de IA. Empaqueta las habilidades y tu agente de claude code/codex/gemini será un agente de investigación de IA con toda su potencia. Mantenido por Orchestra Research.

    12.256+104Variación de estrellas de los últimos 7 días
  • ART@OpenPipe

    Agent Reinforcement Trainer: entrena agentes multipaso para tareas del mundo real utilizando GRPO. Dale a tus agentes entrenamiento práctico. ¡Aprendizaje por refuerzo para Qwen3.6, GPT-OSS, Llama y más!

    10.689+10Variación de estrellas de los últimos 7 días
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | Guía de desarrollo de AI Agent | LangGraph en la práctica | RAG avanzado | Transición a LLM | Entrevistas de LLM | Ingeniero de algoritmos | Banco de preguntas de entrevistas | Aprendizaje por refuerzo | Síntesis de datos

    9116+169Variación de estrellas de los últimos 7 días
  • VLM-R1@om-ai-lab

    Resuelve la comprensión visual con VLMs reforzados

    6018+4Variación de estrellas de los últimos 7 días
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: Entrena cualquier agente simplemente hablando

    5665+7Variación de estrellas de los últimos 7 días
  • reasoning-from-scratch@rasbt

    Implementa un LLM de razonamiento en PyTorch desde cero, paso a paso

    5138+49Variación de estrellas de los últimos 7 días
  • hands-on-modern-rl@walkinglabs

    🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.

    4199+54Variación de estrellas de los últimos 7 días
  • Skywork-R1V@SkyworkAI

    Skywork-R1V es una serie avanzada de modelos de IA multimodal desarrollada por Skywork AI, especializada en razonamiento de visión-lenguaje.

    3168+0Variación de estrellas de los últimos 7 días
  • verl-agent@langfengQ

    verl-agent es una extensión de veRL, diseñada para entrenar agentes LLM/VLM mediante RL. verl-agent es también el código oficial del artículo "Group-in-Group Policy Optimization for LLM Agent Training".

    2274+17Variación de estrellas de los últimos 7 días
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: Desbloqueo de la eficiencia de GRPO basado en flujos con ODE-SDE mixtas

    1177+0Variación de estrellas de los últimos 7 días
  • judgeval@JudgmentLabs

    La pila de mejora continua para agentes. Nuestros datos de entorno y evaluaciones potencian la mejora y el monitoreo de agentes.

    1060+2Variación de estrellas de los últimos 7 días
  • verl-omni@verl-project

    Framework de entrenamiento de aprendizaje por refuerzo multimodal para modelos de difusión y omnimodales

    955+60Variación de estrellas de los últimos 7 días
  • oat@sail-sg

    🌾 OAT: Un marco de trabajo amigable para la investigación de alineación en línea de LLM, que incluye aprendizaje por refuerzo, aprendizaje de preferencias, etc.

    669-1Variación de estrellas de los últimos 7 días
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA: Un modelo de visión-lenguaje-acción para conducción autónoma de extremo a extremo con razonamiento adaptativo y ajuste fino por refuerzo.

    640+6Variación de estrellas de los últimos 7 días
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) y AutoTool (ICML 2026), DemyAgent: RL de código abierto para LLMs y escenarios de agentes

    632+9Variación de estrellas de los últimos 7 días
  • VisualThinker-R1-Zero@turningpoint-ai

    Explora el momento "Aha" multimodal en un modelo de 2B.

    623+0Variación de estrellas de los últimos 7 días
  • Relax@redai-studio

    Un motor de aprendizaje por refuerzo asíncrono para el post-entrenamiento omnimodal a gran escala.

    591+10Variación de estrellas de los últimos 7 días
  • Una lista curada de artículos sobre aprendizaje por refuerzo para la generación de video

    591+1Variación de estrellas de los últimos 7 días
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Variación de estrellas de los últimos 7 días
← Volver a temas