Saltar al contenido principal
buildradar
Sign in
Tema · rl

rl

Repositorios de código abierto monitorizados etiquetados con rl, ordenados por estrellas.

Repositorios
45
Estrellas totales
111.909
Estrellas de media
2487
Proporción
0,01%

Temas que aparecen con frecuencia junto a rl en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con rl.

No hay repositorios nuevos con este tema en los últimos 90 días.

  • Llama-Chinese@LlamaChinese

    Comunidad de Llama en chino, recopila en tiempo real los últimos materiales de estudio de Llama, construye el mejor ecosistema de código abierto para el modelo grande Llama en chino, totalmente de código abierto y comercializable

    14.740+1Variación de estrellas de los últimos 7 días
  • tianshou@thu-ml

    Una elegante librería de aprendizaje por refuerzo profundo en PyTorch.

    10.945+11Variación de estrellas de los últimos 7 días
  • dopamine@google

    Dopamine es un framework de investigación para la creación rápida de prototipos de algoritmos de aprendizaje por refuerzo.

    10.901+4Variación de estrellas de los últimos 7 días
  • ART@OpenPipe

    Agent Reinforcement Trainer: entrena agentes multipaso para tareas del mundo real utilizando GRPO. Dale a tus agentes entrenamiento práctico. ¡Aprendizaje por refuerzo para Qwen3.6, GPT-OSS, Llama y más!

    10.679+57Variación de estrellas de los últimos 7 días
  • AReaL@areal-project

    El puente de RL para aplicaciones de agentes basados en LLM. Simple y flexible.

    5703+19Variación de estrellas de los últimos 7 días
  • EasyR1@hiyouga

    EasyR1: Un framework de entrenamiento de RL multimodal, eficiente y escalable basado en veRL

    5136+10Variación de estrellas de los últimos 7 días
  • hands-on-modern-rl@walkinglabs

    🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.

    4145+94Variación de estrellas de los últimos 7 días
  • agent-sandbox@kubernetes-sigs

    agent-sandbox permite una gestión sencilla de cargas de trabajo aisladas, con estado y de instancia única, ideales para casos de uso como entornos de ejecución de agentes de IA y aprendizaje por refuerzo (RL).

    3678+92Variación de estrellas de los últimos 7 días
  • AlphaZero_Gomoku@junxiaosong

    Una implementación del algoritmo AlphaZero para Gomoku (también llamado Gobang o Cinco en línea)

    3625+2Variación de estrellas de los últimos 7 días
  • rl@pytorch

    Una biblioteca de PyTorch modular, enfocada en primitivas y nativa de Python para el aprendizaje por refuerzo (Reinforcement Learning).

    3540+12Variación de estrellas de los últimos 7 días
  • Un framework de entrenamiento para agentes de aprendizaje por refuerzo de Stable Baselines3, con optimización de hiperparámetros y agentes pre-entrenados incluidos.

    2872+3Variación de estrellas de los últimos 7 días
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    Implementación de papers en 100 líneas de código.

    2867+8Variación de estrellas de los últimos 7 días
  • muzero-general@werner-duvaud

    MuZero

    2863+4Variación de estrellas de los últimos 7 días
  • Awesome-RL-for-LRMs@TsinghuaC3I

    Una encuesta sobre aprendizaje por refuerzo para grandes modelos de razonamiento

    2481+2Variación de estrellas de los últimos 7 días
  • all-rl-algorithms@FareedKhan-dev

    Implementación de todos los algoritmos de RL de una manera más sencilla.

    1922+7Variación de estrellas de los últimos 7 días
  • PRIME@PRIME-RL

    Solución de RL escalable para el razonamiento avanzado de modelos de lenguaje.

    1872+3Variación de estrellas de los últimos 7 días
  • SimpleVLA-RL@PRIME-RL

    [ICLR 2026] SimpleVLA-RL: Escalado del entrenamiento de VLA mediante aprendizaje por refuerzo.

    1839+9Variación de estrellas de los últimos 7 días
  • Últimos avances en razonamiento System-2

    1353+1Variación de estrellas de los últimos 7 días
  • understand-r1-zero@sail-sg

    Entendiendo el entrenamiento tipo R1-Zero: una perspectiva crítica.

    1274+1Variación de estrellas de los últimos 7 días
  • diy-llm@datawhalechina

    🎓 Curso sistemático de construcción de modelos de lenguaje extensos | 🛠️ Cubre ingeniería de datos de preentrenamiento, Tokenizer, Transformer, MoE, programación de GPU (CUDA/Triton), entrenamiento distribuido, leyes de escala, optimización de inferencia y alineación (SFT/RLHF/GRPO) | 🚀 6 tareas progresivas + impulsadas por código para establecer un sistema de conocimiento full-stack de LLM

    1260+22Variación de estrellas de los últimos 7 días
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL: Aprendizaje por refuerzo en tiempo de prueba

    1121+5Variación de estrellas de los últimos 7 días
  • ARPO@RUC-NLPIR

    [ICLR 2026] Optimización de políticas reforzadas por agentes (ARPO)

    1111+3Variación de estrellas de los últimos 7 días
  • SDPO@lasgroup

    Aprendizaje por refuerzo mediante autodestilación (SDPO)

    1080+8Variación de estrellas de los últimos 7 días
  • judgeval@JudgmentLabs

    La pila de mejora continua para agentes. Nuestros datos de entorno y evaluaciones potencian la mejora y el monitoreo de agentes.

    1058+1Variación de estrellas de los últimos 7 días
  • tensorlake@tensorlakeai

    Tensorlake es un runtime serverless para sandboxes y despliegue de aplicaciones de agentes en segundo plano

    995+1Variación de estrellas de los últimos 7 días
  • OpenDerisk@derisk-ai

    Sistemas de inteligencia de riesgos nativos de IA, OpenDeRisk: su gestor inteligente de riesgos del sistema de aplicaciones proporciona protección integral y profunda las 24 horas del día, los 7 días de la semana.

    968+3Variación de estrellas de los últimos 7 días
  • mushroom-rl@MushroomRL

    Biblioteca de Python para aprendizaje por refuerzo.

    944+1Variación de estrellas de los últimos 7 días
  • AI-Compass@tingaicompass

    AI-Compass guía a la comunidad a través del océano de la tecnología de IA, ofreciendo rutas para principiantes y desarrolladores avanzados. Su objetivo es ayudar a los desarrolladores a comprender sistemáticamente los conceptos centrales, las tecnologías principales y las tendencias de vanguardia de la IA, dominando el proceso desde la teoría hasta la implementación práctica.

    926+12Variación de estrellas de los últimos 7 días
  • zeroth-bot@zeroth-robotics

    Plataforma de robot humanoide de código abierto impresa en 3D para sim-to-real y aprendizaje por refuerzo (RL).

    820+1Variación de estrellas de los últimos 7 días
  • mobilegym@Purewhiter

    MobileGym: Una plataforma de simulación verificable y altamente paralela para la investigación de agentes de GUI móvil · Simulador de Android alojado en navegador · Evaluación verificable · Entrenamiento de RL en línea escalable

    777+10Variación de estrellas de los últimos 7 días
← Volver a temas