rl
Repositorios de código abierto monitorizados etiquetados con rl, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a rl en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con rl.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Comunidad de Llama en chino, recopila en tiempo real los últimos materiales de estudio de Llama, construye el mejor ecosistema de código abierto para el modelo grande Llama en chino, totalmente de código abierto y comercializable
★ 14.740+1Variación de estrellas de los últimos 7 días - #2★ 10.945+11Variación de estrellas de los últimos 7 días
- #3
Dopamine es un framework de investigación para la creación rápida de prototipos de algoritmos de aprendizaje por refuerzo.
★ 10.901+4Variación de estrellas de los últimos 7 días - #4
Agent Reinforcement Trainer: entrena agentes multipaso para tareas del mundo real utilizando GRPO. Dale a tus agentes entrenamiento práctico. ¡Aprendizaje por refuerzo para Qwen3.6, GPT-OSS, Llama y más!
★ 10.679+57Variación de estrellas de los últimos 7 días - #5★ 5703+19Variación de estrellas de los últimos 7 días
- #6
EasyR1: Un framework de entrenamiento de RL multimodal, eficiente y escalable basado en veRL
★ 5136+10Variación de estrellas de los últimos 7 días - #7
🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.
★ 4145+94Variación de estrellas de los últimos 7 días - #8
agent-sandbox permite una gestión sencilla de cargas de trabajo aisladas, con estado y de instancia única, ideales para casos de uso como entornos de ejecución de agentes de IA y aprendizaje por refuerzo (RL).
★ 3678+92Variación de estrellas de los últimos 7 días - #9
Una implementación del algoritmo AlphaZero para Gomoku (también llamado Gobang o Cinco en línea)
★ 3625+2Variación de estrellas de los últimos 7 días - #10
Una biblioteca de PyTorch modular, enfocada en primitivas y nativa de Python para el aprendizaje por refuerzo (Reinforcement Learning).
★ 3540+12Variación de estrellas de los últimos 7 días - #11
Un framework de entrenamiento para agentes de aprendizaje por refuerzo de Stable Baselines3, con optimización de hiperparámetros y agentes pre-entrenados incluidos.
★ 2872+3Variación de estrellas de los últimos 7 días - #12
Implementación de papers en 100 líneas de código.
★ 2867+8Variación de estrellas de los últimos 7 días - #13
MuZero
★ 2863+4Variación de estrellas de los últimos 7 días - #14
Una encuesta sobre aprendizaje por refuerzo para grandes modelos de razonamiento
★ 2481+2Variación de estrellas de los últimos 7 días - #15
Implementación de todos los algoritmos de RL de una manera más sencilla.
★ 1922+7Variación de estrellas de los últimos 7 días - #16★ 1872+3Variación de estrellas de los últimos 7 días
- #17
[ICLR 2026] SimpleVLA-RL: Escalado del entrenamiento de VLA mediante aprendizaje por refuerzo.
★ 1839+9Variación de estrellas de los últimos 7 días - #18
Últimos avances en razonamiento System-2
★ 1353+1Variación de estrellas de los últimos 7 días - #19
Entendiendo el entrenamiento tipo R1-Zero: una perspectiva crítica.
★ 1274+1Variación de estrellas de los últimos 7 días - #20
🎓 Curso sistemático de construcción de modelos de lenguaje extensos | 🛠️ Cubre ingeniería de datos de preentrenamiento, Tokenizer, Transformer, MoE, programación de GPU (CUDA/Triton), entrenamiento distribuido, leyes de escala, optimización de inferencia y alineación (SFT/RLHF/GRPO) | 🚀 6 tareas progresivas + impulsadas por código para establecer un sistema de conocimiento full-stack de LLM
★ 1260+22Variación de estrellas de los últimos 7 días - #21★ 1121+5Variación de estrellas de los últimos 7 días
- #22★ 1111+3Variación de estrellas de los últimos 7 días
- #23★ 1080+8Variación de estrellas de los últimos 7 días
- #24
La pila de mejora continua para agentes. Nuestros datos de entorno y evaluaciones potencian la mejora y el monitoreo de agentes.
★ 1058+1Variación de estrellas de los últimos 7 días - #25
Tensorlake es un runtime serverless para sandboxes y despliegue de aplicaciones de agentes en segundo plano
★ 995+1Variación de estrellas de los últimos 7 días - #26
Sistemas de inteligencia de riesgos nativos de IA, OpenDeRisk: su gestor inteligente de riesgos del sistema de aplicaciones proporciona protección integral y profunda las 24 horas del día, los 7 días de la semana.
★ 968+3Variación de estrellas de los últimos 7 días - #27
Biblioteca de Python para aprendizaje por refuerzo.
★ 944+1Variación de estrellas de los últimos 7 días - #28
AI-Compass guía a la comunidad a través del océano de la tecnología de IA, ofreciendo rutas para principiantes y desarrolladores avanzados. Su objetivo es ayudar a los desarrolladores a comprender sistemáticamente los conceptos centrales, las tecnologías principales y las tendencias de vanguardia de la IA, dominando el proceso desde la teoría hasta la implementación práctica.
★ 926+12Variación de estrellas de los últimos 7 días - #29
Plataforma de robot humanoide de código abierto impresa en 3D para sim-to-real y aprendizaje por refuerzo (RL).
★ 820+1Variación de estrellas de los últimos 7 días - #30
MobileGym: Una plataforma de simulación verificable y altamente paralela para la investigación de agentes de GUI móvil · Simulador de Android alojado en navegador · Evaluación verificable · Entrenamiento de RL en línea escalable
★ 777+10Variación de estrellas de los últimos 7 días