Saltar al contenido principal
buildradar
Sign in
Tema · reinforcement-learning

reinforcement-learning

Repositorios de código abierto monitorizados etiquetados con reinforcement-learning, ordenados por estrellas.

304 repositorios
  • ReCall@Agent-RL

    ReSearch: Aprendizaje para razonar con búsqueda para LLMs mediante aprendizaje por refuerzo y ReCall: Aprendizaje para razonar con llamadas a herramientas para LLMs mediante aprendizaje por refuerzo

    1432+1Variación de estrellas de los últimos 7 días
  • Algoritmos concisos y elegantes escritos en Julia

    1426+0Variación de estrellas de los últimos 7 días
  • Una lista curada de recursos excelentes sobre aprendizaje por refuerzo basado en modelos (actualizada continuamente)

    1393+0Variación de estrellas de los últimos 7 días
  • rl_games@Denys88

    Implementaciones de RL.

    1385+2Variación de estrellas de los últimos 7 días
  • OpenCat-Old@PetoiCamp

    Un gato robótico programable y altamente maniobrable para educación STEM y servicios mejorados con IA.

    1372+1Variación de estrellas de los últimos 7 días
  • smac@oxwhirl

    SMAC: El desafío multiagente de StarCraft.

    1367+1Variación de estrellas de los últimos 7 días
  • DRL-robot-navigation@reiniscimurs

    Aprendizaje por refuerzo profundo para la navegación de robots móviles en el simulador ROS Gazebo. Utilizando la red neuronal Twin Delayed Deep Deterministic Policy Gradient (TD3), un robot aprende a navegar hacia un punto objetivo aleatorio en un entorno simulado mientras evita obstáculos.

    1362+2Variación de estrellas de los últimos 7 días
  • SLM-Lab@kengz

    Framework modular de aprendizaje por refuerzo profundo en PyTorch. Biblioteca complementaria del libro "Foundations of Deep Reinforcement Learning"

    1362+0Variación de estrellas de los últimos 7 días
  • Popular-RL-Algorithms@quantumiracle

    Implementación en PyTorch de Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet..

    1359+1Variación de estrellas de los últimos 7 días
  • agent-apprenticeship@ray-r-ren

    Ecosistema vivo donde los agentes de IA completan tareas a través de bucles de flujo de trabajo, mejoran mediante ejecución iterativa, son evaluados por agentes mentores o humanos, y convierten el trabajo completado en experiencia laboral reutilizable y datos para mejorar futuros agentes.

    1334+0Variación de estrellas de los últimos 7 días
  • Implementaciones mínimas de Deep Q Learning (DQN y DDQN) en Keras

    1329+1Variación de estrellas de los últimos 7 días
  • Minari@Farama-Foundation

    Un formato estándar para conjuntos de datos de aprendizaje por refuerzo offline, con conjuntos de datos de referencia populares y utilidades relacionadas.

    1294+3Variación de estrellas de los últimos 7 días
  • Learning-Deep-Learning@patrick-llgc

    Notas de lectura sobre Deep Learning y Machine Learning

    1270+0Variación de estrellas de los últimos 7 días
  • PPO-for-Beginners@ericyangyu

    Una implementación de PPO simple y bien estructurada. Basada en mi serie de Medium: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.

    1269+1Variación de estrellas de los últimos 7 días
  • android_env@google-deepmind

    Investigación de aprendizaje por refuerzo en dispositivos Android.

    1240+0Variación de estrellas de los últimos 7 días
  • alphagen@ICT-FinD-Lab

    Generación de conjuntos de factores bursátiles alfa (predictivos) mediante aprendizaje por refuerzo.

    1213+8Variación de estrellas de los últimos 7 días
  • LearningHumanoidWalking@rohanpsingh

    Entrenamiento de un robot humanoide para la locomoción mediante aprendizaje por refuerzo

    1210+3Variación de estrellas de los últimos 7 días
  • Notas de clase, tareas de tutoriales con soluciones y videos en línea para el curso de aprendizaje por refuerzo de la Universidad de Paderborn.

    1192+1Variación de estrellas de los últimos 7 días
  • flow@flow-project

    Framework computacional para el aprendizaje por refuerzo en el control de tráfico

    1188+0Variación de estrellas de los últimos 7 días
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: Desbloqueo de la eficiencia de GRPO basado en flujos con ODE-SDE mixtas

    1177+0Variación de estrellas de los últimos 7 días
  • Gym@NVIDIA-NeMo

    Evalúe y mejore modelos y agentes utilizando entornos.

    1155+7Variación de estrellas de los últimos 7 días
  • SimplerEnv@simpler-env

    Evaluación y reproducción de políticas de manipulación robótica del mundo real (ej. RT-1, RT-1-X, Octo) en simulación bajo configuraciones comunes (ej. Google Robot, WidowX+Bridge) (CoRL 2024)

    1153+3Variación de estrellas de los últimos 7 días
  • omnisafe@PKU-Alignment

    JMLR: OmniSafe es un marco de infraestructura para acelerar la investigación en SafeRL.

    1150+1Variación de estrellas de los últimos 7 días
  • evotorch@nnaisense

    Biblioteca avanzada de computación evolutiva construida directamente sobre PyTorch, creada en NNAISENSE.

    1144+1Variación de estrellas de los últimos 7 días
  • SMARTS@huawei-noah

    Escuela de entrenamiento de aprendizaje por refuerzo multi-agente escalable para conducción autónoma.

    1134+0Variación de estrellas de los últimos 7 días
  • :computer: Aprende a hacer que las máquinas aprendan para que no tengas que esforzarte en programarlas; La lista definitiva

    1128+0Variación de estrellas de los últimos 7 días
  • ir-sim@hanruihua

    Un simulador de robots ligero basado en Python diseñado para navegación, control y aprendizaje

    1125+6Variación de estrellas de los últimos 7 días
  • ASE@nv-tlabs

    Embeddings de habilidades adversarias para entrenar controladores reutilizables en personajes simulados físicamente.

    1119+1Variación de estrellas de los últimos 7 días
  • ARPO@RUC-NLPIR

    [ICLR 2026] Optimización de políticas reforzadas por agentes (ARPO)

    1114+3Variación de estrellas de los últimos 7 días
  • SoundMind@xid32

    Presentamos el conjunto de datos Audio Logical Reasoning (ALR), que consta de 6,446 muestras anotadas de texto-audio diseñadas específicamente para tareas de razonamiento complejo. Basándonos en este recurso, proponemos SoundMind, un algoritmo de aprendizaje por refuerzo (RL) basado en reglas diseñado para dotar a los modelos de lenguaje de audio (ALM) de capacidades de razonamiento bimodal profundo.

    1113+0Variación de estrellas de los últimos 7 días
← Volver a temas