reinforcement-learning
Repositorios de código abierto monitorizados etiquetados con reinforcement-learning, ordenados por estrellas.
- #151
ReSearch: Aprendizaje para razonar con búsqueda para LLMs mediante aprendizaje por refuerzo y ReCall: Aprendizaje para razonar con llamadas a herramientas para LLMs mediante aprendizaje por refuerzo
★ 1432+1Variación de estrellas de los últimos 7 días - #152
Algoritmos concisos y elegantes escritos en Julia
★ 1426+0Variación de estrellas de los últimos 7 días - #153
Una lista curada de recursos excelentes sobre aprendizaje por refuerzo basado en modelos (actualizada continuamente)
★ 1393+0Variación de estrellas de los últimos 7 días - #154★ 1385+2Variación de estrellas de los últimos 7 días
- #155
Un gato robótico programable y altamente maniobrable para educación STEM y servicios mejorados con IA.
★ 1372+1Variación de estrellas de los últimos 7 días - #156★ 1367+1Variación de estrellas de los últimos 7 días
- #157
Aprendizaje por refuerzo profundo para la navegación de robots móviles en el simulador ROS Gazebo. Utilizando la red neuronal Twin Delayed Deep Deterministic Policy Gradient (TD3), un robot aprende a navegar hacia un punto objetivo aleatorio en un entorno simulado mientras evita obstáculos.
★ 1362+2Variación de estrellas de los últimos 7 días - #158
Framework modular de aprendizaje por refuerzo profundo en PyTorch. Biblioteca complementaria del libro "Foundations of Deep Reinforcement Learning"
★ 1362+0Variación de estrellas de los últimos 7 días - #159
Implementación en PyTorch de Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet..
★ 1359+1Variación de estrellas de los últimos 7 días - #160
Ecosistema vivo donde los agentes de IA completan tareas a través de bucles de flujo de trabajo, mejoran mediante ejecución iterativa, son evaluados por agentes mentores o humanos, y convierten el trabajo completado en experiencia laboral reutilizable y datos para mejorar futuros agentes.
★ 1334+0Variación de estrellas de los últimos 7 días - #161
Implementaciones mínimas de Deep Q Learning (DQN y DDQN) en Keras
★ 1329+1Variación de estrellas de los últimos 7 días - #162
Un formato estándar para conjuntos de datos de aprendizaje por refuerzo offline, con conjuntos de datos de referencia populares y utilidades relacionadas.
★ 1294+3Variación de estrellas de los últimos 7 días - #163
Notas de lectura sobre Deep Learning y Machine Learning
★ 1270+0Variación de estrellas de los últimos 7 días - #164
Una implementación de PPO simple y bien estructurada. Basada en mi serie de Medium: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.
★ 1269+1Variación de estrellas de los últimos 7 días - #165
Investigación de aprendizaje por refuerzo en dispositivos Android.
★ 1240+0Variación de estrellas de los últimos 7 días - #166
Generación de conjuntos de factores bursátiles alfa (predictivos) mediante aprendizaje por refuerzo.
★ 1213+8Variación de estrellas de los últimos 7 días - #167
Entrenamiento de un robot humanoide para la locomoción mediante aprendizaje por refuerzo
★ 1210+3Variación de estrellas de los últimos 7 días - #168
Notas de clase, tareas de tutoriales con soluciones y videos en línea para el curso de aprendizaje por refuerzo de la Universidad de Paderborn.
★ 1192+1Variación de estrellas de los últimos 7 días - #169★ 1188+0Variación de estrellas de los últimos 7 días
- #170
[ECCV 2026] MixGRPO: Desbloqueo de la eficiencia de GRPO basado en flujos con ODE-SDE mixtas
★ 1177+0Variación de estrellas de los últimos 7 días - #171★ 1155+7Variación de estrellas de los últimos 7 días
- #172
Evaluación y reproducción de políticas de manipulación robótica del mundo real (ej. RT-1, RT-1-X, Octo) en simulación bajo configuraciones comunes (ej. Google Robot, WidowX+Bridge) (CoRL 2024)
★ 1153+3Variación de estrellas de los últimos 7 días - #173
JMLR: OmniSafe es un marco de infraestructura para acelerar la investigación en SafeRL.
★ 1150+1Variación de estrellas de los últimos 7 días - #174
Biblioteca avanzada de computación evolutiva construida directamente sobre PyTorch, creada en NNAISENSE.
★ 1144+1Variación de estrellas de los últimos 7 días - #175
Escuela de entrenamiento de aprendizaje por refuerzo multi-agente escalable para conducción autónoma.
★ 1134+0Variación de estrellas de los últimos 7 días - #176
:computer: Aprende a hacer que las máquinas aprendan para que no tengas que esforzarte en programarlas; La lista definitiva
★ 1128+0Variación de estrellas de los últimos 7 días - #177
Un simulador de robots ligero basado en Python diseñado para navegación, control y aprendizaje
★ 1125+6Variación de estrellas de los últimos 7 días - #178
Embeddings de habilidades adversarias para entrenar controladores reutilizables en personajes simulados físicamente.
★ 1119+1Variación de estrellas de los últimos 7 días - #179★ 1114+3Variación de estrellas de los últimos 7 días
- #180
Presentamos el conjunto de datos Audio Logical Reasoning (ALR), que consta de 6,446 muestras anotadas de texto-audio diseñadas específicamente para tareas de razonamiento complejo. Basándonos en este recurso, proponemos SoundMind, un algoritmo de aprendizaje por refuerzo (RL) basado en reglas diseñado para dotar a los modelos de lenguaje de audio (ALM) de capacidades de razonamiento bimodal profundo.
★ 1113+0Variación de estrellas de los últimos 7 días