reinforcement-learning
Repositorios de código abierto monitorizados etiquetados con reinforcement-learning, ordenados por estrellas.
- #241
Una colección de artículos recientes sobre la creación de agentes autónomos. Incluye dos temas: agentes basados en RL y basados en LLM.
★ 758+1Variación de estrellas de los últimos 7 días - #242★ 737+2Variación de estrellas de los últimos 7 días
- #243
Paquete contrib para Stable-Baselines3: código experimental de aprendizaje por refuerzo (RL)
★ 736+4Variación de estrellas de los últimos 7 días - #244
Proyecto sobre algoritmos de evasión de obstáculos autónomos para UAV mediante aprendizaje por refuerzo profundo.
★ 730+2Variación de estrellas de los últimos 7 días - #245★ 730+1Variación de estrellas de los últimos 7 días
- #246
Código complementario para la publicación en Nature "Discovering State-of-the-art Reinforcement Algorithms"
★ 728+1Variación de estrellas de los últimos 7 días - #247★ 726+0Variación de estrellas de los últimos 7 días
- #248
Lista curada de recursos sobre aprendizaje por refuerzo (RL) de exploración (actualizada continuamente)
★ 723+0Variación de estrellas de los últimos 7 días - #249
Código para el artículo "Optimización de descarga de computación para computación de borde móvil asistida por UAV: un enfoque de gradiente de política determinista profundo"
★ 722+0Variación de estrellas de los últimos 7 días - #250
Entorno de póker Texas Hold'em para OpenAI Gym con aprendizaje por refuerzo basado en keras-rl. Incluye renderizado virtual y Monte Carlo para el cálculo de equity.
★ 722+1Variación de estrellas de los últimos 7 días - #251
Motor de póquer para el desarrollo de IA de póquer en Python
★ 722+0Variación de estrellas de los últimos 7 días - #252
[COLM’25] DeepRetrieval — 🔥 Entrenamiento de agentes de búsqueda mediante RLVR con resultados de recuperación
★ 718+0Variación de estrellas de los últimos 7 días - #253
Lista curada de artículos sobre búsqueda en árbol de Monte Carlo con implementaciones.
★ 715+1Variación de estrellas de los últimos 7 días - #254
Plataforma de investigación de IA para aprendizaje por refuerzo a partir de imágenes panorámicas reales.
★ 714+2Variación de estrellas de los últimos 7 días - #255
Aprendizaje por refuerzo con control predictivo basado en modelos.
★ 710+0Variación de estrellas de los últimos 7 días - #256
Algoritmos MARL ajustados en SMAC (100% de tasa de victorias en la mayoría de los escenarios)
★ 708+0Variación de estrellas de los últimos 7 días - #257
Una colección completa de recursos sobre modelos de lenguaje visual, incluyendo artículos y repositorios de modelos. Actualización continua.
★ 706+5Variación de estrellas de los últimos 7 días - #258
ns3-gym: el entorno de pruebas para aprendizaje por refuerzo en investigación de redes.
★ 692+1Variación de estrellas de los últimos 7 días - #259
Un marco unificado para el aprendizaje por refuerzo sencillo en modelos de Flow-Matching
★ 690+6Variación de estrellas de los últimos 7 días - #260
Implementación de algoritmos de Aprendizaje por Refuerzo Inverso (IRL) en Python/Tensorflow. Deep MaxEnt, MaxEnt, LPIRL.
★ 681+2Variación de estrellas de los últimos 7 días - #261
Simulador de Hearthstone desarrollado en C++ con aprendizaje por refuerzo
★ 680+2Variación de estrellas de los últimos 7 días - #262
Un framework de C++ para MDP y POMDP con bindings para Python.
★ 671+1Variación de estrellas de los últimos 7 días - #263
Una biblioteca de PyTorch para crear agentes de aprendizaje por refuerzo profundo.
★ 657+1Variación de estrellas de los últimos 7 días - #264
BenchMARL es una biblioteca para realizar evaluaciones comparativas de aprendizaje por refuerzo multiagente (MARL). BenchMARL permite comparar rápidamente diferentes algoritmos, tareas y modelos de MARL, basándose sistemáticamente en sus dos principios fundamentales: reproducibilidad y estandarización.
★ 656+0Variación de estrellas de los últimos 7 días - #265
Ciclo de vida completo de un proyecto de ciencia de datos
★ 653+0Variación de estrellas de los últimos 7 días - #266
Un paquete de aprendizaje por refuerzo para Julia
★ 652+1Variación de estrellas de los últimos 7 días - #267
Últimos avances en razonamiento de cadena de pensamiento larga (Long Chain-of-Thought)
★ 647+0Variación de estrellas de los últimos 7 días - #268★ 643+2Variación de estrellas de los últimos 7 días
- #269
Página del proyecto para "Seg-Zero: Segmentación guiada por cadena de razonamiento mediante refuerzo cognitivo"
★ 639+1Variación de estrellas de los últimos 7 días - #270
Plataforma de inteligencia de decisiones para la simulación de conducción autónoma.
★ 639+0Variación de estrellas de los últimos 7 días