reinforcement-learning
Repositorios de código abierto monitorizados etiquetados con reinforcement-learning, ordenados por estrellas.
- #91
🤖 Guía de escuelas de verano de Machine Learning
★ 3033+3Variación de estrellas de los últimos 7 días - #92
Artículos de investigación de Deep Learning y aprendizaje por refuerzo profundo con algo de código
★ 3026+2Variación de estrellas de los últimos 7 días - #93
TF-Agents: Una librería de TensorFlow confiable, escalable y fácil de usar para bandidos contextuales y aprendizaje por refuerzo.
★ 3026+0Variación de estrellas de los últimos 7 días - #94★ 2960+82Variación de estrellas de los últimos 7 días
- #95
Un brazo humanoide totalmente de código abierto para la investigación de IA física y su implementación en entornos ricos en contacto.
★ 2919+23Variación de estrellas de los últimos 7 días - #96
Un framework de entrenamiento para agentes de aprendizaje por refuerzo de Stable Baselines3, con optimización de hiperparámetros y agentes pre-entrenados incluidos.
★ 2873+1Variación de estrellas de los últimos 7 días - #97
Implementación de papers en 100 líneas de código.
★ 2870+3Variación de estrellas de los últimos 7 días - #98
MuZero
★ 2865+2Variación de estrellas de los últimos 7 días - #99
Tutoriales simples y completos en TensorFlow
★ 2841+0Variación de estrellas de los últimos 7 días - #100
Una biblioteca de agentes de IA de nivel empresarial diseñada para democratizar la inteligencia artificial y ofrecer alternativas gratuitas y de código abierto a las startups sobrevaloradas de Y Combinator.
★ 2806+7Variación de estrellas de los últimos 7 días - #101
RAGEN aprovecha el aprendizaje por refuerzo para entrenar agentes de razonamiento de LLM en entornos interactivos y estocásticos.
★ 2786+6Variación de estrellas de los últimos 7 días - #102★ 2657+3Variación de estrellas de los últimos 7 días
- #103
Curso tutorial de DRL PPO x Family (Curso abierto de introducción a la inteligencia de decisiones: 8 lecciones para aclarar la teoría de algoritmos, ordenar la lógica del código y dominar la práctica de aplicaciones de IA de decisiones)
★ 2616+2Variación de estrellas de los últimos 7 días - #104
Artículos increíbles de Deep Learning para búsqueda, recomendación y publicidad industrial. Se centran en embedding, coincidencia, preclasificación, clasificación, posclasificación, relevancia, LLM y RL. Por favor cite nuestro artículo "Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives" (TOIS 2026).
★ 2589+0Variación de estrellas de los últimos 7 días - #105
robosuite: un marco de simulación modular y un punto de referencia para el aprendizaje de robots
★ 2586+4Variación de estrellas de los últimos 7 días - #106
Tutorial, encuesta y guía impresionante sobre LLM de razonamiento
★ 2533+6Variación de estrellas de los últimos 7 días - #107
Soluciones para Reinforcement Learning, An Introduction
★ 2433+3Variación de estrellas de los últimos 7 días - #108
Una biblioteca modular de RL para ajustar modelos de lenguaje según las preferencias humanas
★ 2395+1Variación de estrellas de los últimos 7 días - #109
El entorno de trading de OpenAI Gym más simple, flexible y completo (aprobado por OpenAI Gym)
★ 2387+0Variación de estrellas de los últimos 7 días - #110
Implementación mínima de Proximal Policy Optimization (PPO) con objetivo recortado en PyTorch
★ 2381+6Variación de estrellas de los últimos 7 días - #111
ProtoMotions es un framework de simulación y aprendizaje acelerado por GPU para entrenar humanos digitales y robots humanoides simulados físicamente.
★ 2359+10Variación de estrellas de los últimos 7 días - #112
ICCV2019 - Aprendiendo a pintar con aprendizaje por refuerzo profundo basado en modelos
★ 2308+2Variación de estrellas de los últimos 7 días - #113★ 2293+0Variación de estrellas de los últimos 7 días
- #114
Un conjunto ligero de métodos de imitación de movimiento para entrenar controladores.
★ 2280+15Variación de estrellas de los últimos 7 días - #115
verl-agent es una extensión de veRL, diseñada para entrenar agentes LLM/VLM mediante RL. verl-agent es también el código oficial del artículo "Group-in-Group Policy Optimization for LLM Agent Training".
★ 2274+17Variación de estrellas de los últimos 7 días - #116
Una colección de artículos clásicos de la industria y de vanguardia en el campo de la recomendación, publicidad y búsqueda.
★ 2188-1Variación de estrellas de los últimos 7 días - #117
Entornos PyBullet Gymnasium para aprendizaje por refuerzo de agentes individuales y múltiples en el control de cuadricópteros
★ 2119-2Variación de estrellas de los últimos 7 días - #118
[RSS 2025] "ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills"
★ 2107+3Variación de estrellas de los últimos 7 días - #119
DIAMOND (DIffusion As a Model Of eNvironment Dreams) es un agente de aprendizaje por refuerzo entrenado en un modelo de mundo de difusión. NeurIPS 2024 Spotlight.
★ 2100+1Variación de estrellas de los últimos 7 días - #120
Entornos de aprendizaje por refuerzo basados en el juego Doom de 1993 :godmode:
★ 2065+0Variación de estrellas de los últimos 7 días