rl
Repositorios de código abierto monitorizados etiquetados con rl, ordenados por estrellas.
- #31
MobileGym: Una plataforma de simulación verificable y altamente paralela para la investigación de agentes de GUI móvil · Simulador de Android alojado en navegador · Evaluación verificable · Entrenamiento de RL en línea escalable
★ 785+9Variación de estrellas de los últimos 7 días - #32
Paquete contrib para Stable-Baselines3: código experimental de aprendizaje por refuerzo (RL)
★ 736+5Variación de estrellas de los últimos 7 días - #33
Lista curada de artículos sobre búsqueda en árbol de Monte Carlo con implementaciones.
★ 715+1Variación de estrellas de los últimos 7 días - #34
Plataforma de investigación de IA para aprendizaje por refuerzo a partir de imágenes panorámicas reales.
★ 714+2Variación de estrellas de los últimos 7 días - #35
Repositorio oficial de DR Tulu: Aprendizaje por refuerzo con rúbricas evolutivas para investigación profunda.
★ 703+3Variación de estrellas de los últimos 7 días - #36
Implementación de algoritmos de Aprendizaje por Refuerzo Inverso (IRL) en Python/Tensorflow. Deep MaxEnt, MaxEnt, LPIRL.
★ 681+2Variación de estrellas de los últimos 7 días - #37
Simulador de Hearthstone desarrollado en C++ con aprendizaje por refuerzo
★ 680+1Variación de estrellas de los últimos 7 días - #38
BenchMARL es una biblioteca para realizar evaluaciones comparativas de aprendizaje por refuerzo multiagente (MARL). BenchMARL permite comparar rápidamente diferentes algoritmos, tareas y modelos de MARL, basándose sistemáticamente en sus dos principios fundamentales: reproducibilidad y estandarización.
★ 656+2Variación de estrellas de los últimos 7 días - #39
Últimos avances en razonamiento de cadena de pensamiento larga (Long Chain-of-Thought)
★ 647-1Variación de estrellas de los últimos 7 días - #40
[NeurIPS 2022] WebShop: Hacia una interacción web real y escalable con agentes de lenguaje fundamentados
★ 589+3Variación de estrellas de los últimos 7 días - #41
Implementaciones de ROS2-Control para robots cuadrúpedos, incluyendo sim2real.
★ 566+3Variación de estrellas de los últimos 7 días - #42
Meta Agents Research Environments es una plataforma integral diseñada para evaluar agentes de IA en escenarios dinámicos y realistas. A diferencia de los benchmarks estáticos, esta plataforma introduce entornos en evolución donde los agentes deben adaptar sus estrategias a medida que hay nueva información disponible, reflejando desafíos del mundo real.
★ 550+3Variación de estrellas de los últimos 7 días - #43
Implementaciones de algoritmos de aprendizaje por refuerzo multiobjetivo.
★ 533+1Variación de estrellas de los últimos 7 días - #44
DeepThinkVLA: Mejora de la capacidad de razonamiento de los modelos de visión-lenguaje-acción.
★ 529+0Variación de estrellas de los últimos 7 días - #45★ 506+1Variación de estrellas de los últimos 7 días
- #46
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Variación de estrellas de los últimos 7 días