Saltar al contenido principal
buildradar
Sign in
Tema · rl

rl

Repositorios de código abierto monitorizados etiquetados con rl, ordenados por estrellas.

46 repositorios
  • mobilegym@Purewhiter

    MobileGym: Una plataforma de simulación verificable y altamente paralela para la investigación de agentes de GUI móvil · Simulador de Android alojado en navegador · Evaluación verificable · Entrenamiento de RL en línea escalable

    785+9Variación de estrellas de los últimos 7 días
  • stable-baselines3-contrib@Stable-Baselines-Team

    Paquete contrib para Stable-Baselines3: código experimental de aprendizaje por refuerzo (RL)

    736+5Variación de estrellas de los últimos 7 días
  • Lista curada de artículos sobre búsqueda en árbol de Monte Carlo con implementaciones.

    715+1Variación de estrellas de los últimos 7 días
  • Matterport3DSimulator@peteanderson80

    Plataforma de investigación de IA para aprendizaje por refuerzo a partir de imágenes panorámicas reales.

    714+2Variación de estrellas de los últimos 7 días
  • dr-tulu@rlresearch

    Repositorio oficial de DR Tulu: Aprendizaje por refuerzo con rúbricas evolutivas para investigación profunda.

    703+3Variación de estrellas de los últimos 7 días
  • irl-imitation@yrlu

    Implementación de algoritmos de Aprendizaje por Refuerzo Inverso (IRL) en Python/Tensorflow. Deep MaxEnt, MaxEnt, LPIRL.

    681+2Variación de estrellas de los últimos 7 días
  • RosettaStone@utilForever

    Simulador de Hearthstone desarrollado en C++ con aprendizaje por refuerzo

    680+1Variación de estrellas de los últimos 7 días
  • BenchMARL@facebookresearch

    BenchMARL es una biblioteca para realizar evaluaciones comparativas de aprendizaje por refuerzo multiagente (MARL). BenchMARL permite comparar rápidamente diferentes algoritmos, tareas y modelos de MARL, basándose sistemáticamente en sus dos principios fundamentales: reproducibilidad y estandarización.

    656+2Variación de estrellas de los últimos 7 días
  • Últimos avances en razonamiento de cadena de pensamiento larga (Long Chain-of-Thought)

    647-1Variación de estrellas de los últimos 7 días
  • WebShop@princeton-nlp

    [NeurIPS 2022] WebShop: Hacia una interacción web real y escalable con agentes de lenguaje fundamentados

    589+3Variación de estrellas de los últimos 7 días
  • Implementaciones de ROS2-Control para robots cuadrúpedos, incluyendo sim2real.

    566+3Variación de estrellas de los últimos 7 días
  • Meta Agents Research Environments es una plataforma integral diseñada para evaluar agentes de IA en escenarios dinámicos y realistas. A diferencia de los benchmarks estáticos, esta plataforma introduce entornos en evolución donde los agentes deben adaptar sus estrategias a medida que hay nueva información disponible, reflejando desafíos del mundo real.

    550+3Variación de estrellas de los últimos 7 días
  • morl-baselines@LucasAlegre

    Implementaciones de algoritmos de aprendizaje por refuerzo multiobjetivo.

    533+1Variación de estrellas de los últimos 7 días
  • DeepThinkVLA@OpenBMB

    DeepThinkVLA: Mejora de la capacidad de razonamiento de los modelos de visión-lenguaje-acción.

    529+0Variación de estrellas de los últimos 7 días
  • gem@axon-rl

    Un entorno de entrenamiento (Gym) para LLMs agentes

    506+1Variación de estrellas de los últimos 7 días
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Variación de estrellas de los últimos 7 días
← Volver a temas