Saltar al contenido principal
buildradar
Sign in
Tema · reinforcement-learning

reinforcement-learning

Repositorios de código abierto monitorizados etiquetados con reinforcement-learning, ordenados por estrellas.

305 repositorios
  • DI-drive@opendilab

    Plataforma de inteligencia de decisiones para la simulación de conducción autónoma.

    639+1Variación de estrellas de los últimos 7 días
  • mlimpl@vincen-github

    Este repositorio recopila códigos que encapsulan algoritmos de uso común en el campo del aprendizaje automático. La mayoría se basan en Numpy, Pandas o Torch. Puede profundizar su comprensión de los modelos y algoritmos relacionados o modificarlos para obtener código personalizado consultando este repositorio.

    635+0Variación de estrellas de los últimos 7 días
  • ma-gym@koulanurag

    Una colección de entornos multiagente basados en OpenAI gym.

    633+0Variación de estrellas de los últimos 7 días
  • virtualhome@xavierpuigf

    API para ejecutar VirtualHome, un simulador de hogar multi-agente

    632+2Variación de estrellas de los últimos 7 días
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) y AutoTool (ICML 2026), DemyAgent: RL de código abierto para LLMs y escenarios de agentes

    632+9Variación de estrellas de los últimos 7 días
  • robohive@vikashplus

    Un marco unificado para el aprendizaje de robots

    631+0Variación de estrellas de los últimos 7 días
  • Despliegue del proyecto walk-these-ways en Unitree Go2

    623+3Variación de estrellas de los últimos 7 días
  • VisualThinker-R1-Zero@turningpoint-ai

    Explora el momento "Aha" multimodal en un modelo de 2B.

    623+0Variación de estrellas de los últimos 7 días
  • DiffPhysDrone@HenryHuYu

    ¡Publicado en Nature Machine Intelligence! El primer robot real (cuadricóptero) basado en entrenamiento de física diferenciable.

    614+9Variación de estrellas de los últimos 7 días
  • ML-2021-notes@chsiang426

    Notas del curso Machine Learning 2021 Spring del profesor Hung-yi Lee de la Universidad Nacional de Taiwán (NTU)

    602+3Variación de estrellas de los últimos 7 días
  • recogdrive@xiaomi-research

    [ICLR 2026] ReCogDrive: Un framework cognitivo reforzado para la conducción autónoma de extremo a extremo

    599+4Variación de estrellas de los últimos 7 días
  • Artículos relacionados con el aprendizaje por refuerzo, incluyendo trabajos clásicos y los más recientes en conferencias de primer nivel

    595+0Variación de estrellas de los últimos 7 días
  • AAAI-2024-Papers@DmitryRyumin

    Artículos de AAAI 2024: Explore una colección completa de artículos de investigación innovadores presentados en una de las principales conferencias de inteligencia artificial. Integre fácilmente implementaciones de código para una mejor comprensión. ¡Experimente la vanguardia del progreso en inteligencia artificial con este repositorio!

    592+1Variación de estrellas de los últimos 7 días
  • Una lista curada de artículos sobre aprendizaje por refuerzo para la generación de video

    591+1Variación de estrellas de los últimos 7 días
  • Graph-R1@LHRLAB

    [ICML 2026] Recursos oficiales de "Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning".

    591+1Variación de estrellas de los últimos 7 días
  • Relax@redai-studio

    Un motor de aprendizaje por refuerzo asíncrono para el post-entrenamiento omnimodal a gran escala.

    591+11Variación de estrellas de los últimos 7 días
  • crafter@danijar

    Evaluación comparativa del espectro de capacidades de los agentes.

    586+0Variación de estrellas de los últimos 7 días
  • safety-gymnasium@PKU-Alignment

    NeurIPS 2023: Safety-Gymnasium: un benchmark unificado para el aprendizaje por refuerzo seguro.

    580+1Variación de estrellas de los últimos 7 días
  • OmniDrones@btx0424
    578+3Variación de estrellas de los últimos 7 días
  • TextRL@voidful

    Implementación de RLHF (aprendizaje por refuerzo con retroalimentación humana) de ChatGPT en cualquier modelo generativo de los transformers de huggingface (blommz-176B/bloom/gpt/bart/T5/MetaICL).

    564+0Variación de estrellas de los últimos 7 días
  • Aprendizaje por refuerzo profundo (PPO) en conducción autónoma (Carla) [desde cero].

    563-1Variación de estrellas de los últimos 7 días
  • Meta Agents Research Environments es una plataforma integral diseñada para evaluar agentes de IA en escenarios dinámicos y realistas. A diferencia de los benchmarks estáticos, esta plataforma introduce entornos en evolución donde los agentes deben adaptar sus estrategias a medida que hay nueva información disponible, reflejando desafíos del mundo real.

    551+3Variación de estrellas de los últimos 7 días
  • awesome-ai@hades217

    Una lista seleccionada de recursos de inteligencia artificial (cursos, herramientas, aplicaciones, proyectos de código abierto).

    548-1Variación de estrellas de los últimos 7 días
  • ReasonFlux@Gen-Verse

    [NeurIPS 2025 Spotlight] Suite de post-entrenamiento para LLM, que incluye ReasonFlux, ReasonFlux-PRM y ReasonFlux-Coder.

    542+0Variación de estrellas de los últimos 7 días
  • flybody@TuragaLab

    Modelo de cuerpo de mosca de la fruta para MuJoCo y tareas de RL de locomoción

    539+2Variación de estrellas de los últimos 7 días
  • umi-on-legs@real-stanford

    UMI on Legs: haciendo que las políticas de manipulación sean móviles con controladores de cuerpo completo centrados en la manipulación

    536+3Variación de estrellas de los últimos 7 días
  • Lista curada de cursos de ingeniería de aprendizaje automático de acceso público de CalTech, Columbia, Berkeley, MIT y Stanford.

    535+1Variación de estrellas de los últimos 7 días
  • morl-baselines@LucasAlegre

    Implementaciones de algoritmos de aprendizaje por refuerzo multiobjetivo.

    533+1Variación de estrellas de los últimos 7 días
  • InterMimic@Sirui-Xu

    [CVPR 2025 Highlight] InterMimic: Hacia un control universal de cuerpo completo para interacciones humano-objeto basadas en física

    528+1Variación de estrellas de los últimos 7 días
  • gym-mtsim@AminHP

    Un simulador de propósito general, flexible y fácil de usar junto con un entorno de trading de OpenAI Gym para la plataforma MetaTrader 5 (aprobado por OpenAI Gym)

    524+0Variación de estrellas de los últimos 7 días
← Volver a temas