reinforcement-learning
Repositorios de código abierto monitorizados etiquetados con reinforcement-learning, ordenados por estrellas.
- #271
Plataforma de inteligencia de decisiones para la simulación de conducción autónoma.
★ 639+1Variación de estrellas de los últimos 7 días - #272
Este repositorio recopila códigos que encapsulan algoritmos de uso común en el campo del aprendizaje automático. La mayoría se basan en Numpy, Pandas o Torch. Puede profundizar su comprensión de los modelos y algoritmos relacionados o modificarlos para obtener código personalizado consultando este repositorio.
★ 635+0Variación de estrellas de los últimos 7 días - #273★ 633+0Variación de estrellas de los últimos 7 días
- #274
API para ejecutar VirtualHome, un simulador de hogar multi-agente
★ 632+2Variación de estrellas de los últimos 7 días - #275
RLAnything (ICML 2026) y AutoTool (ICML 2026), DemyAgent: RL de código abierto para LLMs y escenarios de agentes
★ 632+9Variación de estrellas de los últimos 7 días - #276★ 631+0Variación de estrellas de los últimos 7 días
- #277
Despliegue del proyecto walk-these-ways en Unitree Go2
★ 623+3Variación de estrellas de los últimos 7 días - #278
Explora el momento "Aha" multimodal en un modelo de 2B.
★ 623+0Variación de estrellas de los últimos 7 días - #279
¡Publicado en Nature Machine Intelligence! El primer robot real (cuadricóptero) basado en entrenamiento de física diferenciable.
★ 614+9Variación de estrellas de los últimos 7 días - #280
Notas del curso Machine Learning 2021 Spring del profesor Hung-yi Lee de la Universidad Nacional de Taiwán (NTU)
★ 602+3Variación de estrellas de los últimos 7 días - #281
[ICLR 2026] ReCogDrive: Un framework cognitivo reforzado para la conducción autónoma de extremo a extremo
★ 599+4Variación de estrellas de los últimos 7 días - #282
Artículos relacionados con el aprendizaje por refuerzo, incluyendo trabajos clásicos y los más recientes en conferencias de primer nivel
★ 595+0Variación de estrellas de los últimos 7 días - #283
Artículos de AAAI 2024: Explore una colección completa de artículos de investigación innovadores presentados en una de las principales conferencias de inteligencia artificial. Integre fácilmente implementaciones de código para una mejor comprensión. ¡Experimente la vanguardia del progreso en inteligencia artificial con este repositorio!
★ 592+1Variación de estrellas de los últimos 7 días - #284
Una lista curada de artículos sobre aprendizaje por refuerzo para la generación de video
★ 591+1Variación de estrellas de los últimos 7 días - #285
[ICML 2026] Recursos oficiales de "Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning".
★ 591+1Variación de estrellas de los últimos 7 días - #286
Un motor de aprendizaje por refuerzo asíncrono para el post-entrenamiento omnimodal a gran escala.
★ 591+11Variación de estrellas de los últimos 7 días - #287★ 586+0Variación de estrellas de los últimos 7 días
- #288
NeurIPS 2023: Safety-Gymnasium: un benchmark unificado para el aprendizaje por refuerzo seguro.
★ 580+1Variación de estrellas de los últimos 7 días - #289★ 578+3Variación de estrellas de los últimos 7 días
- #290
Implementación de RLHF (aprendizaje por refuerzo con retroalimentación humana) de ChatGPT en cualquier modelo generativo de los transformers de huggingface (blommz-176B/bloom/gpt/bart/T5/MetaICL).
★ 564+0Variación de estrellas de los últimos 7 días - #291
Aprendizaje por refuerzo profundo (PPO) en conducción autónoma (Carla) [desde cero].
★ 563-1Variación de estrellas de los últimos 7 días - #292
Meta Agents Research Environments es una plataforma integral diseñada para evaluar agentes de IA en escenarios dinámicos y realistas. A diferencia de los benchmarks estáticos, esta plataforma introduce entornos en evolución donde los agentes deben adaptar sus estrategias a medida que hay nueva información disponible, reflejando desafíos del mundo real.
★ 551+3Variación de estrellas de los últimos 7 días - #293
Una lista seleccionada de recursos de inteligencia artificial (cursos, herramientas, aplicaciones, proyectos de código abierto).
★ 548-1Variación de estrellas de los últimos 7 días - #294
[NeurIPS 2025 Spotlight] Suite de post-entrenamiento para LLM, que incluye ReasonFlux, ReasonFlux-PRM y ReasonFlux-Coder.
★ 542+0Variación de estrellas de los últimos 7 días - #295★ 539+2Variación de estrellas de los últimos 7 días
- #296
UMI on Legs: haciendo que las políticas de manipulación sean móviles con controladores de cuerpo completo centrados en la manipulación
★ 536+3Variación de estrellas de los últimos 7 días - #297
Lista curada de cursos de ingeniería de aprendizaje automático de acceso público de CalTech, Columbia, Berkeley, MIT y Stanford.
★ 535+1Variación de estrellas de los últimos 7 días - #298
Implementaciones de algoritmos de aprendizaje por refuerzo multiobjetivo.
★ 533+1Variación de estrellas de los últimos 7 días - #299
[CVPR 2025 Highlight] InterMimic: Hacia un control universal de cuerpo completo para interacciones humano-objeto basadas en física
★ 528+1Variación de estrellas de los últimos 7 días - #300
Un simulador de propósito general, flexible y fácil de usar junto con un entorno de trading de OpenAI Gym para la plataforma MetaTrader 5 (aprobado por OpenAI Gym)
★ 524+0Variación de estrellas de los últimos 7 días