ppo
Repositorios de código abierto monitorizados etiquetados con ppo, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a ppo en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con ppo.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Tutorial en chino de aprendizaje por refuerzo (Libro de hongos 🍄), dirección de lectura en línea: https://datawhalechina.github.io/easy-rl/
★ 14.592+28Variación de estrellas de los últimos 7 días - #2★ 10.945+11Variación de estrellas de los últimos 7 días
- #3
Implementación de archivo único de alta calidad de algoritmos de aprendizaje por refuerzo profundo con características amigables para la investigación (PPO, DQN, C51, DDPG, TD3, SAC, PPG)
★ 10.339+36Variación de estrellas de los últimos 7 días - #4
Tutoriales sencillos de aprendizaje por refuerzo, enseñanza de IA en chino de MoFan Python
★ 9510+7Variación de estrellas de los últimos 7 días - #5
Repositorio para el programa Nanodegree de Aprendizaje por Refuerzo Profundo (Deep Reinforcement Learning)
★ 5176+0Variación de estrellas de los últimos 7 días - #6★ 4357+1Variación de estrellas de los últimos 7 días
- #7
🚀 Un plan de estudios práctico y de código abierto que puentea la brecha desde los conceptos básicos de RL hasta la alineación de LLM, RLVR y sistemas de agentes avanzados.
★ 4145+94Variación de estrellas de los últimos 7 días - #8
FinRL-X: Una infraestructura modular nativa de IA para el trading cuantitativo
★ 3607+25Variación de estrellas de los últimos 7 días - #9★ 3449+2Variación de estrellas de los últimos 7 días
- #10
Implementación en PyTorch limpia, robusta y unificada de algoritmos populares de Aprendizaje por Refuerzo Profundo (DRL) (Q-learning, Duel DDQN, PER, C51, Noisy DQN, PPO, DDPG, TD3, SAC, ASL)
★ 3437+4Variación de estrellas de los últimos 7 días - #11
Implementación mínima de Proximal Policy Optimization (PPO) con objetivo recortado en PyTorch
★ 2376+0Variación de estrellas de los últimos 7 días - #12★ 2087+2Variación de estrellas de los últimos 7 días
- #13
Framework modular de aprendizaje por refuerzo profundo en PyTorch. Biblioteca complementaria del libro "Foundations of Deep Reinforcement Learning"
★ 1362-1Variación de estrellas de los últimos 7 días - #14
Una implementación de PPO simple y bien estructurada. Basada en mi serie de Medium: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.
★ 1268+3Variación de estrellas de los últimos 7 días - #15
Entrenamiento de un robot humanoide para la locomoción mediante aprendizaje por refuerzo
★ 1207+1Variación de estrellas de los últimos 7 días - #16★ 1100+2Variación de estrellas de los últimos 7 días
- #17★ 1081+1Variación de estrellas de los últimos 7 días
- #18
Una biblioteca con implementaciones extensibles de DPO, KTO, PPO, ORPO y otras funciones de pérdida orientadas a humanos (HALOs).
★ 910+0Variación de estrellas de los últimos 7 días - #19
Archivos de inicio de RL para entrenar, visualizar y evaluar inmediatamente un agente sin escribir ninguna línea de código
★ 728+1Variación de estrellas de los últimos 7 días - #20
Este repositorio contiene la mayoría de las implementaciones en PyTorch basadas en algoritmos clásicos de aprendizaje por refuerzo profundo, incluyendo DQN, DDQN, Dueling Network, DDPG, SAC, A2C, PPO y TRPO. (Más algoritmos en desarrollo)
★ 696+0Variación de estrellas de los últimos 7 días - #21
🌾 OAT: Un marco de trabajo amigable para la investigación de alineación en línea de LLM, que incluye aprendizaje por refuerzo, aprendizaje de preferencias, etc.
★ 670-1Variación de estrellas de los últimos 7 días - #22
Una biblioteca de PyTorch para crear agentes de aprendizaje por refuerzo profundo.
★ 657+1Variación de estrellas de los últimos 7 días - #23
RLAnything (ICML 2026) y AutoTool (ICML 2026), DemyAgent: RL de código abierto para LLMs y escenarios de agentes
★ 625+1Variación de estrellas de los últimos 7 días - #24
Ajuste fino (finetuning) fácil y eficiente para LLMs. (Compatible con LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon). Entrenamiento y despliegue eficiente de cuantización para grandes modelos.
★ 621+0Variación de estrellas de los últimos 7 días - #25
Una lista curada de artículos sobre aprendizaje por refuerzo para la generación de video
★ 590+2Variación de estrellas de los últimos 7 días - #26
Aprendizaje por refuerzo profundo (PPO) en conducción autónoma (Carla) [desde cero].
★ 564+1Variación de estrellas de los últimos 7 días