ppo
Repositórios de código aberto acompanhados marcados com ppo, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de ppo no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com ppo.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Tutorial de aprendizado por reforço em chinês (Livro Cogumelo🍄), endereço de leitura online: https://datawhalechina.github.io/easy-rl/
★ 14.592+28Variação de estrelas nos últimos 7 dias - #2★ 10.945+11Variação de estrelas nos últimos 7 dias
- #3
Implementação em arquivo único de alta qualidade de algoritmos de Deep Reinforcement Learning com recursos voltados para pesquisa (PPO, DQN, C51, DDPG, TD3, SAC, PPG).
★ 10.339+36Variação de estrelas nos últimos 7 dias - #4
Tutoriais simples de aprendizado por reforço, ensino de IA em chinês do 莫烦Python
★ 9.510+7Variação de estrelas nos últimos 7 dias - #5
Repositório para o programa Nanodegree de Aprendizado por Reforço Profundo.
★ 5.176+0Variação de estrelas nos últimos 7 dias - #6★ 4.357+1Variação de estrelas nos últimos 7 dias
- #7
Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.
★ 4.145+94Variação de estrelas nos últimos 7 dias - #8
FinRL-X: Uma infraestrutura modular nativa de IA para negociação quantitativa.
★ 3.607+25Variação de estrelas nos últimos 7 dias - #9★ 3.449+2Variação de estrelas nos últimos 7 dias
- #10
Implementação PyTorch limpa, robusta e unificada de algoritmos populares de Deep Reinforcement Learning (DRL) (Q-learning, Duel DDQN, PER, C51, Noisy DQN, PPO, DDPG, TD3, SAC, ASL).
★ 3.437+4Variação de estrelas nos últimos 7 dias - #11
Implementação mínima de Proximal Policy Optimization (PPO) com objetivo recortado em PyTorch
★ 2.376+0Variação de estrelas nos últimos 7 dias - #12★ 2.087+2Variação de estrelas nos últimos 7 dias
- #13
Framework modular de Deep Reinforcement Learning em PyTorch. Biblioteca complementar do livro "Foundations of Deep Reinforcement Learning".
★ 1.362-1Variação de estrelas nos últimos 7 dias - #14
Uma implementação simples e bem estruturada de PPO, baseada na série do Medium: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.
★ 1.268+3Variação de estrelas nos últimos 7 dias - #15
Treinamento de um robô humanoide para locomoção usando Aprendizado por Reforço
★ 1.207+1Variação de estrelas nos últimos 7 dias - #16★ 1.100+2Variação de estrelas nos últimos 7 dias
- #17★ 1.081+1Variação de estrelas nos últimos 7 dias
- #18
Uma biblioteca com implementações extensíveis de DPO, KTO, PPO, ORPO e outras funções de perda orientadas a humanos (HALOs).
★ 910+0Variação de estrelas nos últimos 7 dias - #19
Arquivos iniciais de RL para treinar, visualizar e avaliar imediatamente um agente sem escrever nenhuma linha de código
★ 728+1Variação de estrelas nos últimos 7 dias - #20
Este repositório contém a maioria das implementações em pytorch baseadas em algoritmos clássicos de aprendizado por reforço profundo, incluindo: DQN, DDQN, Dueling Network, DDPG, SAC, A2C, PPO, TRPO. (Mais algoritmos ainda estão em desenvolvimento)
★ 696+0Variação de estrelas nos últimos 7 dias - #21
🌾 OAT: Uma estrutura amigável para pesquisa de alinhamento online de LLMs, incluindo aprendizado por reforço, aprendizado por preferência, etc.
★ 670-1Variação de estrelas nos últimos 7 dias - #22
Uma biblioteca PyTorch para construir agentes de aprendizado por reforço profundo.
★ 657+1Variação de estrelas nos últimos 7 dias - #23
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL Open-Source para LLMs e Cenários de Agentes
★ 625+1Variação de estrelas nos últimos 7 dias - #24
Fine-tuning fácil e eficiente de LLMs. (Suporta LLaMA, LLaMA2, LLaMA3, Qwen, Baichuan, GLM, Falcon). Treinamento e implantação eficientes de quantização para grandes modelos.
★ 621+0Variação de estrelas nos últimos 7 dias - #25
Uma lista selecionada de artigos sobre aprendizado por reforço para geração de vídeo
★ 590+2Variação de estrelas nos últimos 7 dias - #26
Aprendizado por Reforço Profundo (PPO) em Condução Autônoma (Carla) [do zero]
★ 564+1Variação de estrelas nos últimos 7 dias