reinforcement-learning
Repositórios de código aberto acompanhados marcados com reinforcement-learning, ordenados por estrelas.
- #91
🤖 Guia da Escola de Verão de Machine Learning.
★ 3.033+3Variação de estrelas nos últimos 7 dias - #92
TF-Agents: Uma biblioteca TensorFlow confiável, escalável e fácil de usar para Contextual Bandits e Aprendizado por Reforço.
★ 3.026+0Variação de estrelas nos últimos 7 dias - #93
Artigos de pesquisa sobre Deep Learning e aprendizado por reforço profundo, além de alguns códigos.
★ 3.026+2Variação de estrelas nos últimos 7 dias - #94★ 2.960+82Variação de estrelas nos últimos 7 dias
- #95
Um braço humanoide totalmente de código aberto para pesquisa em IA física e implementação em ambientes ricos em contato.
★ 2.919+23Variação de estrelas nos últimos 7 dias - #96
Um framework de treinamento para agentes de aprendizado por reforço Stable Baselines3, incluindo otimização de hiperparâmetros e agentes pré-treinados.
★ 2.873+1Variação de estrelas nos últimos 7 dias - #97
Implementação de artigos científicos em 100 linhas de código.
★ 2.870+3Variação de estrelas nos últimos 7 dias - #98
MuZero
★ 2.865+2Variação de estrelas nos últimos 7 dias - #99
Tutoriais simples e abrangentes em TensorFlow
★ 2.841+0Variação de estrelas nos últimos 7 dias - #100
Uma biblioteca de agentes de IA de nível empresarial projetada para democratizar a inteligência artificial e fornecer alternativas gratuitas e de código aberto para startups supervalorizadas da Y Combinator.
★ 2.806+7Variação de estrelas nos últimos 7 dias - #101
O RAGEN utiliza aprendizado por reforço para treinar agentes de raciocínio LLM em ambientes interativos e estocásticos.
★ 2.786+6Variação de estrelas nos últimos 7 dias - #102★ 2.657+3Variação de estrelas nos últimos 7 dias
- #103
Curso tutorial de DRL PPO x Family (Curso introdutório de inteligência de decisão: 8 aulas para entender a teoria dos algoritmos, a lógica do código e aplicar IA de decisão)
★ 2.616+2Variação de estrelas nos últimos 7 dias - #104
Artigos incríveis de Deep Learning para busca, recomendação e publicidade industrial. Eles focam em Embedding, Matching, Pré-Ranking, Ranking, Pós-Ranking, Relevância, LLM e RL. Por favor, cite nosso artigo "Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives" (TOIS 2026).
★ 2.589+0Variação de estrelas nos últimos 7 dias - #105
robosuite: Um framework de simulação modular e benchmark para aprendizado de robôs
★ 2.586+4Variação de estrelas nos últimos 7 dias - #106
Tutorial, levantamento e guia sobre LLMs de raciocínio
★ 2.533+6Variação de estrelas nos últimos 7 dias - #107
Soluções para Reinforcement Learning: An Introduction
★ 2.433+3Variação de estrelas nos últimos 7 dias - #108
Uma biblioteca modular de RL para ajustar modelos de linguagem às preferências humanas.
★ 2.395+1Variação de estrelas nos últimos 7 dias - #109
O ambiente de negociação OpenAI Gym mais simples, flexível e abrangente (aprovado pelo OpenAI Gym)
★ 2.387+0Variação de estrelas nos últimos 7 dias - #110
Implementação mínima de Proximal Policy Optimization (PPO) com objetivo recortado em PyTorch
★ 2.381+6Variação de estrelas nos últimos 7 dias - #111
ProtoMotions é um framework de simulação e aprendizado acelerado por GPU para treinar humanos digitais e robôs humanoides simulados fisicamente.
★ 2.359+10Variação de estrelas nos últimos 7 dias - #112
ICCV2019 - Aprendendo a pintar com aprendizado por reforço profundo baseado em modelos
★ 2.308+2Variação de estrelas nos últimos 7 dias - #113★ 2.293+0Variação de estrelas nos últimos 7 dias
- #114
Um conjunto leve de métodos de imitação de movimento para treinamento de controladores.
★ 2.280+15Variação de estrelas nos últimos 7 dias - #115
verl-agent é uma extensão do veRL, projetada para treinar agentes LLM/VLM via RL. verl-agent é também o código oficial do artigo "Group-in-Group Policy Optimization for LLM Agent Training"
★ 2.274+17Variação de estrelas nos últimos 7 dias - #116
Uma coleção de artigos clássicos e de ponta da indústria nas áreas de recomendação, publicidade e busca.
★ 2.188-1Variação de estrelas nos últimos 7 dias - #117
Ambientes Gymnasium PyBullet para aprendizado por reforço de agente único e multiagente no controle de quadricópteros.
★ 2.119-2Variação de estrelas nos últimos 7 dias - #118
[RSS 2025] "ASAP: Alinhando Simulação e Física do Mundo Real para Aprender Habilidades de Corpo Inteiro de Humanoides Ágeis"
★ 2.107+3Variação de estrelas nos últimos 7 dias - #119
DIAMOND (DIffusion As a Model Of eNvironment Dreams) é um agente de aprendizado por reforço treinado em um modelo de mundo de difusão. NeurIPS 2024 Spotlight.
★ 2.100+1Variação de estrelas nos últimos 7 dias - #120
Ambientes de aprendizado por reforço baseados no jogo Doom de 1993 :godmode:
★ 2.065+0Variação de estrelas nos últimos 7 dias