reinforcement-learning
Repositórios de código aberto acompanhados marcados com reinforcement-learning, ordenados por estrelas.
- #151
ReSearch: Aprendendo a raciocinar com busca para LLMs via aprendizado por reforço & ReCall: Aprendendo a raciocinar com chamadas de ferramentas para LLMs via aprendizado por reforço.
★ 1.432+1Variação de estrelas nos últimos 7 dias - #152
Algoritmos concisos e elegantes escritos em Julia
★ 1.426+0Variação de estrelas nos últimos 7 dias - #153
Uma lista curada de recursos incríveis sobre RL baseada em modelos (atualizada continuamente)
★ 1.393+0Variação de estrelas nos últimos 7 dias - #154★ 1.385+2Variação de estrelas nos últimos 7 dias
- #155
Um gato robótico programável e altamente manobrável para educação STEM e serviços aprimorados por IA.
★ 1.372+1Variação de estrelas nos últimos 7 dias - #156★ 1.367+1Variação de estrelas nos últimos 7 dias
- #157
Aprendizado por reforço profundo para navegação de robôs móveis no simulador ROS Gazebo. Usando a rede neural Twin Delayed Deep Deterministic Policy Gradient (TD3), um robô aprende a navegar até um ponto de destino aleatório em um ambiente simulado enquanto evita obstáculos.
★ 1.362+2Variação de estrelas nos últimos 7 dias - #158
Framework modular de Deep Reinforcement Learning em PyTorch. Biblioteca complementar do livro "Foundations of Deep Reinforcement Learning".
★ 1.362+0Variação de estrelas nos últimos 7 dias - #159
Implementação em PyTorch de Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet...
★ 1.359+1Variação de estrelas nos últimos 7 dias - #160
Um ecossistema vivo onde agentes de IA completam tarefas através de loops de fluxo de trabalho, melhoram por meio de execução iterativa, são avaliados por agentes mentores ou humanos, e transformam o trabalho concluído em experiência e dados reutilizáveis para aprimorar futuros agentes.
★ 1.334+0Variação de estrelas nos últimos 7 dias - #161
Implementações mínimas de Deep Q Learning (DQN e DDQN) em Keras
★ 1.329+1Variação de estrelas nos últimos 7 dias - #162
Um formato padrão para conjuntos de dados de aprendizado por reforço offline, com conjuntos de dados de referência populares e utilitários relacionados
★ 1.294+3Variação de estrelas nos últimos 7 dias - #163
Notas de leitura de artigos sobre Deep Learning e Machine Learning
★ 1.270+0Variação de estrelas nos últimos 7 dias - #164
Uma implementação simples e bem estruturada de PPO, baseada na série do Medium: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.
★ 1.269+1Variação de estrelas nos últimos 7 dias - #165
Pesquisa de RL em dispositivos Android.
★ 1.240+0Variação de estrelas nos últimos 7 dias - #166
Geração de conjuntos de fatores de ações (preditivos) formulaicos via aprendizado por reforço.
★ 1.213+8Variação de estrelas nos últimos 7 dias - #167
Treinamento de um robô humanoide para locomoção usando Aprendizado por Reforço
★ 1.210+3Variação de estrelas nos últimos 7 dias - #168
Notas de aula, tarefas de tutorial incluindo soluções, bem como vídeos online para o curso de aprendizado por reforço ministrado pela Universidade de Paderborn
★ 1.192+1Variação de estrelas nos últimos 7 dias - #169★ 1.188+0Variação de estrelas nos últimos 7 dias
- #170
[ECCV 2026] MixGRPO: Desbloqueando a eficiência do GRPO baseado em fluxo com ODE-SDE mistos
★ 1.177+0Variação de estrelas nos últimos 7 dias - #171★ 1.155+7Variação de estrelas nos últimos 7 dias
- #172
Avaliação e reprodução de políticas de manipulação robótica do mundo real (ex: RT-1, RT-1-X, Octo) em simulação sob configurações comuns (ex: Google Robot, WidowX+Bridge) (CoRL 2024).
★ 1.153+3Variação de estrelas nos últimos 7 dias - #173
JMLR: OmniSafe é um framework de infraestrutura para acelerar a pesquisa em SafeRL.
★ 1.150+1Variação de estrelas nos últimos 7 dias - #174
Biblioteca avançada de computação evolutiva construída diretamente sobre o PyTorch, criada na NNAISENSE.
★ 1.144+1Variação de estrelas nos últimos 7 dias - #175
Escola de treinamento de aprendizado por reforço multiagente escalável para direção autônoma.
★ 1.134+0Variação de estrelas nos últimos 7 dias - #176
Aprenda a fazer máquinas aprenderem para que você não precise se esforçar para programá-las; a lista definitiva
★ 1.128+0Variação de estrelas nos últimos 7 dias - #177
Um simulador de robô leve baseado em Python projetado para navegação, controle e aprendizado
★ 1.125+6Variação de estrelas nos últimos 7 dias - #178
Embeddings de habilidades adversárias para o treinamento de controladores reutilizáveis para personagens simulados fisicamente.
★ 1.120+2Variação de estrelas nos últimos 7 dias - #179★ 1.116+5Variação de estrelas nos últimos 7 dias
- #180
Apresentamos o conjunto de dados Audio Logical Reasoning (ALR), composto por 6.446 amostras anotadas de texto-áudio projetadas especificamente para tarefas de raciocínio complexo. Com base neste recurso, propomos o SoundMind, um algoritmo de aprendizado por reforço (RL) baseado em regras, adaptado para dotar modelos de linguagem de áudio (ALMs) com habilidades profundas de raciocínio bimodal.
★ 1.113+0Variação de estrelas nos últimos 7 dias