Pular para o conteúdo principal
buildradar
Sign in
Tópico · reinforcement-learning

reinforcement-learning

Repositórios de código aberto acompanhados marcados com reinforcement-learning, ordenados por estrelas.

305 repositórios
  • ReCall@Agent-RL

    ReSearch: Aprendendo a raciocinar com busca para LLMs via aprendizado por reforço & ReCall: Aprendendo a raciocinar com chamadas de ferramentas para LLMs via aprendizado por reforço.

    1.432+1Variação de estrelas nos últimos 7 dias
  • Algoritmos concisos e elegantes escritos em Julia

    1.426+0Variação de estrelas nos últimos 7 dias
  • Uma lista curada de recursos incríveis sobre RL baseada em modelos (atualizada continuamente)

    1.393+0Variação de estrelas nos últimos 7 dias
  • rl_games@Denys88

    Implementações de RL

    1.385+2Variação de estrelas nos últimos 7 dias
  • OpenCat-Old@PetoiCamp

    Um gato robótico programável e altamente manobrável para educação STEM e serviços aprimorados por IA.

    1.372+1Variação de estrelas nos últimos 7 dias
  • smac@oxwhirl

    SMAC: O Desafio Multi-Agente de StarCraft.

    1.367+1Variação de estrelas nos últimos 7 dias
  • DRL-robot-navigation@reiniscimurs

    Aprendizado por reforço profundo para navegação de robôs móveis no simulador ROS Gazebo. Usando a rede neural Twin Delayed Deep Deterministic Policy Gradient (TD3), um robô aprende a navegar até um ponto de destino aleatório em um ambiente simulado enquanto evita obstáculos.

    1.362+2Variação de estrelas nos últimos 7 dias
  • SLM-Lab@kengz

    Framework modular de Deep Reinforcement Learning em PyTorch. Biblioteca complementar do livro "Foundations of Deep Reinforcement Learning".

    1.362+0Variação de estrelas nos últimos 7 dias
  • Popular-RL-Algorithms@quantumiracle

    Implementação em PyTorch de Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet...

    1.359+1Variação de estrelas nos últimos 7 dias
  • agent-apprenticeship@ray-r-ren

    Um ecossistema vivo onde agentes de IA completam tarefas através de loops de fluxo de trabalho, melhoram por meio de execução iterativa, são avaliados por agentes mentores ou humanos, e transformam o trabalho concluído em experiência e dados reutilizáveis para aprimorar futuros agentes.

    1.334+0Variação de estrelas nos últimos 7 dias
  • Implementações mínimas de Deep Q Learning (DQN e DDQN) em Keras

    1.329+1Variação de estrelas nos últimos 7 dias
  • Minari@Farama-Foundation

    Um formato padrão para conjuntos de dados de aprendizado por reforço offline, com conjuntos de dados de referência populares e utilitários relacionados

    1.294+3Variação de estrelas nos últimos 7 dias
  • Learning-Deep-Learning@patrick-llgc

    Notas de leitura de artigos sobre Deep Learning e Machine Learning

    1.270+0Variação de estrelas nos últimos 7 dias
  • PPO-for-Beginners@ericyangyu

    Uma implementação simples e bem estruturada de PPO, baseada na série do Medium: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.

    1.269+1Variação de estrelas nos últimos 7 dias
  • android_env@google-deepmind

    Pesquisa de RL em dispositivos Android.

    1.240+0Variação de estrelas nos últimos 7 dias
  • alphagen@ICT-FinD-Lab

    Geração de conjuntos de fatores de ações (preditivos) formulaicos via aprendizado por reforço.

    1.213+8Variação de estrelas nos últimos 7 dias
  • LearningHumanoidWalking@rohanpsingh

    Treinamento de um robô humanoide para locomoção usando Aprendizado por Reforço

    1.210+3Variação de estrelas nos últimos 7 dias
  • Notas de aula, tarefas de tutorial incluindo soluções, bem como vídeos online para o curso de aprendizado por reforço ministrado pela Universidade de Paderborn

    1.192+1Variação de estrelas nos últimos 7 dias
  • flow@flow-project

    Estrutura computacional para aprendizagem por reforço no controle de tráfego

    1.188+0Variação de estrelas nos últimos 7 dias
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: Desbloqueando a eficiência do GRPO baseado em fluxo com ODE-SDE mistos

    1.177+0Variação de estrelas nos últimos 7 dias
  • Gym@NVIDIA-NeMo

    Avalie e aprimore modelos e agentes usando ambientes

    1.155+7Variação de estrelas nos últimos 7 dias
  • SimplerEnv@simpler-env

    Avaliação e reprodução de políticas de manipulação robótica do mundo real (ex: RT-1, RT-1-X, Octo) em simulação sob configurações comuns (ex: Google Robot, WidowX+Bridge) (CoRL 2024).

    1.153+3Variação de estrelas nos últimos 7 dias
  • omnisafe@PKU-Alignment

    JMLR: OmniSafe é um framework de infraestrutura para acelerar a pesquisa em SafeRL.

    1.150+1Variação de estrelas nos últimos 7 dias
  • evotorch@nnaisense

    Biblioteca avançada de computação evolutiva construída diretamente sobre o PyTorch, criada na NNAISENSE.

    1.144+1Variação de estrelas nos últimos 7 dias
  • SMARTS@huawei-noah

    Escola de treinamento de aprendizado por reforço multiagente escalável para direção autônoma.

    1.134+0Variação de estrelas nos últimos 7 dias
  • Aprenda a fazer máquinas aprenderem para que você não precise se esforçar para programá-las; a lista definitiva

    1.128+0Variação de estrelas nos últimos 7 dias
  • ir-sim@hanruihua

    Um simulador de robô leve baseado em Python projetado para navegação, controle e aprendizado

    1.125+6Variação de estrelas nos últimos 7 dias
  • ASE@nv-tlabs

    Embeddings de habilidades adversárias para o treinamento de controladores reutilizáveis para personagens simulados fisicamente.

    1.120+2Variação de estrelas nos últimos 7 dias
  • ARPO@RUC-NLPIR

    [ICLR 2026] Agentic Reinforced Policy Optimization (ARPO)

    1.116+5Variação de estrelas nos últimos 7 dias
  • SoundMind@xid32

    Apresentamos o conjunto de dados Audio Logical Reasoning (ALR), composto por 6.446 amostras anotadas de texto-áudio projetadas especificamente para tarefas de raciocínio complexo. Com base neste recurso, propomos o SoundMind, um algoritmo de aprendizado por reforço (RL) baseado em regras, adaptado para dotar modelos de linguagem de áudio (ALMs) com habilidades profundas de raciocínio bimodal.

    1.113+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos