Pular para o conteúdo principal
buildradar
Sign in
Tópico · reinforcement-learning

reinforcement-learning

Repositórios de código aberto acompanhados marcados com reinforcement-learning, ordenados por estrelas.

305 repositórios
  • awesome-mlss@awesome-mlss

    🤖 Guia da Escola de Verão de Machine Learning.

    3.033+3Variação de estrelas nos últimos 7 dias
  • agents@tensorflow

    TF-Agents: Uma biblioteca TensorFlow confiável, escalável e fácil de usar para Contextual Bandits e Aprendizado por Reforço.

    3.026+0Variação de estrelas nos últimos 7 dias
  • Artigos de pesquisa sobre Deep Learning e aprendizado por reforço profundo, além de alguns códigos.

    3.026+2Variação de estrelas nos últimos 7 dias
  • mjlab@mujocolab

    API do Isaac Lab, baseada em MuJoCo-Warp, para pesquisa em RL e robótica

    2.960+82Variação de estrelas nos últimos 7 dias
  • openarm@enactic

    Um braço humanoide totalmente de código aberto para pesquisa em IA física e implementação em ambientes ricos em contato.

    2.919+23Variação de estrelas nos últimos 7 dias
  • Um framework de treinamento para agentes de aprendizado por reforço Stable Baselines3, incluindo otimização de hiperparâmetros e agentes pré-treinados.

    2.873+1Variação de estrelas nos últimos 7 dias
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    Implementação de artigos científicos em 100 linhas de código.

    2.870+3Variação de estrelas nos últimos 7 dias
  • muzero-general@werner-duvaud

    MuZero

    2.865+2Variação de estrelas nos últimos 7 dias
  • easy-tensorflow@easy-tensorflow

    Tutoriais simples e abrangentes em TensorFlow

    2.841+0Variação de estrelas nos últimos 7 dias
  • YC-Killer@sahibzada-allahyar

    Uma biblioteca de agentes de IA de nível empresarial projetada para democratizar a inteligência artificial e fornecer alternativas gratuitas e de código aberto para startups supervalorizadas da Y Combinator.

    2.806+7Variação de estrelas nos últimos 7 dias
  • RAGEN@mll-lab-nu

    O RAGEN utiliza aprendizado por reforço para treinar agentes de raciocínio LLM em ambientes interativos e estocásticos.

    2.786+6Variação de estrelas nos últimos 7 dias
  • mctx@google-deepmind

    Busca em árvore de Monte Carlo em JAX.

    2.657+3Variação de estrelas nos últimos 7 dias
  • PPOxFamily@opendilab

    Curso tutorial de DRL PPO x Family (Curso introdutório de inteligência de decisão: 8 aulas para entender a teoria dos algoritmos, a lógica do código e aplicar IA de decisão)

    2.616+2Variação de estrelas nos últimos 7 dias
  • Artigos incríveis de Deep Learning para busca, recomendação e publicidade industrial. Eles focam em Embedding, Matching, Pré-Ranking, Ranking, Pós-Ranking, Relevância, LLM e RL. Por favor, cite nosso artigo "Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives" (TOIS 2026).

    2.589+0Variação de estrelas nos últimos 7 dias
  • robosuite@ARISE-Initiative

    robosuite: Um framework de simulação modular e benchmark para aprendizado de robôs

    2.586+4Variação de estrelas nos últimos 7 dias
  • Tutorial, levantamento e guia sobre LLMs de raciocínio

    2.533+6Variação de estrelas nos últimos 7 dias
  • Soluções para Reinforcement Learning: An Introduction

    2.433+3Variação de estrelas nos últimos 7 dias
  • RL4LMs@allenai

    Uma biblioteca modular de RL para ajustar modelos de linguagem às preferências humanas.

    2.395+1Variação de estrelas nos últimos 7 dias
  • gym-anytrading@AminHP

    O ambiente de negociação OpenAI Gym mais simples, flexível e abrangente (aprovado pelo OpenAI Gym)

    2.387+0Variação de estrelas nos últimos 7 dias
  • PPO-PyTorch@nikhilbarhate99

    Implementação mínima de Proximal Policy Optimization (PPO) com objetivo recortado em PyTorch

    2.381+6Variação de estrelas nos últimos 7 dias
  • ProtoMotions@NVlabs

    ProtoMotions é um framework de simulação e aprendizado acelerado por GPU para treinar humanos digitais e robôs humanoides simulados fisicamente.

    2.359+10Variação de estrelas nos últimos 7 dias
  • ICCV2019 - Aprendendo a pintar com aprendizado por reforço profundo baseado em modelos

    2.308+2Variação de estrelas nos últimos 7 dias
  • drl-zh@alessiodm

    Aprendizado por Reforço Profundo: Do zero ao especialista!

    2.293+0Variação de estrelas nos últimos 7 dias
  • MimicKit@xbpeng

    Um conjunto leve de métodos de imitação de movimento para treinamento de controladores.

    2.280+15Variação de estrelas nos últimos 7 dias
  • verl-agent@langfengQ

    verl-agent é uma extensão do veRL, projetada para treinar agentes LLM/VLM via RL. verl-agent é também o código oficial do artigo "Group-in-Group Policy Optimization for LLM Agent Training"

    2.274+17Variação de estrelas nos últimos 7 dias
  • RecSysPapers@tangxyw

    Uma coleção de artigos clássicos e de ponta da indústria nas áreas de recomendação, publicidade e busca.

    2.188-1Variação de estrelas nos últimos 7 dias
  • gym-pybullet-drones@learnsyslab

    Ambientes Gymnasium PyBullet para aprendizado por reforço de agente único e multiagente no controle de quadricópteros.

    2.119-2Variação de estrelas nos últimos 7 dias
  • ASAP@LeCAR-Lab

    [RSS 2025] "ASAP: Alinhando Simulação e Física do Mundo Real para Aprender Habilidades de Corpo Inteiro de Humanoides Ágeis"

    2.107+3Variação de estrelas nos últimos 7 dias
  • diamond@eloialonso

    DIAMOND (DIffusion As a Model Of eNvironment Dreams) é um agente de aprendizado por reforço treinado em um modelo de mundo de difusão. NeurIPS 2024 Spotlight.

    2.100+1Variação de estrelas nos últimos 7 dias
  • ViZDoom@Farama-Foundation

    Ambientes de aprendizado por reforço baseados no jogo Doom de 1993 :godmode:

    2.065+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos