Pular para o conteúdo principal
buildradar
Sign in
Tópico · rl

rl

Repositórios de código aberto acompanhados marcados com rl, ordenados por estrelas.

Repositórios
45
Total de estrelas
111.909
Média de estrelas
2.487
Participação
0,01%

Tópicos que aparecem com frequência ao lado de rl no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com rl.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • Llama-Chinese@LlamaChinese

    Comunidade chinesa Llama, reunindo em tempo real os materiais de estudo mais recentes sobre Llama, construindo o melhor ecossistema open source de grandes modelos Llama em chinês, totalmente aberto e comercializável.

    14.740+1Variação de estrelas nos últimos 7 dias
  • tianshou@thu-ml

    Uma biblioteca elegante de aprendizado por reforço profundo em PyTorch.

    10.945+11Variação de estrelas nos últimos 7 dias
  • dopamine@google

    Dopamine é um framework de pesquisa para prototipagem rápida de algoritmos de aprendizado por reforço.

    10.901+4Variação de estrelas nos últimos 7 dias
  • ART@OpenPipe

    Agent Reinforcement Trainer: treine agentes de múltiplas etapas para tarefas do mundo real usando GRPO. Dê aos seus agentes treinamento prático. Aprendizado por reforço para Qwen3.6, GPT-OSS, Llama e muito mais!

    10.679+57Variação de estrelas nos últimos 7 dias
  • AReaL@areal-project

    A ponte de RL para aplicações de agentes baseadas em LLM. Simples e flexível.

    5.703+19Variação de estrelas nos últimos 7 dias
  • EasyR1@hiyouga

    EasyR1: Um framework de treinamento de RL multimodal eficiente, escalável e baseado no veRL

    5.136+10Variação de estrelas nos últimos 7 dias
  • hands-on-modern-rl@walkinglabs

    Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.

    4.145+94Variação de estrelas nos últimos 7 dias
  • agent-sandbox@kubernetes-sigs

    O agent-sandbox permite o gerenciamento simples de cargas de trabalho isoladas, com estado e singleton, ideais para casos de uso como ambientes de execução de agentes de IA e aprendizado por reforço (RL).

    3.678+92Variação de estrelas nos últimos 7 dias
  • AlphaZero_Gomoku@junxiaosong

    Uma implementação do algoritmo AlphaZero para Gomoku (também conhecido como Gobang ou Cinco em Linha)

    3.625+2Variação de estrelas nos últimos 7 dias
  • rl@pytorch

    Uma biblioteca PyTorch modular, focada em primitivas e em Python para Aprendizado por Reforço.

    3.540+12Variação de estrelas nos últimos 7 dias
  • Um framework de treinamento para agentes de aprendizado por reforço Stable Baselines3, incluindo otimização de hiperparâmetros e agentes pré-treinados.

    2.872+3Variação de estrelas nos últimos 7 dias
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    Implementação de artigos científicos em 100 linhas de código.

    2.867+8Variação de estrelas nos últimos 7 dias
  • muzero-general@werner-duvaud

    MuZero

    2.863+4Variação de estrelas nos últimos 7 dias
  • Awesome-RL-for-LRMs@TsinghuaC3I

    Uma pesquisa sobre Aprendizagem por Reforço para Modelos de Raciocínio de Grande Porte

    2.481+2Variação de estrelas nos últimos 7 dias
  • all-rl-algorithms@FareedKhan-dev

    Implementação de todos os algoritmos de RL de uma forma mais simples

    1.922+7Variação de estrelas nos últimos 7 dias
  • PRIME@PRIME-RL

    Solução de RL escalável para raciocínio avançado de modelos de linguagem

    1.872+3Variação de estrelas nos últimos 7 dias
  • SimpleVLA-RL@PRIME-RL

    [ICLR 2026] SimpleVLA-RL: Escalando o treinamento de VLA via aprendizado por reforço

    1.839+9Variação de estrelas nos últimos 7 dias
  • Últimos avanços no raciocínio System-2

    1.353+1Variação de estrelas nos últimos 7 dias
  • understand-r1-zero@sail-sg

    Entendendo o treinamento tipo R1-Zero: uma perspectiva crítica.

    1.274+1Variação de estrelas nos últimos 7 dias
  • diy-llm@datawhalechina

    Curso sistemático de construção de Large Language Models | Abrange engenharia de dados de pré-treinamento, Tokenizer, Transformer, MoE, programação GPU (CUDA/Triton), treinamento distribuído, Scaling Laws, otimização de inferência e alinhamento (SFT/RLHF/GRPO) | 6 exercícios progressivos orientados a código para estabelecer uma visão full-stack de LLMs

    1.260+22Variação de estrelas nos últimos 7 dias
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL: Aprendizado por Reforço em Tempo de Teste (Test-Time Reinforcement Learning).

    1.121+5Variação de estrelas nos últimos 7 dias
  • ARPO@RUC-NLPIR

    [ICLR 2026] Agentic Reinforced Policy Optimization (ARPO)

    1.111+3Variação de estrelas nos últimos 7 dias
  • SDPO@lasgroup

    Aprendizado por reforço via autodestilação (SDPO)

    1.080+8Variação de estrelas nos últimos 7 dias
  • judgeval@JudgmentLabs

    A pilha de melhoria contínua para agentes. Nossos dados de ambiente e avaliações impulsionam a melhoria e o monitoramento de agentes.

    1.058+1Variação de estrelas nos últimos 7 dias
  • tensorlake@tensorlakeai

    Tensorlake é um runtime serverless para sandboxes e implantação de aplicações de agentes em segundo plano.

    995+1Variação de estrelas nos últimos 7 dias
  • OpenDerisk@derisk-ai

    Sistemas de Inteligência de Risco nativos em IA, OpenDeRisk — seu gerenciador inteligente de riscos de sistemas de aplicação oferece proteção abrangente e profunda 24 horas por dia, 7 dias por semana.

    968+3Variação de estrelas nos últimos 7 dias
  • mushroom-rl@MushroomRL

    Biblioteca Python para Aprendizado por Reforço

    944+1Variação de estrelas nos últimos 7 dias
  • AI-Compass@tingaicompass

    O "AI-Compass" guiará a comunidade na navegação pelo oceano da tecnologia de IA; seja você um iniciante ou um desenvolvedor avançado, encontrará aqui o caminho para as principais direções da IA. O objetivo é ajudar os desenvolvedores a entender sistematicamente os conceitos principais de IA, tecnologias tradicionais, tendências de ponta e dominar todo o processo, da teoria à implementação prática, por meio da prática.

    926+12Variação de estrelas nos últimos 7 dias
  • zeroth-bot@zeroth-robotics

    Plataforma de robô humanoide de código aberto impressa em 3D para sim-to-real e RL.

    820+1Variação de estrelas nos últimos 7 dias
  • mobilegym@Purewhiter

    MobileGym: Uma plataforma de simulação verificável e altamente paralela para pesquisa de agentes de GUI móveis · Simulador Android executado no navegador · Simulador Android hospedado no navegador · Avaliação Verificável · Treinamento RL online escalável

    777+10Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos