rl
Repositórios de código aberto acompanhados marcados com rl, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de rl no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com rl.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Comunidade chinesa Llama, reunindo em tempo real os materiais de estudo mais recentes sobre Llama, construindo o melhor ecossistema open source de grandes modelos Llama em chinês, totalmente aberto e comercializável.
★ 14.740+1Variação de estrelas nos últimos 7 dias - #2★ 10.945+11Variação de estrelas nos últimos 7 dias
- #3
Dopamine é um framework de pesquisa para prototipagem rápida de algoritmos de aprendizado por reforço.
★ 10.901+4Variação de estrelas nos últimos 7 dias - #4
Agent Reinforcement Trainer: treine agentes de múltiplas etapas para tarefas do mundo real usando GRPO. Dê aos seus agentes treinamento prático. Aprendizado por reforço para Qwen3.6, GPT-OSS, Llama e muito mais!
★ 10.679+57Variação de estrelas nos últimos 7 dias - #5★ 5.703+19Variação de estrelas nos últimos 7 dias
- #6
EasyR1: Um framework de treinamento de RL multimodal eficiente, escalável e baseado no veRL
★ 5.136+10Variação de estrelas nos últimos 7 dias - #7
Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.
★ 4.145+94Variação de estrelas nos últimos 7 dias - #8
O agent-sandbox permite o gerenciamento simples de cargas de trabalho isoladas, com estado e singleton, ideais para casos de uso como ambientes de execução de agentes de IA e aprendizado por reforço (RL).
★ 3.678+92Variação de estrelas nos últimos 7 dias - #9
Uma implementação do algoritmo AlphaZero para Gomoku (também conhecido como Gobang ou Cinco em Linha)
★ 3.625+2Variação de estrelas nos últimos 7 dias - #10
Uma biblioteca PyTorch modular, focada em primitivas e em Python para Aprendizado por Reforço.
★ 3.540+12Variação de estrelas nos últimos 7 dias - #11
Um framework de treinamento para agentes de aprendizado por reforço Stable Baselines3, incluindo otimização de hiperparâmetros e agentes pré-treinados.
★ 2.872+3Variação de estrelas nos últimos 7 dias - #12
Implementação de artigos científicos em 100 linhas de código.
★ 2.867+8Variação de estrelas nos últimos 7 dias - #13
MuZero
★ 2.863+4Variação de estrelas nos últimos 7 dias - #14
Uma pesquisa sobre Aprendizagem por Reforço para Modelos de Raciocínio de Grande Porte
★ 2.481+2Variação de estrelas nos últimos 7 dias - #15
Implementação de todos os algoritmos de RL de uma forma mais simples
★ 1.922+7Variação de estrelas nos últimos 7 dias - #16★ 1.872+3Variação de estrelas nos últimos 7 dias
- #17
[ICLR 2026] SimpleVLA-RL: Escalando o treinamento de VLA via aprendizado por reforço
★ 1.839+9Variação de estrelas nos últimos 7 dias - #18
Últimos avanços no raciocínio System-2
★ 1.353+1Variação de estrelas nos últimos 7 dias - #19
Entendendo o treinamento tipo R1-Zero: uma perspectiva crítica.
★ 1.274+1Variação de estrelas nos últimos 7 dias - #20
Curso sistemático de construção de Large Language Models | Abrange engenharia de dados de pré-treinamento, Tokenizer, Transformer, MoE, programação GPU (CUDA/Triton), treinamento distribuído, Scaling Laws, otimização de inferência e alinhamento (SFT/RLHF/GRPO) | 6 exercícios progressivos orientados a código para estabelecer uma visão full-stack de LLMs
★ 1.260+22Variação de estrelas nos últimos 7 dias - #21
[NeurIPS 2025] TTRL: Aprendizado por Reforço em Tempo de Teste (Test-Time Reinforcement Learning).
★ 1.121+5Variação de estrelas nos últimos 7 dias - #22★ 1.111+3Variação de estrelas nos últimos 7 dias
- #23★ 1.080+8Variação de estrelas nos últimos 7 dias
- #24
A pilha de melhoria contínua para agentes. Nossos dados de ambiente e avaliações impulsionam a melhoria e o monitoramento de agentes.
★ 1.058+1Variação de estrelas nos últimos 7 dias - #25
Tensorlake é um runtime serverless para sandboxes e implantação de aplicações de agentes em segundo plano.
★ 995+1Variação de estrelas nos últimos 7 dias - #26
Sistemas de Inteligência de Risco nativos em IA, OpenDeRisk — seu gerenciador inteligente de riscos de sistemas de aplicação oferece proteção abrangente e profunda 24 horas por dia, 7 dias por semana.
★ 968+3Variação de estrelas nos últimos 7 dias - #27
Biblioteca Python para Aprendizado por Reforço
★ 944+1Variação de estrelas nos últimos 7 dias - #28
O "AI-Compass" guiará a comunidade na navegação pelo oceano da tecnologia de IA; seja você um iniciante ou um desenvolvedor avançado, encontrará aqui o caminho para as principais direções da IA. O objetivo é ajudar os desenvolvedores a entender sistematicamente os conceitos principais de IA, tecnologias tradicionais, tendências de ponta e dominar todo o processo, da teoria à implementação prática, por meio da prática.
★ 926+12Variação de estrelas nos últimos 7 dias - #29
Plataforma de robô humanoide de código aberto impressa em 3D para sim-to-real e RL.
★ 820+1Variação de estrelas nos últimos 7 dias - #30
MobileGym: Uma plataforma de simulação verificável e altamente paralela para pesquisa de agentes de GUI móveis · Simulador Android executado no navegador · Simulador Android hospedado no navegador · Avaliação Verificável · Treinamento RL online escalável
★ 777+10Variação de estrelas nos últimos 7 dias