rlhf
Repositórios de código aberto acompanhados marcados com rlhf, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de rlhf no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com rlhf.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Ajuste fino eficiente e unificado de mais de 100 LLMs e VLMs (ACL 2024)
★ 74.532+89Variação de estrelas nos últimos 7 dias - #2
OpenAssistant é um assistente baseado em chat que entende tarefas, pode interagir com sistemas de terceiros e recuperar informações dinamicamente para isso.
★ 37.401-7Variação de estrelas nos últimos 7 dias - #3
Página oficial do GitHub para o artigo de revisão "A Survey of Large Language Models".
★ 12.208+2Variação de estrelas nos últimos 7 dias - #4
Lançamento oficial da série InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).
★ 7.277+4Variação de estrelas nos últimos 7 dias - #5
Projeto fase 2 de LLMs Chinese LLaMA-2 & Alpaca-2 + modelos de contexto ultralongo de 64K (Chinese LLaMA-2 & Alpaca-2 LLMs com modelos de contexto longo de 64K)
★ 7.120+0Variação de estrelas nos últimos 7 dias - #6
Receitas robustas para alinhar modelos de linguagem com preferências humanas e de IA
★ 5.670-3Variação de estrelas nos últimos 7 dias - #7
OpenClaw-RL: Treine qualquer agente simplesmente conversando
★ 5.665+7Variação de estrelas nos últimos 7 dias - #8
O ambiente de pesquisa de código aberto para pesquisadores de IA treinarem, avaliarem e escalarem modelos perfeitamente, desde hardware local até clusters de GPU.
★ 5.185+3Variação de estrelas nos últimos 7 dias - #9
Implemente um LLM de raciocínio em PyTorch do zero, passo a passo
★ 5.138+49Variação de estrelas nos últimos 7 dias - #10
Argilla é uma ferramenta de colaboração para engenheiros de IA e especialistas de domínio construírem conjuntos de dados de alta qualidade
★ 5.093+5Variação de estrelas nos últimos 7 dias - #11
Construa, avalie e otimize sistemas de IA. Inclui avaliações, RAG, agentes, ajuste fino, geração de dados sintéticos, gerenciamento de conjuntos de dados, MCP e muito mais.
★ 5.042+5Variação de estrelas nos últimos 7 dias - #12
Align Anything: Treinamento de modelos multimodais com feedback
★ 4.671+3Variação de estrelas nos últimos 7 dias - #13
Uma lista curada de recursos sobre aprendizado por reforço com feedback humano (atualizada continuamente).
★ 4.424+2Variação de estrelas nos últimos 7 dias - #14
Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.
★ 4.199+54Variação de estrelas nos últimos 7 dias - #15★ 3.485-1Variação de estrelas nos últimos 7 dias
- #16
Distilabel é um framework para dados sintéticos e feedback de IA para engenheiros que precisam de pipelines rápidos, confiáveis e escaláveis baseados em artigos de pesquisa verificados.
★ 3.384+3Variação de estrelas nos últimos 7 dias - #17
Uma biblioteca de escalabilidade eficiente e amigável para aprendizado por reforço com Large Language Models
★ 3.380+6Variação de estrelas nos últimos 7 dias - #18
LeetCode para PyTorch — 65 problemas de entrevista de ML/IA de entrevistas reais no Google, Meta e Anthropic. Inclui notebooks Jupyter, um avaliador automático e um tutor de IA MCP.
★ 2.461+12Variação de estrelas nos últimos 7 dias - #19★ 2.357+11Variação de estrelas nos últimos 7 dias
- #20
Um avaliador automático para modelos de linguagem de seguimento de instruções. Validado por humanos, de alta qualidade, barato e rápido.
★ 2.012-1Variação de estrelas nos últimos 7 dias - #21
Lista Awesome para Aprendizado por Reforço Agêntico (Agentic RL)
★ 1.832+29Variação de estrelas nos últimos 7 dias - #22
[NeurIPS 2023] ImageReward: Aprendendo e avaliando preferências humanas para geração de texto para imagem
★ 1.703+1Variação de estrelas nos últimos 7 dias - #23
Safe RLHF: Alinhamento de valor restrito via Aprendizado por Reforço Seguro a partir de Feedback Humano
★ 1.613+1Variação de estrelas nos últimos 7 dias - #24★ 1.601-1Variação de estrelas nos últimos 7 dias
- #25
Receitas para treinar modelos de recompensa para RLHF.
★ 1.541+0Variação de estrelas nos últimos 7 dias - #26★ 1.430+0Variação de estrelas nos últimos 7 dias
- #27
Xtreme1 é uma plataforma de rotulagem e anotação de dados tudo-em-um para treinamento de dados multimodais, com suporte para nuvens de pontos LiDAR 3D, imagens e LLMs.
★ 1.239+2Variação de estrelas nos últimos 7 dias - #28
[NeurIPS 2024] SimPO: Simple Preference Optimization with a Reference-Free Reward
★ 959+1Variação de estrelas nos últimos 7 dias - #29★ 955+60Variação de estrelas nos últimos 7 dias
- #30
O "AI-Compass" guiará a comunidade na navegação pelo oceano da tecnologia de IA; seja você um iniciante ou um desenvolvedor avançado, encontrará aqui o caminho para as principais direções da IA. O objetivo é ajudar os desenvolvedores a entender sistematicamente os conceitos principais de IA, tecnologias tradicionais, tendências de ponta e dominar todo o processo, da teoria à implementação prática, por meio da prática.
★ 933+10Variação de estrelas nos últimos 7 dias