Pular para o conteúdo principal
buildradar
Sign in
Tópico · rlhf

rlhf

Repositórios de código aberto acompanhados marcados com rlhf, ordenados por estrelas.

Repositórios
44
Total de estrelas
223.657
Média de estrelas
5.083
Participação
0,01%

Tópicos que aparecem com frequência ao lado de rlhf no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com rlhf.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • LlamaFactory@hiyouga

    Ajuste fino eficiente e unificado de mais de 100 LLMs e VLMs (ACL 2024)

    74.532+89Variação de estrelas nos últimos 7 dias
  • Open-Assistant@LAION-AI

    OpenAssistant é um assistente baseado em chat que entende tarefas, pode interagir com sistemas de terceiros e recuperar informações dinamicamente para isso.

    37.401-7Variação de estrelas nos últimos 7 dias
  • LLMSurvey@RUCAIBox

    Página oficial do GitHub para o artigo de revisão "A Survey of Large Language Models".

    12.208+2Variação de estrelas nos últimos 7 dias
  • InternLM@InternLM

    Lançamento oficial da série InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).

    7.277+4Variação de estrelas nos últimos 7 dias
  • Projeto fase 2 de LLMs Chinese LLaMA-2 & Alpaca-2 + modelos de contexto ultralongo de 64K (Chinese LLaMA-2 & Alpaca-2 LLMs com modelos de contexto longo de 64K)

    7.120+0Variação de estrelas nos últimos 7 dias
  • alignment-handbook@huggingface

    Receitas robustas para alinhar modelos de linguagem com preferências humanas e de IA

    5.670-3Variação de estrelas nos últimos 7 dias
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: Treine qualquer agente simplesmente conversando

    5.665+7Variação de estrelas nos últimos 7 dias
  • transformerlab-app@transformerlab

    O ambiente de pesquisa de código aberto para pesquisadores de IA treinarem, avaliarem e escalarem modelos perfeitamente, desde hardware local até clusters de GPU.

    5.185+3Variação de estrelas nos últimos 7 dias
  • reasoning-from-scratch@rasbt

    Implemente um LLM de raciocínio em PyTorch do zero, passo a passo

    5.138+49Variação de estrelas nos últimos 7 dias
  • argilla@argilla-io

    Argilla é uma ferramenta de colaboração para engenheiros de IA e especialistas de domínio construírem conjuntos de dados de alta qualidade

    5.093+5Variação de estrelas nos últimos 7 dias
  • Kiln@Kiln-AI

    Construa, avalie e otimize sistemas de IA. Inclui avaliações, RAG, agentes, ajuste fino, geração de dados sintéticos, gerenciamento de conjuntos de dados, MCP e muito mais.

    5.042+5Variação de estrelas nos últimos 7 dias
  • align-anything@PKU-Alignment

    Align Anything: Treinamento de modelos multimodais com feedback

    4.671+3Variação de estrelas nos últimos 7 dias
  • awesome-RLHF@opendilab

    Uma lista curada de recursos sobre aprendizado por reforço com feedback humano (atualizada continuamente).

    4.424+2Variação de estrelas nos últimos 7 dias
  • hands-on-modern-rl@walkinglabs

    Um currículo prático de código aberto que preenche a lacuna entre conceitos básicos de RL e alinhamento de LLM, RLVR e sistemas de agentes avançados.

    4.199+54Variação de estrelas nos últimos 7 dias
  • docta@Docta-ai

    Um médico para seus dados

    3.485-1Variação de estrelas nos últimos 7 dias
  • distilabel@argilla-io

    Distilabel é um framework para dados sintéticos e feedback de IA para engenheiros que precisam de pipelines rápidos, confiáveis e escaláveis baseados em artigos de pesquisa verificados.

    3.384+3Variação de estrelas nos últimos 7 dias
  • ROLL@alibaba

    Uma biblioteca de escalabilidade eficiente e amigável para aprendizado por reforço com Large Language Models

    3.380+6Variação de estrelas nos últimos 7 dias
  • TorchLeet@Exorust

    LeetCode para PyTorch — 65 problemas de entrevista de ML/IA de entrevistas reais no Google, Meta e Anthropic. Inclui notebooks Jupyter, um avaliador automático e um tutor de IA MCP.

    2.461+12Variação de estrelas nos últimos 7 dias
  • rlhf-book@natolambert

    Livro didático sobre aprendizado por reforço com feedback humano

    2.357+11Variação de estrelas nos últimos 7 dias
  • alpaca_eval@tatsu-lab

    Um avaliador automático para modelos de linguagem de seguimento de instruções. Validado por humanos, de alta qualidade, barato e rápido.

    2.012-1Variação de estrelas nos últimos 7 dias
  • AgentsMeetRL@thinkwee

    Lista Awesome para Aprendizado por Reforço Agêntico (Agentic RL)

    1.832+29Variação de estrelas nos últimos 7 dias
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward: Aprendendo e avaliando preferências humanas para geração de texto para imagem

    1.703+1Variação de estrelas nos últimos 7 dias
  • safe-rlhf@PKU-Alignment

    Safe RLHF: Alinhamento de valor restrito via Aprendizado por Reforço Seguro a partir de Feedback Humano

    1.613+1Variação de estrelas nos últimos 7 dias
  • WebGLM@THUDM

    WebGLM: Um sistema de resposta a perguntas eficiente aprimorado pela Web (KDD 2023)

    1.601-1Variação de estrelas nos últimos 7 dias
  • Receitas para treinar modelos de recompensa para RLHF.

    1.541+0Variação de estrelas nos últimos 7 dias
  • MOSS-RLHF@OpenLMLab

    Segredos do RLHF em Large Language Models Parte I: PPO.

    1.430+0Variação de estrelas nos últimos 7 dias
  • xtreme1@xtreme1-io

    Xtreme1 é uma plataforma de rotulagem e anotação de dados tudo-em-um para treinamento de dados multimodais, com suporte para nuvens de pontos LiDAR 3D, imagens e LLMs.

    1.239+2Variação de estrelas nos últimos 7 dias
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO: Simple Preference Optimization with a Reference-Free Reward

    959+1Variação de estrelas nos últimos 7 dias
  • verl-omni@verl-project

    Framework de treinamento de RL multimodal para modelos de difusão e omni

    955+60Variação de estrelas nos últimos 7 dias
  • AI-Compass@tingaicompass

    O "AI-Compass" guiará a comunidade na navegação pelo oceano da tecnologia de IA; seja você um iniciante ou um desenvolvedor avançado, encontrará aqui o caminho para as principais direções da IA. O objetivo é ajudar os desenvolvedores a entender sistematicamente os conceitos principais de IA, tecnologias tradicionais, tendências de ponta e dominar todo o processo, da teoria à implementação prática, por meio da prática.

    933+10Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos