Aller au contenu principal
buildradar
Sign in
Sujet · rlhf

rlhf

Dépôts open source suivis étiquetés rlhf, triés par étoiles.

Dépôts
44
Total d'étoiles
223 657
Étoiles en moyenne
5 083
Part
0,01%

Sujets qui apparaissent souvent aux côtés de rlhf sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés rlhf.

Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.

  • LlamaFactory@hiyouga

    Fine-tuning efficace et unifié de plus de 100 LLM et VLM (ACL 2024).

    74 532+89Évolution des étoiles sur les 7 derniers jours
  • Open-Assistant@LAION-AI

    OpenAssistant est un assistant conversationnel capable de comprendre des tâches, d'interagir avec des systèmes tiers et de récupérer des informations dynamiquement.

    37 401-7Évolution des étoiles sur les 7 derniers jours
  • LLMSurvey@RUCAIBox

    Page GitHub officielle de l'article de synthèse A Survey of Large Language Models

    12 208+2Évolution des étoiles sur les 7 derniers jours
  • InternLM@InternLM

    Publication officielle de la série InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).

    7 277+4Évolution des étoiles sur les 7 derniers jours
  • Projet de phase 2 pour les grands modèles LLaMA-2 et Alpaca-2 en chinois, incluant des modèles avec un contexte étendu de 64K.

    7 120+0Évolution des étoiles sur les 7 derniers jours
  • alignment-handbook@huggingface

    Recettes robustes pour aligner les modèles de langage avec les préférences humaines et celles de l'IA.

    5 670-3Évolution des étoiles sur les 7 derniers jours
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL : Entraînez n'importe quel agent simplement par la parole.

    5 665+7Évolution des étoiles sur les 7 derniers jours
  • transformerlab-app@transformerlab

    Environnement de recherche open source permettant aux chercheurs en IA d'entraîner, d'évaluer et de mettre à l'échelle des modèles de manière transparente, du matériel local aux clusters GPU.

    5 185+3Évolution des étoiles sur les 7 derniers jours
  • reasoning-from-scratch@rasbt

    Implémenter un LLM de raisonnement en PyTorch à partir de zéro, étape par étape.

    5 138+49Évolution des étoiles sur les 7 derniers jours
  • argilla@argilla-io

    Argilla est un outil de collaboration destiné aux ingénieurs en IA et aux experts métier pour créer des jeux de données de haute qualité.

    5 093+5Évolution des étoiles sur les 7 derniers jours
  • Kiln@Kiln-AI

    Construisez, évaluez et optimisez des systèmes d'IA. Inclut des évaluations, RAG, agents, fine-tuning, génération de données synthétiques, gestion de jeux de données, MCP, et plus encore.

    5 042+5Évolution des étoiles sur les 7 derniers jours
  • align-anything@PKU-Alignment

    Align Anything : Entraînement de modèles multimodaux avec rétroaction.

    4 671+3Évolution des étoiles sur les 7 derniers jours
  • awesome-RLHF@opendilab

    Une liste organisée de ressources sur l'apprentissage par renforcement à partir de rétroaction humaine (mise à jour continue).

    4 424+2Évolution des étoiles sur les 7 derniers jours
  • hands-on-modern-rl@walkinglabs

    Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.

    4 199+54Évolution des étoiles sur les 7 derniers jours
  • docta@Docta-ai

    Un docteur pour vos données

    3 485-1Évolution des étoiles sur les 7 derniers jours
  • distilabel@argilla-io

    Distilabel est un framework de données synthétiques et de rétroaction IA pour les ingénieurs ayant besoin de pipelines rapides, fiables et évolutifs basés sur des articles de recherche vérifiés.

    3 384+3Évolution des étoiles sur les 7 derniers jours
  • ROLL@alibaba

    Une bibliothèque de mise à l'échelle efficace et conviviale pour l'apprentissage par renforcement avec des modèles de langage étendus

    3 380+6Évolution des étoiles sur les 7 derniers jours
  • TorchLeet@Exorust

    LeetCode pour PyTorch : 65 problèmes d'entretien ML/IA issus d'entretiens réels chez Google, Meta et Anthropic. Inclut des notebooks Jupyter, un auto-correcteur et un tuteur IA MCP.

    2 461+12Évolution des étoiles sur les 7 derniers jours
  • rlhf-book@natolambert

    Manuel sur l'apprentissage par renforcement à partir de la rétroaction humaine (RLHF).

    2 357+11Évolution des étoiles sur les 7 derniers jours
  • alpaca_eval@tatsu-lab

    Un évaluateur automatique pour les modèles de langage suivant des instructions. Validé par l'humain, de haute qualité, économique et rapide.

    2 012-1Évolution des étoiles sur les 7 derniers jours
  • AgentsMeetRL@thinkwee

    Liste Awesome pour l'apprentissage par renforcement agentique (Agentic RL).

    1 832+29Évolution des étoiles sur les 7 derniers jours
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward : Apprentissage et évaluation des préférences humaines pour la génération texte-image.

    1 703+1Évolution des étoiles sur les 7 derniers jours
  • safe-rlhf@PKU-Alignment

    Safe RLHF : Alignement de valeur contraint via l'apprentissage par renforcement sécurisé à partir de la rétroaction humaine

    1 613+1Évolution des étoiles sur les 7 derniers jours
  • WebGLM@THUDM

    WebGLM : un système de réponse aux questions efficace enrichi par le Web (KDD 2023)

    1 601-1Évolution des étoiles sur les 7 derniers jours
  • Recettes pour entraîner un modèle de récompense pour le RLHF.

    1 541+0Évolution des étoiles sur les 7 derniers jours
  • MOSS-RLHF@OpenLMLab

    Secrets du RLHF dans les grands modèles de langage, partie I : PPO

    1 430+0Évolution des étoiles sur les 7 derniers jours
  • xtreme1@xtreme1-io

    Xtreme1 est une plateforme tout-en-un d'étiquetage et d'annotation de données pour l'entraînement multimodal, prenant en charge les nuages de points LiDAR 3D, les images et les LLM.

    1 239+2Évolution des étoiles sur les 7 derniers jours
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO : Optimisation simple des préférences avec une récompense sans référence

    959+1Évolution des étoiles sur les 7 derniers jours
  • verl-omni@verl-project

    Framework d'entraînement RL multimodal pour modèles de diffusion et omni

    955+60Évolution des étoiles sur les 7 derniers jours
  • AI-Compass@tingaicompass

    AI-Compass guide la communauté à travers l'océan des technologies IA, offrant des parcours pour les débutants comme pour les développeurs avancés. Il vise à aider les développeurs à comprendre systématiquement les concepts fondamentaux, les technologies dominantes et les tendances de l'IA, tout en maîtrisant le passage de la théorie à la pratique.

    933+10Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets