rlhf
Dépôts open source suivis étiquetés rlhf, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de rlhf sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés rlhf.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Fine-tuning efficace et unifié de plus de 100 LLM et VLM (ACL 2024).
★ 74 532+89Évolution des étoiles sur les 7 derniers jours - #2
OpenAssistant est un assistant conversationnel capable de comprendre des tâches, d'interagir avec des systèmes tiers et de récupérer des informations dynamiquement.
★ 37 401-7Évolution des étoiles sur les 7 derniers jours - #3
Page GitHub officielle de l'article de synthèse A Survey of Large Language Models
★ 12 208+2Évolution des étoiles sur les 7 derniers jours - #4
Publication officielle de la série InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).
★ 7 277+4Évolution des étoiles sur les 7 derniers jours - #5
Projet de phase 2 pour les grands modèles LLaMA-2 et Alpaca-2 en chinois, incluant des modèles avec un contexte étendu de 64K.
★ 7 120+0Évolution des étoiles sur les 7 derniers jours - #6
Recettes robustes pour aligner les modèles de langage avec les préférences humaines et celles de l'IA.
★ 5 670-3Évolution des étoiles sur les 7 derniers jours - #7
OpenClaw-RL : Entraînez n'importe quel agent simplement par la parole.
★ 5 665+7Évolution des étoiles sur les 7 derniers jours - #8
Environnement de recherche open source permettant aux chercheurs en IA d'entraîner, d'évaluer et de mettre à l'échelle des modèles de manière transparente, du matériel local aux clusters GPU.
★ 5 185+3Évolution des étoiles sur les 7 derniers jours - #9
Implémenter un LLM de raisonnement en PyTorch à partir de zéro, étape par étape.
★ 5 138+49Évolution des étoiles sur les 7 derniers jours - #10
Argilla est un outil de collaboration destiné aux ingénieurs en IA et aux experts métier pour créer des jeux de données de haute qualité.
★ 5 093+5Évolution des étoiles sur les 7 derniers jours - #11
Construisez, évaluez et optimisez des systèmes d'IA. Inclut des évaluations, RAG, agents, fine-tuning, génération de données synthétiques, gestion de jeux de données, MCP, et plus encore.
★ 5 042+5Évolution des étoiles sur les 7 derniers jours - #12
Align Anything : Entraînement de modèles multimodaux avec rétroaction.
★ 4 671+3Évolution des étoiles sur les 7 derniers jours - #13
Une liste organisée de ressources sur l'apprentissage par renforcement à partir de rétroaction humaine (mise à jour continue).
★ 4 424+2Évolution des étoiles sur les 7 derniers jours - #14
Un programme open-source pratique pour faire le pont entre les concepts de base de l'apprentissage par renforcement (RL) et l'alignement des LLM, RLVR et les systèmes d'agents avancés.
★ 4 199+54Évolution des étoiles sur les 7 derniers jours - #15★ 3 485-1Évolution des étoiles sur les 7 derniers jours
- #16
Distilabel est un framework de données synthétiques et de rétroaction IA pour les ingénieurs ayant besoin de pipelines rapides, fiables et évolutifs basés sur des articles de recherche vérifiés.
★ 3 384+3Évolution des étoiles sur les 7 derniers jours - #17
Une bibliothèque de mise à l'échelle efficace et conviviale pour l'apprentissage par renforcement avec des modèles de langage étendus
★ 3 380+6Évolution des étoiles sur les 7 derniers jours - #18
LeetCode pour PyTorch : 65 problèmes d'entretien ML/IA issus d'entretiens réels chez Google, Meta et Anthropic. Inclut des notebooks Jupyter, un auto-correcteur et un tuteur IA MCP.
★ 2 461+12Évolution des étoiles sur les 7 derniers jours - #19
Manuel sur l'apprentissage par renforcement à partir de la rétroaction humaine (RLHF).
★ 2 357+11Évolution des étoiles sur les 7 derniers jours - #20
Un évaluateur automatique pour les modèles de langage suivant des instructions. Validé par l'humain, de haute qualité, économique et rapide.
★ 2 012-1Évolution des étoiles sur les 7 derniers jours - #21
Liste Awesome pour l'apprentissage par renforcement agentique (Agentic RL).
★ 1 832+29Évolution des étoiles sur les 7 derniers jours - #22
[NeurIPS 2023] ImageReward : Apprentissage et évaluation des préférences humaines pour la génération texte-image.
★ 1 703+1Évolution des étoiles sur les 7 derniers jours - #23
Safe RLHF : Alignement de valeur contraint via l'apprentissage par renforcement sécurisé à partir de la rétroaction humaine
★ 1 613+1Évolution des étoiles sur les 7 derniers jours - #24★ 1 601-1Évolution des étoiles sur les 7 derniers jours
- #25
Recettes pour entraîner un modèle de récompense pour le RLHF.
★ 1 541+0Évolution des étoiles sur les 7 derniers jours - #26★ 1 430+0Évolution des étoiles sur les 7 derniers jours
- #27
Xtreme1 est une plateforme tout-en-un d'étiquetage et d'annotation de données pour l'entraînement multimodal, prenant en charge les nuages de points LiDAR 3D, les images et les LLM.
★ 1 239+2Évolution des étoiles sur les 7 derniers jours - #28
[NeurIPS 2024] SimPO : Optimisation simple des préférences avec une récompense sans référence
★ 959+1Évolution des étoiles sur les 7 derniers jours - #29★ 955+60Évolution des étoiles sur les 7 derniers jours
- #30
AI-Compass guide la communauté à travers l'océan des technologies IA, offrant des parcours pour les débutants comme pour les développeurs avancés. Il vise à aider les développeurs à comprendre systématiquement les concepts fondamentaux, les technologies dominantes et les tendances de l'IA, tout en maîtrisant le passage de la théorie à la pratique.
★ 933+10Évolution des étoiles sur les 7 derniers jours