मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · rlhf

rlhf

rlhf टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
44
कुल स्टार
2,23,657
औसत स्टार
5,083
हिस्सा
0.01%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर rlhf के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और rlhf टैग वाली रिपॉजिटरी।

पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।

  • LlamaFactory@hiyouga

    100+ LLMs और VLMs की यूनिफाइड एफिशिएंट फाइन-ट्यूनिंग (ACL 2024)

    74,532+89पिछले 7 दिनों में स्टार का बदलाव
  • Open-Assistant@LAION-AI

    OpenAssistant एक चैट-आधारित असिस्टेंट है जो कार्यों को समझता है, थर्ड-पार्टी सिस्टम के साथ इंटरैक्ट कर सकता है, और ऐसा करने के लिए गतिशील रूप से जानकारी पुनः प्राप्त कर सकता है।

    37,401-7पिछले 7 दिनों में स्टार का बदलाव
  • LLMSurvey@RUCAIBox

    सर्वेक्षण पत्र "A Survey of Large Language Models" के लिए आधिकारिक GitHub पेज।

    12,208+2पिछले 7 दिनों में स्टार का बदलाव
  • InternLM@InternLM

    InternLM श्रृंखला (InternLM, InternLM2, InternLM2.5, InternLM3) का आधिकारिक रिलीज़।

    7,277+4पिछले 7 दिनों में स्टार का बदलाव
  • चाइनीज LLaMA-2 और Alpaca-2 LLM दूसरा चरण प्रोजेक्ट + 64K लॉन्ग कॉन्टेक्स्ट मॉडल (Chinese LLaMA-2 & Alpaca-2 LLMs with 64K long context models)

    7,120+0पिछले 7 दिनों में स्टार का बदलाव
  • alignment-handbook@huggingface

    मानव और AI प्राथमिकताओं के साथ language models को संरेखित करने के लिए मजबूत रेसिपी

    5,670-3पिछले 7 दिनों में स्टार का बदलाव
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: बस बात करके किसी भी एजेंट को प्रशिक्षित करें

    5,665+7पिछले 7 दिनों में स्टार का बदलाव
  • transformerlab-app@transformerlab

    AI शोधकर्ताओं के लिए स्थानीय हार्डवेयर से GPU क्लस्टर तक मॉडल को सहजता से प्रशिक्षित करने, मूल्यांकन करने और स्केल करने के लिए ओपन सोर्स अनुसंधान वातावरण।

    5,185+3पिछले 7 दिनों में स्टार का बदलाव
  • reasoning-from-scratch@rasbt

    PyTorch में शुरुआत से, चरण-दर-चरण एक रीज़निंग LLM लागू करें।

    5,138+49पिछले 7 दिनों में स्टार का बदलाव
  • argilla@argilla-io

    Argilla उच्च गुणवत्ता वाले डेटासेट बनाने के लिए AI इंजीनियरों और डोमेन विशेषज्ञों के लिए एक सहयोग टूल है

    5,093+5पिछले 7 दिनों में स्टार का बदलाव
  • Kiln@Kiln-AI

    AI सिस्टम बनाएं, मूल्यांकन करें और अनुकूलित करें। इसमें मूल्यांकन, RAG, एजेंट, फाइन-ट्यूनिंग, सिंथेटिक डेटा जनरेशन, डेटासेट प्रबंधन, MCP और बहुत कुछ शामिल है।

    5,042+5पिछले 7 दिनों में स्टार का बदलाव
  • align-anything@PKU-Alignment

    Align Anything: फीडबैक के साथ ऑल-मोडैलिटी मॉडल को प्रशिक्षित करना

    4,671+3पिछले 7 दिनों में स्टार का बदलाव
  • awesome-RLHF@opendilab

    ह्यूमन फीडबैक के साथ रीइंफोर्समेंट लर्निंग संसाधनों की एक क्यूरेटेड सूची (लगातार अपडेट की जाती है)

    4,424+2पिछले 7 दिनों में स्टार का बदलाव
  • hands-on-modern-rl@walkinglabs

    🚀 बुनियादी RL अवधारणाओं से LLM संरेखण, RLVR, और उन्नत एजेंटिक प्रणालियों के बीच की खाई को पाटने वाला एक ओपन-सोर्स, व्यावहारिक पाठ्यक्रम।

    4,199+54पिछले 7 दिनों में स्टार का बदलाव
  • docta@Docta-ai

    आपके डेटा के लिए एक डॉक्टर

    3,485-1पिछले 7 दिनों में स्टार का बदलाव
  • distilabel@argilla-io

    Distilabel उन इंजीनियरों के लिए सिंथेटिक डेटा और AI फीडबैक के लिए एक फ्रेमवर्क है जिन्हें सत्यापित शोध पत्रों के आधार पर तेज़, विश्वसनीय और स्केलेबल पाइपलाइन की आवश्यकता होती है।

    3,384+3पिछले 7 दिनों में स्टार का बदलाव
  • ROLL@alibaba

    लार्ज लैंग्वेज मॉडल के साथ रीइंफोर्समेंट लर्निंग के लिए एक कुशल और उपयोगकर्ता के अनुकूल स्केलिंग लाइब्रेरी

    3,380+6पिछले 7 दिनों में स्टार का बदलाव
  • TorchLeet@Exorust

    PyTorch के लिए LeetCode — Google, Meta, Anthropic के वास्तविक साक्षात्कारों से 65 ML/AI साक्षात्कार समस्याएँ। Jupyter नोटबुक, एक ऑटो-ग्रेडर, और एक MCP AI ट्यूटर।

    2,461+12पिछले 7 दिनों में स्टार का बदलाव
  • rlhf-book@natolambert

    मानव प्रतिक्रिया से सुदृढीकरण सीखने (RLHF) पर पाठ्यपुस्तक

    2,357+11पिछले 7 दिनों में स्टार का बदलाव
  • alpaca_eval@tatsu-lab

    निर्देश-पालन करने वाले भाषा मॉडल के लिए एक स्वचालित मूल्यांकनकर्ता। मानव-सत्यापित, उच्च-गुणवत्ता, सस्ती और तेज़।

    2,012-1पिछले 7 दिनों में स्टार का बदलाव
  • AgentsMeetRL@thinkwee

    Agentic RL के लिए ऑसम लिस्ट

    1,832+29पिछले 7 दिनों में स्टार का बदलाव
  • ImageReward@zai-org

    [NeurIPS 2023] ImageReward: टेक्स्ट-टू-इमेज जनरेशन के लिए मानवीय प्राथमिकताओं को सीखना और मूल्यांकन करना

    1,703+1पिछले 7 दिनों में स्टार का बदलाव
  • safe-rlhf@PKU-Alignment

    Safe RLHF: Safe Reinforcement Learning from Human Feedback के माध्यम से प्रतिबंधित वैल्यू एलाइनमेंट

    1,613+1पिछले 7 दिनों में स्टार का बदलाव
  • WebGLM@THUDM

    WebGLM: एक कुशल वेब-वर्धित प्रश्न उत्तर प्रणाली (KDD 2023)

    1,601-1पिछले 7 दिनों में स्टार का बदलाव
  • RLHF के लिए रिवार्ड मॉडल को प्रशिक्षित करने की विधियाँ।

    1,541+0पिछले 7 दिनों में स्टार का बदलाव
  • MOSS-RLHF@OpenLMLab

    लार्ज लैंग्वेज मॉडल में RLHF के रहस्य भाग I: PPO

    1,430+0पिछले 7 दिनों में स्टार का बदलाव
  • xtreme1@xtreme1-io

    Xtreme1 मल्टीमॉडल डेटा ट्रेनिंग के लिए एक ऑल-इन-वन डेटा लेबलिंग और एनोटेशन प्लेटफॉर्म है और यह 3D LiDAR पॉइंट क्लाउड, इमेज और LLM को सपोर्ट करता है।

    1,239+2पिछले 7 दिनों में स्टार का बदलाव
  • verl-omni@verl-project

    डिफ्यूजन और ओम्नी मॉडल के लिए मल्टीमॉडल RL प्रशिक्षण फ्रेमवर्क

    959+60पिछले 7 दिनों में स्टार का बदलाव
  • SimPO@princeton-nlp

    [NeurIPS 2024] SimPO: एक संदर्भ-मुक्त रिवार्ड के साथ सरल प्राथमिकता अनुकूलन।

    959+1पिछले 7 दिनों में स्टार का बदलाव
  • AI-Compass@tingaicompass

    “AI-Compass” समुदाय को AI तकनीक के महासागर में नेविगेट करने के लिए मार्गदर्शन प्रदान करेगा, चाहे आप शुरुआती हों या उन्नत डेवलपर, आप यहाँ AI के सभी क्षेत्रों के लिए मार्ग पा सकते हैं। इसका उद्देश्य डेवलपर्स को AI की मुख्य अवधारणाओं, मुख्यधारा की तकनीकों और अत्याधुनिक रुझानों को व्यवस्थित रूप से समझने में मदद करना है, और अभ्यास के माध्यम से सिद्धांत से कार्यान्वयन तक की प्रक्रिया में महारत हासिल करना है।

    933+10पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस