rlhf
rlhf टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31
DPO, KTO, PPO, ORPO और अन्य ह्यूमन-अवेयर लॉस फंक्शन्स (HALOs) के विस्तार योग्य कार्यान्वयन वाली एक लाइब्रेरी।
★ 909-1पिछले 7 दिनों में स्टार का बदलाव - #32★ 820+14पिछले 7 दिनों में स्टार का बदलाव
- #33
लार्ज लैंग्वेज मॉडल्स के ऑन-पॉलिसी डिस्टिलेशन (OPD) के लिए पेपर्स, तकनीकी रिपोर्ट्स, फ्रेमवर्क्स और टूल्स का एक क्यूरेटेड संग्रह
★ 794+31पिछले 7 दिनों में स्टार का बदलाव - #34
RewardBench: रिवॉर्ड मॉडल के लिए पहला मूल्यांकन उपकरण।
★ 735+2पिछले 7 दिनों में स्टार का बदलाव - #35
Trinity-RFT लार्ज लैंग्वेज मॉडल्स (LLM) के रीइन्फोर्समेंट फाइन-ट्यूनिंग (RFT) के लिए डिज़ाइन किया गया एक सामान्य-उद्देश्य, लचीला और स्केलेबल फ्रेमवर्क है।
★ 698+2पिछले 7 दिनों में स्टार का बदलाव - #36
🌾 OAT: LLM ऑनलाइन अलाइनमेंट के लिए एक शोध-अनुकूल फ़्रेमवर्क, जिसमें रीइन्फोर्समेंट लर्निंग, प्रेफरेंस लर्निंग आदि शामिल हैं।
★ 669-1पिछले 7 दिनों में स्टार का बदलाव - #37
RLAnything (ICML 2026) और AutoTool (ICML 2026), DemyAgent: LLMs और एजेंटिक परिदृश्यों के लिए ओपन-सोर्स RL।
★ 634+9पिछले 7 दिनों में स्टार का बदलाव - #38
LLMs की आसान और कुशल फाइन-ट्यूनिंग। (LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon समर्थित)
★ 621+0पिछले 7 दिनों में स्टार का बदलाव - #39
बड़े पैमाने पर ऑम्नी-मोडल पोस्ट-ट्रेनिंग के लिए एक एसिंक्रोनस रिइंफोर्समेंट लर्निंग इंजन।
★ 592+11पिछले 7 दिनों में स्टार का बदलाव - #40★ 589+0पिछले 7 दिनों में स्टार का बदलाव
- #41
huggingface के ट्रांसफॉर्मर (blommz-176B/bloom/gpt/bart/T5/MetaICL) में किसी भी जनरेशन मॉडल पर ChatGPT RLHF (Reinforcement Learning with Human Feedback) का कार्यान्वयन
★ 564+0पिछले 7 दिनों में स्टार का बदलाव - #42
ऑनलाइन RLHF और ऑनलाइन इटरेशन DPO के लिए एक रेसिपी।
★ 544+0पिछले 7 दिनों में स्टार का बदलाव - #43
लार्ज लैंग्वेज मॉडल्स के लिए ऑन-पॉलिसी डिस्टिलेशन पर शोध पत्रों और संसाधनों का एक क्यूरेटेड संग्रह।
★ 535+10पिछले 7 दिनों में स्टार का बदलाव - #44
[ICLR 2026] TraceRL के लिए आधिकारिक कोड: Diffusion LLMs के लिए पोस्ट-ट्रेनिंग में क्रांति, जो SOTA TraDo सीरीज़ को संचालित करता है।
★ 520+1पिछले 7 दिनों में स्टार का बदलाव