dpo
dpo टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर dpo के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और dpo टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1★ 9,383+3पिछले 7 दिनों में स्टार का बदलाव
- #2
MedicalGPT: ChatGPT ट्रेनिंग पाइपलाइन के साथ अपना खुद का मेडिकल GPT मॉडल प्रशिक्षित करना। इसमें इंक्रीमेंटल प्री-ट्रेनिंग (PT), सुपरवाइज्ड फाइन-ट्यूनिंग (SFT), RLHF, DPO, ORPO और GRPO शामिल हैं।
★ 5,771+12पिछले 7 दिनों में स्टार का बदलाव - #3
एक YAML से LLM को फाइन-ट्यून करें। लेयर स्ट्रीमिंग 4 GB लैपटॉप GPU पर 8B मॉडल को प्रशिक्षित करती है।
★ 4,929+1,365पिछले 7 दिनों में स्टार का बदलाव - #4
Align Anything: फीडबैक के साथ ऑल-मोडैलिटी मॉडल को प्रशिक्षित करना
★ 4,671+3पिछले 7 दिनों में स्टार का बदलाव - #5
🚀 बुनियादी RL अवधारणाओं से LLM संरेखण, RLVR, और उन्नत एजेंटिक प्रणालियों के बीच की खाई को पाटने वाला एक ओपन-सोर्स, व्यावहारिक पाठ्यक्रम।
★ 4,199+54पिछले 7 दिनों में स्टार का बदलाव - #6
DPO, KTO, PPO, ORPO और अन्य ह्यूमन-अवेयर लॉस फंक्शन्स (HALOs) के विस्तार योग्य कार्यान्वयन वाली एक लाइब्रेरी।
★ 909-1पिछले 7 दिनों में स्टार का बदलाव - #7
[ICCV 2025] DeepMesh का आधिकारिक कोड: रीइन्फोर्समेंट लर्निंग के साथ ऑटो-रिग्रेसिव आर्टिस्ट-मेश क्रिएशन
★ 736+1पिछले 7 दिनों में स्टार का बदलाव - #8
🌾 OAT: LLM ऑनलाइन अलाइनमेंट के लिए एक शोध-अनुकूल फ़्रेमवर्क, जिसमें रीइन्फोर्समेंट लर्निंग, प्रेफरेंस लर्निंग आदि शामिल हैं।
★ 669-1पिछले 7 दिनों में स्टार का बदलाव - #9
LLMs की आसान और कुशल फाइन-ट्यूनिंग। (LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon समर्थित)
★ 621+0पिछले 7 दिनों में स्टार का बदलाव - #10
वीडियो जनरेशन के लिए रीइन्फोर्समेंट लर्निंग पर शोध पत्रों की एक क्यूरेटेड सूची
★ 591+1पिछले 7 दिनों में स्टार का बदलाव - #11
TensorFlow का उपयोग करके टेक्स्ट प्रीप्रोसेसिंग से लेकर Topic Models, BERT, GPT और LLM जैसे आधुनिक मॉडलों के डाउनस्ट्रीम कार्यों को व्यवस्थित करने वाला एक डीप लर्निंग NLP रिपॉजिटरी।
★ 581+0पिछले 7 दिनों में स्टार का बदलाव