मुख्य सामग्री पर जाएँ
buildradar
साइन इन करें

TsinghuaC3I/Awesome-RL-for-LRMs

@TsinghuaC3I

लार्ज रीजनिंग मॉडल के लिए सुदृढीकरण शिक्षण (Reinforcement Learning) का एक सर्वेक्षण

स्टार
2,483
फ़ोर्क
133
भाषा
TeX
लाइसेंस
MIT
आख़िरी push
3 सप्ताह पहले
TeXopen-sourceawesome-listllmrlreasoningdeepseek-r1lrm

अभी कोई संबंधित intel नहीं

यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।