evaluation
evaluation टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #61★ 768+0पिछले 7 दिनों में स्टार का बदलाव
- #62
[EMNLP 2024 & AAAI 2026] LLMs, VLMs और वीडियो जेनरेटिव मॉडल सहित बड़े मॉडलों को कंप्रेस करने के लिए एक शक्तिशाली टूलकिट।
★ 747+4पिछले 7 दिनों में स्टार का बदलाव - #63
🦞 OpenClaw के लिए आधिकारिक प्लगइन जो एजेंट ट्रेसेस को Opik में एक्सपोर्ट करता है। एजेंट के व्यवहार, लागत, टोकन, त्रुटियों और अन्य चीजों को देखें और मॉनिटर करें।
★ 725+0पिछले 7 दिनों में स्टार का बदलाव - #64
IOU Tracker का Python कार्यान्वयन
★ 702+0पिछले 7 दिनों में स्टार का बदलाव - #65★ 698+4पिछले 7 दिनों में स्टार का बदलाव
- #66
लार्ज लैंग्वेज मॉडल में लॉन्ग-फॉर्म तथ्यात्मकता की बेंचमार्किंग। हमारे पेपर "लॉन्ग-फॉर्म फैक्चुअलिटी इन लार्ज लैंग्वेज मॉडल्स" के लिए मूल कोड।
★ 693+2पिछले 7 दिनों में स्टार का बदलाव - #67★ 675+61पिछले 7 दिनों में स्टार का बदलाव
- #68
Awesome-LLM-Eval: मुख्य रूप से LLM मूल्यांकन के लिए टूल, डेटासेट/बेंचमार्क, डेमो, लीडरबोर्ड, पेपर, डॉक्स और मॉडल की एक क्यूरेटेड सूची।
★ 656-2पिछले 7 दिनों में स्टार का बदलाव - #69
AutoPrompt: मास्क किए गए भाषा मॉडल के लिए स्वचालित प्रॉम्प्ट निर्माण।
★ 641+0पिछले 7 दिनों में स्टार का बदलाव - #70★ 632+2पिछले 7 दिनों में स्टार का बदलाव
- #71
एक C# फ़ाइल में सरल गणित और स्यूडो C# एक्सप्रेशन इवैल्यूएटर। यह छोटे C# जैसे स्क्रिप्ट भी चला सकता है
★ 630+0पिछले 7 दिनों में स्टार का बदलाव - #72
Large Language Models में मशीन अनलर्निंग के लिए एक संसाधन रिपॉजिटरी
★ 624+0पिछले 7 दिनों में स्टार का बदलाव - #73
TCExam विश्वविद्यालयों, स्कूलों और कंपनियों के लिए एक CBA (कंप्यूटर-आधारित मूल्यांकन) सिस्टम है, जो शिक्षकों और प्रशिक्षकों को सर्वेक्षण, क्विज़, टेस्ट और परीक्षाओं को बनाने, शेड्यूल करने, वितरित करने और रिपोर्ट करने में सक्षम बनाता है
★ 621+0पिछले 7 दिनों में स्टार का बदलाव - #74
Python के लिए सरल, सुरक्षित, सैंडबॉक्स्ड और एक्स्टेंसिबल एक्सप्रेशन इवैल्यूएटर
★ 611+0पिछले 7 दिनों में स्टार का बदलाव - #75
यह रिपॉजिटरी "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI" पेपर के लिए मूल्यांकन कोड प्रदान करती है।
★ 594+1पिछले 7 दिनों में स्टार का बदलाव - #76
यह इमेज के जोड़े से इमेज मैचिंग करने वाली विभिन्न विधियों का मूल्यांकन करने के लिए एक टूलबॉक्स रिपॉजिटरी है
★ 594+0पिछले 7 दिनों में स्टार का बदलाव - #77
डेटासेट का संग्रह जो प्रश्नों को SQL क्वेरी के साथ जोड़ता है
★ 588+1पिछले 7 दिनों में स्टार का बदलाव - #78
ParseBench - AI एजेंटों के लिए एक दस्तावेज़ पार्सिंग बेंचमार्क
★ 565+12पिछले 7 दिनों में स्टार का बदलाव - #79
Meta Agents Research Environments एक व्यापक प्लेटफॉर्म है जिसे गतिशील और यथार्थवादी परिदृश्यों में AI एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है। स्थिर बेंचमार्क के विपरीत, यह प्लेटफॉर्म ऐसे विकसित वातावरण पेश करता है जहाँ एजेंटों को नई जानकारी उपलब्ध होने पर अपनी रणनीतियों को अनुकूलित करना पड़ता है, जो वास्तविक दुनिया की चुनौतियों को दर्शाता है।
★ 551+3पिछले 7 दिनों में स्टार का बदलाव - #80
कंपनी के आंतरिक दस्तावेजों पर RAG के लिए डेटासेट और बेंचमार्क।
★ 546+11पिछले 7 दिनों में स्टार का बदलाव