evaluation
evaluation टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31
Open LLM Leaderboard का प्रबंधन करते समय और lighteval को डिज़ाइन करते समय हमने जो व्यावहारिक अंतर्दृष्टि और सैद्धांतिक ज्ञान एकत्र किया है, उन्हें साझा करना!
★ 2,143+2पिछले 7 दिनों में स्टार का बदलाव - #32
Avalanche: PyTorch पर आधारित कंटीन्यूअल लर्निंग के लिए एक एंड-टू-एंड लाइब्रेरी।
★ 2,088+0पिछले 7 दिनों में स्टार का बदलाव - #33
:cloud: :rocket: :bar_chart: :chart_with_upwards_trend: AI में अत्याधुनिक तकनीक का मूल्यांकन
★ 2,037-2पिछले 7 दिनों में स्टार का बदलाव - #34
निर्देश-पालन करने वाले भाषा मॉडल के लिए एक स्वचालित मूल्यांकनकर्ता। मानव-सत्यापित, उच्च-गुणवत्ता, सस्ती और तेज़।
★ 2,012-1पिछले 7 दिनों में स्टार का बदलाव - #35
(IROS 2020, ECCVW 2020) "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics" के लिए आधिकारिक Python कार्यान्वयन
★ 1,846+0पिछले 7 दिनों में स्टार का बदलाव - #36
WFGY, WFGY 5.0 Polaris Protocol की ओर बढ़ रहा है, जो AI रीज़निंग, RAG, एजेंट्स और वास्तविक दुनिया के वर्कफ़्लो के लिए एक बड़ा ओपन-सोर्स रिलीज़ है। इसमें Problem Map, Global Debug Card, WFGY 4.0, और CFV Easter Egg शामिल हैं।
★ 1,786+1पिछले 7 दिनों में स्टार का बदलाव - #37
मानसिक स्वास्थ्य लार्ज लैंग्वेज मॉडल (LLM x Mental Health), प्री- & पोस्ट-ट्रेनिंग & डेटासेट & मूल्यांकन & डिप्लॉय & RAG, InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM सीरीज़ मॉडल के साथ
★ 1,781+1पिछले 7 दिनों में स्टार का बदलाव - #38
ग्राफ वर्कफ़्लो, टूल्स, मेमोरी, A2A, AG-UI, MCP, मूल्यांकन और ऑब्ज़र्वेबिलिटी के साथ प्रोडक्शन एजेंट सिस्टम बनाने के लिए एक Go फ्रेमवर्क।
★ 1,760+12पिछले 7 दिनों में स्टार का बदलाव - #39★ 1,668+0पिछले 7 दिनों में स्टार का बदलाव
- #40
सर्वे पेपर "A Survey on Evaluation of Large Language Models" के लिए आधिकारिक GitHub पेज।
★ 1,608-1पिछले 7 दिनों में स्टार का बदलाव - #41★ 1,506+0पिछले 7 दिनों में स्टार का बदलाव
- #42
प्राकृतिक भाषा पीढ़ी के लिए विभिन्न अनसुपरवाइज्ड स्वचालित मेट्रिक्स के लिए मूल्यांकन कोड।
★ 1,391+0पिछले 7 दिनों में स्टार का बदलाव - #43★ 1,300+0पिछले 7 दिनों में स्टार का बदलाव
- #44★ 1,260+0पिछले 7 दिनों में स्टार का बदलाव
- #45
सिमुलेटेड, यथार्थवादी सिंथेटिक इंटरैक्शन का उपयोग करके एजेंटों के व्यापक निदान और अनुकूलन के लिए एक फ्रेमवर्क
★ 1,257+0पिछले 7 दिनों में स्टार का बदलाव - #46
KernelBench: क्या LLMs GPU कर्नेल लिख सकते हैं? - बेंचमार्क + Torch -> CUDA (+ अधिक DSLs) के साथ टूलकिट
★ 1,227+7पिछले 7 दिनों में स्टार का बदलाव - #47
ML इंफ्रा के लिए PyTorch की तरह, Python में Kubernetes पर AI वर्कलोड को जादुई रूप से वितरित और चलाएं।
★ 1,224+0पिछले 7 दिनों में स्टार का बदलाव - #48★ 1,206+0पिछले 7 दिनों में स्टार का बदलाव
- #49
PyTorch में जनरेटिव मॉडल के लिए उच्च-निष्ठा प्रदर्शन मेट्रिक्स
★ 1,200+1पिछले 7 दिनों में स्टार का बदलाव - #50
AI एजेंट्स के लिए ट्रेस-नेटिव CI/CD — प्रोडक्शन की विफलताएं रिग्रेशन टेस्ट बन जाती हैं जो PR को ब्लॉक करती हैं। स्वचालित रूप से पता लगाएं, क्लस्टर करें, हर्मेटिक केस में फ्रीज करें और $0 में CI में रिप्ले करें।
★ 1,176-22पिछले 7 दिनों में स्टार का बदलाव - #51
NCalc .NET के लिए एक तेज़ और हल्का एक्सप्रेशन इवैल्यूएटर लाइब्रेरी है, जिसे लचीलेपन और उच्च प्रदर्शन के लिए डिज़ाइन किया गया है। यह गणितीय और तार्किक ऑपरेशन्स की एक विस्तृत श्रृंखला का समर्थन करता है।
★ 1,156+2पिछले 7 दिनों में स्टार का बदलाव - #52★ 1,155+7पिछले 7 दिनों में स्टार का बदलाव
- #53
Prometheus और GPT4 के साथ अपने LLM के रिस्पॉन्स का मूल्यांकन करें 💯
★ 1,111+4पिछले 7 दिनों में स्टार का बदलाव - #54
LangSmith क्लाइंट SDK कार्यान्वयन
★ 1,049+9पिछले 7 दिनों में स्टार का बदलाव - #55
डेटासेट विज़ुअलाइज़ेशन, डेटा प्रोसेसिंग और परिणामों के मूल्यांकन के लिए SemanticKITTI API
★ 898+3पिछले 7 दिनों में स्टार का बदलाव - #56
एक ही पाइपलाइन में उच्च-गुणवत्ता वाले सिंथेटिक्स उत्पन्न करें, प्रशिक्षित करें, मापें और मूल्यांकन करें
★ 885+3पिछले 7 दिनों में स्टार का बदलाव - #57
ClawProBench एक लाइव-फर्स्ट बेंचमार्क हार्नेस है, जो OpenClaw रनटाइम में LLM एजेंट्स का मूल्यांकन करने के लिए नियतात्मक ग्रेडिंग और बार-बार परीक्षण की विश्वसनीयता प्रदान करता है।
★ 823+0पिछले 7 दिनों में स्टार का बदलाव - #58★ 820+14पिछले 7 दिनों में स्टार का बदलाव
- #59★ 814+1पिछले 7 दिनों में स्टार का बदलाव
- #60
Web Codegen Scorer LLMs द्वारा उत्पन्न वेब कोड की गुणवत्ता का मूल्यांकन करने के लिए एक टूल है
★ 774+4पिछले 7 दिनों में स्टार का बदलाव