evaluation
evaluation टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर evaluation के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और evaluation टैग वाली रिपॉजिटरी।
- #1
The Fable Workflow: Claude Fable 5 ने कैसे काम किया, जिसे किसी भी मॉडल द्वारा चलाए जा सकने वाले कौशलों में संक्षेपित किया गया है।
★ 2,274 - #2
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #3★ 160
- #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 ओपन सोर्स AI इंजीनियरिंग प्लेटफ़ॉर्म: LLM evals, ऑब्सर्वेबिलिटी, मेट्रिक्स, प्रॉम्प्ट मैनेजमेंट, प्लेग्राउंड, डेटासेट। OpenTelemetry, LangChain, OpenAI SDK, LiteLLM और अन्य के साथ एकीकृत। 🍊 YC W23
★ 34,116+207पिछले 7 दिनों में स्टार का बदलाव - #2
एजेंट्स, LLMs और ML मॉडल के लिए ओपन सोर्स AI इंजीनियरिंग प्लेटफ़ॉर्म। MLflow सभी आकार की टीमों को लागत नियंत्रित करने और मॉडल व डेटा तक पहुँच प्रबंधित करते हुए उत्पादन-गुणवत्ता वाले AI अनुप्रयोगों को डीबग, मूल्यांकन, मॉनिटर और अनुकूलित करने में सक्षम बनाता है।
★ 27,783+55पिछले 7 दिनों में स्टार का बदलाव - #3
अपने prompts, agents और RAGs का परीक्षण करें। AI के लिए रेड टीमिंग/पेंटेस्टिंग/वल्नरेबिलिटी स्कैनिंग। GPT, Claude, Gemini, DeepSeek और अन्य के प्रदर्शन की तुलना करें। कमांड लाइन और CI/CD इंटीग्रेशन के साथ सरल घोषणात्मक कॉन्फ़िगरेशन। OpenAI और Anthropic द्वारा उपयोग किया जाता है।
★ 24,767+103पिछले 7 दिनों में स्टार का बदलाव - #4
व्यापक ट्रेसिंग, स्वचालित मूल्यांकन और उत्पादन-तैयार डैशबोर्ड के साथ अपने LLM अनुप्रयोगों, RAG प्रणालियों और एजेंटिक वर्कफ़्लो को डिबग, मूल्यांकन और मॉनिटर करें।
★ 21,752+84पिछले 7 दिनों में स्टार का बदलाव - #5
ओपन-सोर्स LLM ज्ञान प्लेटफ़ॉर्म: रॉ दस्तावेजों को क्वेरी करने योग्य RAG, एक स्वायत्त तर्क एजेंट, और एक स्व-रखरखाव Wiki में बदलें।
★ 21,205+306पिछले 7 दिनों में स्टार का बदलाव - #6★ 15,594+53पिछले 7 दिनों में स्टार का बदलाव
- #7★ 9,383+3पिछले 7 दिनों में स्टार का बदलाव
- #8
OpenCompass एक LLM evaluation platform है, जो 100+ से अधिक datasets पर विभिन्न प्रकार के models (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, आदि) का समर्थन करता है।
★ 7,388+14पिछले 7 दिनों में स्टार का बदलाव - #9
🧊 ओपन सोर्स LLM ऑब्ज़र्वेबिलिटी प्लेटफ़ॉर्म। मॉनिटर, मूल्यांकन और प्रयोग करने के लिए कोड की एक लाइन। YC W23 🍓
★ 6,127+11पिछले 7 दिनों में स्टार का बदलाव - #10
अगली पीढ़ी का AI एजेंट ऑप्टिमाइजेशन प्लेटफॉर्म: Cozeloop विकास, डिबगिंग और मूल्यांकन से लेकर मॉनिटरिंग तक पूर्ण-जीवनचक्र प्रबंधन क्षमताएं प्रदान करके AI एजेंट विकास में आने वाली चुनौतियों का समाधान करता है।
★ 5,711+5पिछले 7 दिनों में स्टार का बदलाव - #11
AutoRAG: अब आपका एजेंट आपके कंप्यूटर में कुछ भी ढूंढ सकता है। यदि आप इसका बार-बार उपयोग करते हैं तो यह अधिक बुद्धिमान हो जाता है।
★ 5,058+1पिछले 7 दिनों में स्टार का बदलाव - #12
AI सिस्टम बनाएं, मूल्यांकन करें और अनुकूलित करें। इसमें मूल्यांकन, RAG, एजेंट, फाइन-ट्यूनिंग, सिंथेटिक डेटा जनरेशन, डेटासेट प्रबंधन, MCP और बहुत कुछ शामिल है।
★ 5,042+5पिछले 7 दिनों में स्टार का बदलाव - #13
टेक्स्ट, इमेज, वीडियो और ऑडियो कार्यों के लिए वन-फॉर-ऑल मल्टीमॉडल मूल्यांकन टूलकिट।
★ 4,390+7पिछले 7 दिनों में स्टार का बदलाव - #14
लार्ज मल्टी-मोडालिटी मॉडल (LMMs) का ओपन-सोर्स मूल्यांकन टूलकिट, 220+ LMMs, 80+ बेंचमार्क का समर्थन करता है।
★ 4,375+13पिछले 7 दिनों में स्टार का बदलाव - #15★ 4,311+1पिछले 7 दिनों में स्टार का बदलाव
- #16★ 3,522+5पिछले 7 दिनों में स्टार का बदलाव
- #17★ 3,414+5पिछले 7 दिनों में स्टार का बदलाव
- #18
कुशल बड़े मॉडल (LLM, VLM, AIGC) मूल्यांकन और प्रदर्शन बेंचमार्किंग के लिए एक सुव्यवस्थित और अनुकूलन योग्य फ्रेमवर्क।
★ 3,356+25पिछले 7 दिनों में स्टार का बदलाव - #19
SuperCLUE: चीनी सामान्य बड़े मॉडल व्यापक बेंचमार्क | चीनी में फाउंडेशन मॉडल के लिए एक बेंचमार्क
★ 3,299+0पिछले 7 दिनों में स्टार का बदलाव - #20
Laminar - AI एजेंट्स के लिए विशेष रूप से निर्मित ओपन-सोर्स ऑब्जर्वेबिलिटी प्लेटफॉर्म। YC S24।
★ 3,219+9पिछले 7 दिनों में स्टार का बदलाव - #21
Klipse टेक ब्लॉग में इंटरैक्टिव कोड स्निपेट एम्बेड करने के लिए एक JavaScript प्लगइन है।
★ 3,134+0पिछले 7 दिनों में स्टार का बदलाव - #22
LLM के लिए प्रॉम्प्ट के युद्ध-परीक्षण हेतु एक ओपन-सोर्स विजुअल प्रोग्रामिंग वातावरण।
★ 3,026-2पिछले 7 दिनों में स्टार का बदलाव - #23
YAO = Yielding AI Outcomes। पुन Useable एजेंट स्किल्स के लिए एक कठोर इंजीनियरिंग, मूल्यांकन, शासन और पोर्टेबिलिटी सिस्टम।
★ 2,581+24पिछले 7 दिनों में स्टार का बदलाव - #24
Lighteval एकाधिक backends में LLM का मूल्यांकन करने के लिए आपका ऑल-इन-वन टूलकिट है।
★ 2,533+3पिछले 7 दिनों में स्टार का बदलाव - #25
🤗 Evaluate: मशीन लर्निंग मॉडल और डेटासेट का आसानी से मूल्यांकन करने के लिए एक लाइब्रेरी।
★ 2,478-2पिछले 7 दिनों में स्टार का बदलाव - #26
UpTrain जनरेटिव AI एप्लिकेशन का मूल्यांकन और सुधार करने के लिए एक ओपन-सोर्स एकीकृत प्लेटफॉर्म है। हम 20+ प्रीकॉन्फ़िगर किए गए चेक के लिए ग्रेड प्रदान करते हैं (भाषा, कोड, एम्बेडिंग उपयोग के मामलों को कवर करते हुए), विफलता के मामलों पर मूल कारण विश्लेषण करते हैं और उन्हें हल करने के तरीके पर अंतर्दृष्टि देते हैं।
★ 2,364+0पिछले 7 दिनों में स्टार का बदलाव - #27
RAG को बेहतर बनाएं: ज्ञान ग्राफ़ निर्माण और खोज के लिए GraphRAG, LightRAG, और Neo4j-llm-graph-builder को एकीकृत किया गया है; निजी RAG तर्क को प्राप्त करने के लिए DeepSearch तकनीक को एकीकृत किया गया है; GraphRAG के लिए कस्टम मूल्यांकन ढांचा बनाया गया है।
★ 2,332+3पिछले 7 दिनों में स्टार का बदलाव - #28
The Fable Workflow: Claude Fable 5 ने कैसे काम किया, जिसे किसी भी मॉडल द्वारा चलाए जा सकने वाले कौशलों में संक्षेपित किया गया है।
★ 2,274+10पिछले 7 दिनों में स्टार का बदलाव - #29
MCP सर्वर, MCP ऐप्स और ChatGPT ऐप्स को चैट, निरीक्षण और डिबग करने के लिए परीक्षण और मूल्यांकन प्लेटफ़ॉर्म।
★ 2,183+6पिछले 7 दिनों में स्टार का बदलाव - #30
📰 LLM आधारित लॉन्ग कॉन्टेक्स्ट मॉडलिंग पर अवश्य पढ़ने योग्य पेपर और ब्लॉग 🔥
★ 2,164-1पिछले 7 दिनों में स्टार का बदलाव