llm-evaluation
llm-evaluation टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर llm-evaluation के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और llm-evaluation टैग वाली रिपॉजिटरी।
- #1
AI एजेंटों के निर्माण और मूल्यांकन के लिए सर्वोत्तम संसाधनों की एक क्यूरेटेड लाइब्रेरी - पेपर, ब्लॉग, टॉक, टूल, बेंचमार्क। BenchFlow द्वारा अनुरक्षित।
★ 865 - #2
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 594 - #3
Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.
★ 352 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
🪢 ओपन सोर्स AI इंजीनियरिंग प्लेटफ़ॉर्म: LLM evals, ऑब्सर्वेबिलिटी, मेट्रिक्स, प्रॉम्प्ट मैनेजमेंट, प्लेग्राउंड, डेटासेट। OpenTelemetry, LangChain, OpenAI SDK, LiteLLM और अन्य के साथ एकीकृत। 🍊 YC W23
★ 34,116+207पिछले 7 दिनों में स्टार का बदलाव - #2
एजेंट्स, LLMs और ML मॉडल के लिए ओपन सोर्स AI इंजीनियरिंग प्लेटफ़ॉर्म। MLflow सभी आकार की टीमों को लागत नियंत्रित करने और मॉडल व डेटा तक पहुँच प्रबंधित करते हुए उत्पादन-गुणवत्ता वाले AI अनुप्रयोगों को डीबग, मूल्यांकन, मॉनिटर और अनुकूलित करने में सक्षम बनाता है।
★ 27,783+55पिछले 7 दिनों में स्टार का बदलाव - #3
अपने prompts, agents और RAGs का परीक्षण करें। AI के लिए रेड टीमिंग/पेंटेस्टिंग/वल्नरेबिलिटी स्कैनिंग। GPT, Claude, Gemini, DeepSeek और अन्य के प्रदर्शन की तुलना करें। कमांड लाइन और CI/CD इंटीग्रेशन के साथ सरल घोषणात्मक कॉन्फ़िगरेशन। OpenAI और Anthropic द्वारा उपयोग किया जाता है।
★ 24,767+103पिछले 7 दिनों में स्टार का बदलाव - #4
व्यापक ट्रेसिंग, स्वचालित मूल्यांकन और उत्पादन-तैयार डैशबोर्ड के साथ अपने LLM अनुप्रयोगों, RAG प्रणालियों और एजेंटिक वर्कफ़्लो को डिबग, मूल्यांकन और मॉनिटर करें।
★ 21,752+84पिछले 7 दिनों में स्टार का बदलाव - #5★ 18,063+110पिछले 7 दिनों में स्टार का बदलाव
- #6
AI एजेंटों की स्वतंत्र ऑडिटिंग। मानव या एजेंट द्वारा स्वयं संचालित, AI एजेंट अर्थव्यवस्था में सबसे महत्वपूर्ण प्रश्न का उत्तर देने के लिए। क्या एजेंट वही कर रहा है जो उसे करना चाहिए? iFixAi के साथ आप 120 सेकंड से कम समय में यह उत्तर पा सकते हैं।
★ 12,643+1,247पिछले 7 दिनों में स्टार का बदलाव - #7★ 11,298+55पिछले 7 दिनों में स्टार का बदलाव
- #8★ 9,094+23पिछले 7 दिनों में स्टार का बदलाव
- #9
NoneLinear - ReLE मूल्यांकन: चीनी AI बड़े भाषा मॉडल (LLM) की क्षमता का मूल्यांकन (निरंतर अपडेट): वर्तमान में 374 मॉडल शामिल हैं, जिनमें ChatGPT, GPT-5.4, Google Gemini-3.1-Pro, Claude-4.6, ERNIE-X1.1, ERNIE-5.0, Qwen3.6-Max, Qwen3.6-Plus, Baichuan, iFlytek Spark, SenseChat जैसे वाणिज्यिक मॉडल, और Step3.5-Flash, Kimi-K2.6, Ernie4.5, MiniMax-M2.7, DeepSeek-V4, Qwen3.6, Llama4, GLM-5.1, MiMo-V2, LongCat, Gemma4, Mistral जैसे ओपन-सोर्स मॉडल शामिल हैं। यह न केवल लीडरबोर्ड प्रदान करता है, बल्कि 2 मिलियन से अधिक का मॉडल दोष डेटाबेस भी प्रदान करता है!
★ 6,415+6पिछले 7 दिनों में स्टार का बदलाव - #10
🧊 ओपन सोर्स LLM ऑब्ज़र्वेबिलिटी प्लेटफ़ॉर्म। मॉनिटर, मूल्यांकन और प्रयोग करने के लिए कोड की एक लाइन। YC W23 🍓
★ 6,127+11पिछले 7 दिनों में स्टार का बदलाव - #11
Agent Scan, Skills Scan, MCP scan, AI Infra scan और LLM jailbreak evaluation के माध्यम से AI इकोसिस्टम को सुरक्षित करने वाला एक फुल-स्टैक AI रेड टीमिंग प्लेटफॉर्म।
★ 6,117+59पिछले 7 दिनों में स्टार का बदलाव - #12
🐢 LLM Agents के लिए ओपन-सोर्स इवैल्यूएशन और टेस्टिंग लाइब्रेरी
★ 5,801+9पिछले 7 दिनों में स्टार का बदलाव - #13
Agent OS: एजेंट अपने आप होशियार हो जाता है। हम केवल लाइन संभालते हैं: ग्रेडिंग कमांड और अपेक्षित परिणाम कभी भी उस सफलता अनुबंध में नहीं जाते जो हम इसे सौंपते हैं।
★ 5,753+25पिछले 7 दिनों में स्टार का बदलाव - #14
LLM की व्यावहारिक मार्गदर्शिका: बुनियादी बातों से लेकर LLMOps सर्वोत्तम प्रथाओं का उपयोग करके AWS पर उन्नत LLM और RAG ऐप तैनात करने तक
★ 5,310+8पिछले 7 दिनों में स्टार का बदलाव - #15
AutoRAG: अब आपका एजेंट आपके कंप्यूटर में कुछ भी ढूंढ सकता है। यदि आप इसका बार-बार उपयोग करते हैं तो यह अधिक बुद्धिमान हो जाता है।
★ 5,058+1पिछले 7 दिनों में स्टार का बदलाव - #16
टेक्स्ट, इमेज, वीडियो और ऑडियो कार्यों के लिए वन-फॉर-ऑल मल्टीमॉडल मूल्यांकन टूलकिट।
★ 4,390+7पिछले 7 दिनों में स्टार का बदलाव - #17
कहानियाँ और मॉडल बनाने के लिए वैज्ञानिक तरीकों, प्रक्रियाओं, एल्गोरिदम और प्रणालियों का एक संग्रह।
★ 3,676+2पिछले 7 दिनों में स्टार का बदलाव - #18★ 3,530+2पिछले 7 दिनों में स्टार का बदलाव
- #19
Laminar - AI एजेंट्स के लिए विशेष रूप से निर्मित ओपन-सोर्स ऑब्जर्वेबिलिटी प्लेटफॉर्म। YC S24।
★ 3,219+9पिछले 7 दिनों में स्टार का बदलाव - #20
Generative AI पर व्यापक संसाधन, जिसमें एक विस्तृत रोडमैप, प्रोजेक्ट्स, उपयोग के मामले, साक्षात्कार की तैयारी और कोडिंग की तैयारी शामिल है।
★ 2,610+1पिछले 7 दिनों में स्टार का बदलाव - #21
Agentic LLM Vulnerability Scanner / AI red teaming kit 🧪
★ 1,983+3पिछले 7 दिनों में स्टार का बदलाव - #22
LLM और AI एजेंट एप्लिकेशन के मूल्यांकन, अवलोकन और सुधार के लिए ओपन-सोर्स, एंड-टू-एंड प्लेटफॉर्म। ट्रेसिंग · मूल्यांकन · सिमुलेशन · डेटासेट · गेटवे · गार्डरेल्स। सेल्फ-होस्टेबल। Apache 2.0।
★ 1,909+42पिछले 7 दिनों में स्टार का बदलाव - #23
नो-कोड के साथ AI मॉडल का उपयोग करके डेटासेट बनाएं, समृद्ध करें और रूपांतरित करें
★ 1,641-1पिछले 7 दिनों में स्टार का बदलाव - #24
स्वचालित LLM फ़ज़िंग के लिए एक शक्तिशाली टूल। इसे डेवलपर्स और सुरक्षा शोधकर्ताओं को उनके LLM API में संभावित जेलब्रेक की पहचान करने और उन्हें कम करने में मदद करने के लिए डिज़ाइन किया गया है।
★ 1,573+4पिछले 7 दिनों में स्टार का बदलाव - #25
Prompty आपके AI अनुप्रयोगों के लिए LLM प्रॉम्प्ट बनाना, प्रबंधित करना, डिबग करना और मूल्यांकन करना आसान बनाता है। Prompty डेवलपर्स के लिए ऑब्जर्वेबिलिटी, समझदारी और पोर्टेबिलिटी को बढ़ाने के लिए डिज़ाइन किया गया LLM प्रॉम्प्ट्स के लिए एक एसेट क्लास और फॉर्मेट है।
★ 1,255+1पिछले 7 दिनों में स्टार का बदलाव - #26
[JMLR 2026] "UQLM: लार्ज लैंग्वेज मॉडल में अनिश्चितता मात्रा निर्धारण के लिए एक Python पैकेज"
★ 1,194+1पिछले 7 दिनों में स्टार का बदलाव - #27
AI एजेंट्स के लिए ट्रेस-नेटिव CI/CD — प्रोडक्शन की विफलताएं रिग्रेशन टेस्ट बन जाती हैं जो PR को ब्लॉक करती हैं। स्वचालित रूप से पता लगाएं, क्लस्टर करें, हर्मेटिक केस में फ्रीज करें और $0 में CI में रिप्ले करें।
★ 1,176-22पिछले 7 दिनों में स्टार का बदलाव - #28
एजेंटों के लिए निरंतर-सुधार स्टैक। हमारा पर्यावरण डेटा और मूल्यांकन एजेंट सुधार और निगरानी को शक्ति प्रदान करते हैं।
★ 1,060+2पिछले 7 दिनों में स्टार का बदलाव - #29
लचीले वर्कफ़्लो, एविडेंस-ग्राउंडेड RAG, वर्शन्ड रिपोर्ट्स और स्वचालित गुणवत्ता मूल्यांकन के साथ AI इक्विटी रिसर्च एजेंट।
★ 1,031-2पिछले 7 दिनों में स्टार का बदलाव - #30
AI एजेंटों के निर्माण और मूल्यांकन के लिए सर्वोत्तम संसाधनों की एक क्यूरेटेड लाइब्रेरी - पेपर, ब्लॉग, टॉक, टूल, बेंचमार्क। BenchFlow द्वारा अनुरक्षित।
★ 865+17पिछले 7 दिनों में स्टार का बदलाव