मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · llm-evaluation

llm-evaluation

llm-evaluation टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
37
कुल स्टार
2,34,912
औसत स्टार
6,349
हिस्सा
0.01%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर llm-evaluation के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और llm-evaluation टैग वाली रिपॉजिटरी।

  • awesome-evals@benchflow-ai

    AI एजेंटों के निर्माण और मूल्यांकन के लिए सर्वोत्तम संसाधनों की एक क्यूरेटेड लाइब्रेरी - पेपर, ब्लॉग, टॉक, टूल, बेंचमार्क। BenchFlow द्वारा अनुरक्षित।

    865
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594
  • KADATH@i3T4AN

    Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.

    352
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 ओपन सोर्स AI इंजीनियरिंग प्लेटफ़ॉर्म: LLM evals, ऑब्सर्वेबिलिटी, मेट्रिक्स, प्रॉम्प्ट मैनेजमेंट, प्लेग्राउंड, डेटासेट। OpenTelemetry, LangChain, OpenAI SDK, LiteLLM और अन्य के साथ एकीकृत। 🍊 YC W23

    34,116+207पिछले 7 दिनों में स्टार का बदलाव
  • mlflow@mlflow

    एजेंट्स, LLMs और ML मॉडल के लिए ओपन सोर्स AI इंजीनियरिंग प्लेटफ़ॉर्म। MLflow सभी आकार की टीमों को लागत नियंत्रित करने और मॉडल व डेटा तक पहुँच प्रबंधित करते हुए उत्पादन-गुणवत्ता वाले AI अनुप्रयोगों को डीबग, मूल्यांकन, मॉनिटर और अनुकूलित करने में सक्षम बनाता है।

    27,783+55पिछले 7 दिनों में स्टार का बदलाव
  • promptfoo@promptfoo

    अपने prompts, agents और RAGs का परीक्षण करें। AI के लिए रेड टीमिंग/पेंटेस्टिंग/वल्नरेबिलिटी स्कैनिंग। GPT, Claude, Gemini, DeepSeek और अन्य के प्रदर्शन की तुलना करें। कमांड लाइन और CI/CD इंटीग्रेशन के साथ सरल घोषणात्मक कॉन्फ़िगरेशन। OpenAI और Anthropic द्वारा उपयोग किया जाता है।

    24,767+103पिछले 7 दिनों में स्टार का बदलाव
  • opik@comet-ml

    व्यापक ट्रेसिंग, स्वचालित मूल्यांकन और उत्पादन-तैयार डैशबोर्ड के साथ अपने LLM अनुप्रयोगों, RAG प्रणालियों और एजेंटिक वर्कफ़्लो को डिबग, मूल्यांकन और मॉनिटर करें।

    21,752+84पिछले 7 दिनों में स्टार का बदलाव
  • deepeval@confident-ai

    LLM मूल्यांकन फ्रेमवर्क।

    18,063+110पिछले 7 दिनों में स्टार का बदलाव
  • iFixAi@ifixai-ai

    AI एजेंटों की स्वतंत्र ऑडिटिंग। मानव या एजेंट द्वारा स्वयं संचालित, AI एजेंट अर्थव्यवस्था में सबसे महत्वपूर्ण प्रश्न का उत्तर देने के लिए। क्या एजेंट वही कर रहा है जो उसे करना चाहिए? iFixAi के साथ आप 120 सेकंड से कम समय में यह उत्तर पा सकते हैं।

    12,643+1,247पिछले 7 दिनों में स्टार का बदलाव
  • phoenix@Arize-ai

    AI ऑब्सर्बेबिलिटी और मूल्यांकन

    11,298+55पिछले 7 दिनों में स्टार का बदलाव
  • garak@NVIDIA

    LLM vulnerablity स्कैनर

    9,094+23पिछले 7 दिनों में स्टार का बदलाव
  • NoneLinear - ReLE मूल्यांकन: चीनी AI बड़े भाषा मॉडल (LLM) की क्षमता का मूल्यांकन (निरंतर अपडेट): वर्तमान में 374 मॉडल शामिल हैं, जिनमें ChatGPT, GPT-5.4, Google Gemini-3.1-Pro, Claude-4.6, ERNIE-X1.1, ERNIE-5.0, Qwen3.6-Max, Qwen3.6-Plus, Baichuan, iFlytek Spark, SenseChat जैसे वाणिज्यिक मॉडल, और Step3.5-Flash, Kimi-K2.6, Ernie4.5, MiniMax-M2.7, DeepSeek-V4, Qwen3.6, Llama4, GLM-5.1, MiMo-V2, LongCat, Gemma4, Mistral जैसे ओपन-सोर्स मॉडल शामिल हैं। यह न केवल लीडरबोर्ड प्रदान करता है, बल्कि 2 मिलियन से अधिक का मॉडल दोष डेटाबेस भी प्रदान करता है!

    6,415+6पिछले 7 दिनों में स्टार का बदलाव
  • helicone@Helicone

    🧊 ओपन सोर्स LLM ऑब्ज़र्वेबिलिटी प्लेटफ़ॉर्म। मॉनिटर, मूल्यांकन और प्रयोग करने के लिए कोड की एक लाइन। YC W23 🍓

    6,127+11पिछले 7 दिनों में स्टार का बदलाव
  • AI-Infra-Guard@Tencent

    Agent Scan, Skills Scan, MCP scan, AI Infra scan और LLM jailbreak evaluation के माध्यम से AI इकोसिस्टम को सुरक्षित करने वाला एक फुल-स्टैक AI रेड टीमिंग प्लेटफॉर्म।

    6,117+59पिछले 7 दिनों में स्टार का बदलाव
  • giskard-oss@Giskard-AI

    🐢 LLM Agents के लिए ओपन-सोर्स इवैल्यूएशन और टेस्टिंग लाइब्रेरी

    5,801+9पिछले 7 दिनों में स्टार का बदलाव
  • ouroboros@Q00

    Agent OS: एजेंट अपने आप होशियार हो जाता है। हम केवल लाइन संभालते हैं: ग्रेडिंग कमांड और अपेक्षित परिणाम कभी भी उस सफलता अनुबंध में नहीं जाते जो हम इसे सौंपते हैं।

    5,753+25पिछले 7 दिनों में स्टार का बदलाव
  • LLM-Engineers-Handbook@PacktPublishing

    LLM की व्यावहारिक मार्गदर्शिका: बुनियादी बातों से लेकर LLMOps सर्वोत्तम प्रथाओं का उपयोग करके AWS पर उन्नत LLM और RAG ऐप तैनात करने तक

    5,310+8पिछले 7 दिनों में स्टार का बदलाव
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: अब आपका एजेंट आपके कंप्यूटर में कुछ भी ढूंढ सकता है। यदि आप इसका बार-बार उपयोग करते हैं तो यह अधिक बुद्धिमान हो जाता है।

    5,058+1पिछले 7 दिनों में स्टार का बदलाव
  • lmms-eval@EvolvingLMMs-Lab

    टेक्स्ट, इमेज, वीडियो और ऑडियो कार्यों के लिए वन-फॉर-ऑल मल्टीमॉडल मूल्यांकन टूलकिट।

    4,390+7पिछले 7 दिनों में स्टार का बदलाव
  • AI-Engineer-Headquarters@hemansnation

    कहानियाँ और मॉडल बनाने के लिए वैज्ञानिक तरीकों, प्रक्रियाओं, एल्गोरिदम और प्रणालियों का एक संग्रह।

    3,676+2पिछले 7 दिनों में स्टार का बदलाव
  • trulens@truera

    LLM प्रयोगों और AI एजेंटों के लिए मूल्यांकन और ट्रैकिंग

    3,530+2पिछले 7 दिनों में स्टार का बदलाव
  • lmnr@lmnr-ai

    Laminar - AI एजेंट्स के लिए विशेष रूप से निर्मित ओपन-सोर्स ऑब्जर्वेबिलिटी प्लेटफॉर्म। YC S24।

    3,219+9पिछले 7 दिनों में स्टार का बदलाव
  • generative-ai@genieincodebottle

    Generative AI पर व्यापक संसाधन, जिसमें एक विस्तृत रोडमैप, प्रोजेक्ट्स, उपयोग के मामले, साक्षात्कार की तैयारी और कोडिंग की तैयारी शामिल है।

    2,610+1पिछले 7 दिनों में स्टार का बदलाव
  • agentic_security@msoedov

    Agentic LLM Vulnerability Scanner / AI red teaming kit 🧪

    1,983+3पिछले 7 दिनों में स्टार का बदलाव
  • future-agi@future-agi

    LLM और AI एजेंट एप्लिकेशन के मूल्यांकन, अवलोकन और सुधार के लिए ओपन-सोर्स, एंड-टू-एंड प्लेटफॉर्म। ट्रेसिंग · मूल्यांकन · सिमुलेशन · डेटासेट · गेटवे · गार्डरेल्स। सेल्फ-होस्टेबल। Apache 2.0।

    1,909+42पिछले 7 दिनों में स्टार का बदलाव
  • aisheets@huggingface

    नो-कोड के साथ AI मॉडल का उपयोग करके डेटासेट बनाएं, समृद्ध करें और रूपांतरित करें

    1,641-1पिछले 7 दिनों में स्टार का बदलाव
  • FuzzyAI@cyberark

    स्वचालित LLM फ़ज़िंग के लिए एक शक्तिशाली टूल। इसे डेवलपर्स और सुरक्षा शोधकर्ताओं को उनके LLM API में संभावित जेलब्रेक की पहचान करने और उन्हें कम करने में मदद करने के लिए डिज़ाइन किया गया है।

    1,573+4पिछले 7 दिनों में स्टार का बदलाव
  • prompty@microsoft

    Prompty आपके AI अनुप्रयोगों के लिए LLM प्रॉम्प्ट बनाना, प्रबंधित करना, डिबग करना और मूल्यांकन करना आसान बनाता है। Prompty डेवलपर्स के लिए ऑब्जर्वेबिलिटी, समझदारी और पोर्टेबिलिटी को बढ़ाने के लिए डिज़ाइन किया गया LLM प्रॉम्प्ट्स के लिए एक एसेट क्लास और फॉर्मेट है।

    1,255+1पिछले 7 दिनों में स्टार का बदलाव
  • uqlm@cvs-health

    [JMLR 2026] "UQLM: लार्ज लैंग्वेज मॉडल में अनिश्चितता मात्रा निर्धारण के लिए एक Python पैकेज"

    1,194+1पिछले 7 दिनों में स्टार का बदलाव
  • Tracely-ai@Jwuthri

    AI एजेंट्स के लिए ट्रेस-नेटिव CI/CD — प्रोडक्शन की विफलताएं रिग्रेशन टेस्ट बन जाती हैं जो PR को ब्लॉक करती हैं। स्वचालित रूप से पता लगाएं, क्लस्टर करें, हर्मेटिक केस में फ्रीज करें और $0 में CI में रिप्ले करें।

    1,176-22पिछले 7 दिनों में स्टार का बदलाव
  • judgeval@JudgmentLabs

    एजेंटों के लिए निरंतर-सुधार स्टैक। हमारा पर्यावरण डेटा और मूल्यांकन एजेंट सुधार और निगरानी को शक्ति प्रदान करते हैं।

    1,060+2पिछले 7 दिनों में स्टार का बदलाव
  • FinSight-AI@juanjuandog

    लचीले वर्कफ़्लो, एविडेंस-ग्राउंडेड RAG, वर्शन्ड रिपोर्ट्स और स्वचालित गुणवत्ता मूल्यांकन के साथ AI इक्विटी रिसर्च एजेंट।

    1,031-2पिछले 7 दिनों में स्टार का बदलाव
  • awesome-evals@benchflow-ai

    AI एजेंटों के निर्माण और मूल्यांकन के लिए सर्वोत्तम संसाधनों की एक क्यूरेटेड लाइब्रेरी - पेपर, ब्लॉग, टॉक, टूल, बेंचमार्क। BenchFlow द्वारा अनुरक्षित।

    865+17पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस