मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · evaluation

evaluation

evaluation टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
80
कुल स्टार
2,92,612
औसत स्टार
3,658
हिस्सा
0.02%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर evaluation के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और evaluation टैग वाली रिपॉजिटरी।

  • fable-method@Sahir619

    The Fable Workflow: Claude Fable 5 ने कैसे काम किया, जिसे किसी भी मॉडल द्वारा चलाए जा सकने वाले कौशलों में संक्षेपित किया गया है।

    2,274
  • HarnessEval-W@MirroS-Lab

    HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    256
  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    160
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    🪢 ओपन सोर्स AI इंजीनियरिंग प्लेटफ़ॉर्म: LLM evals, ऑब्सर्वेबिलिटी, मेट्रिक्स, प्रॉम्प्ट मैनेजमेंट, प्लेग्राउंड, डेटासेट। OpenTelemetry, LangChain, OpenAI SDK, LiteLLM और अन्य के साथ एकीकृत। 🍊 YC W23

    34,116+207पिछले 7 दिनों में स्टार का बदलाव
  • mlflow@mlflow

    एजेंट्स, LLMs और ML मॉडल के लिए ओपन सोर्स AI इंजीनियरिंग प्लेटफ़ॉर्म। MLflow सभी आकार की टीमों को लागत नियंत्रित करने और मॉडल व डेटा तक पहुँच प्रबंधित करते हुए उत्पादन-गुणवत्ता वाले AI अनुप्रयोगों को डीबग, मूल्यांकन, मॉनिटर और अनुकूलित करने में सक्षम बनाता है।

    27,783+55पिछले 7 दिनों में स्टार का बदलाव
  • promptfoo@promptfoo

    अपने prompts, agents और RAGs का परीक्षण करें। AI के लिए रेड टीमिंग/पेंटेस्टिंग/वल्नरेबिलिटी स्कैनिंग। GPT, Claude, Gemini, DeepSeek और अन्य के प्रदर्शन की तुलना करें। कमांड लाइन और CI/CD इंटीग्रेशन के साथ सरल घोषणात्मक कॉन्फ़िगरेशन। OpenAI और Anthropic द्वारा उपयोग किया जाता है।

    24,767+103पिछले 7 दिनों में स्टार का बदलाव
  • opik@comet-ml

    व्यापक ट्रेसिंग, स्वचालित मूल्यांकन और उत्पादन-तैयार डैशबोर्ड के साथ अपने LLM अनुप्रयोगों, RAG प्रणालियों और एजेंटिक वर्कफ़्लो को डिबग, मूल्यांकन और मॉनिटर करें।

    21,752+84पिछले 7 दिनों में स्टार का बदलाव
  • WeKnora@Tencent

    ओपन-सोर्स LLM ज्ञान प्लेटफ़ॉर्म: रॉ दस्तावेजों को क्वेरी करने योग्य RAG, एक स्वायत्त तर्क एजेंट, और एक स्व-रखरखाव Wiki में बदलें।

    21,205+306पिछले 7 दिनों में स्टार का बदलाव
  • ragas@vibrantlabsai

    अपने LLM एप्लिकेशन मूल्यांकन को सुपरचार्ज करें 🚀

    15,594+53पिछले 7 दिनों में स्टार का बदलाव
  • oumi@oumi-ai

    Qwen, Gemma, या किसी भी ओपन वेट LLM को आसानी से फाइन-ट्यून, मूल्यांकन और तैनात करें!

    9,383+3पिछले 7 दिनों में स्टार का बदलाव
  • opencompass@open-compass

    OpenCompass एक LLM evaluation platform है, जो 100+ से अधिक datasets पर विभिन्न प्रकार के models (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, आदि) का समर्थन करता है।

    7,388+14पिछले 7 दिनों में स्टार का बदलाव
  • helicone@Helicone

    🧊 ओपन सोर्स LLM ऑब्ज़र्वेबिलिटी प्लेटफ़ॉर्म। मॉनिटर, मूल्यांकन और प्रयोग करने के लिए कोड की एक लाइन। YC W23 🍓

    6,127+11पिछले 7 दिनों में स्टार का बदलाव
  • coze-loop@coze-dev

    अगली पीढ़ी का AI एजेंट ऑप्टिमाइजेशन प्लेटफॉर्म: Cozeloop विकास, डिबगिंग और मूल्यांकन से लेकर मॉनिटरिंग तक पूर्ण-जीवनचक्र प्रबंधन क्षमताएं प्रदान करके AI एजेंट विकास में आने वाली चुनौतियों का समाधान करता है।

    5,711+5पिछले 7 दिनों में स्टार का बदलाव
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: अब आपका एजेंट आपके कंप्यूटर में कुछ भी ढूंढ सकता है। यदि आप इसका बार-बार उपयोग करते हैं तो यह अधिक बुद्धिमान हो जाता है।

    5,058+1पिछले 7 दिनों में स्टार का बदलाव
  • Kiln@Kiln-AI

    AI सिस्टम बनाएं, मूल्यांकन करें और अनुकूलित करें। इसमें मूल्यांकन, RAG, एजेंट, फाइन-ट्यूनिंग, सिंथेटिक डेटा जनरेशन, डेटासेट प्रबंधन, MCP और बहुत कुछ शामिल है।

    5,042+5पिछले 7 दिनों में स्टार का बदलाव
  • lmms-eval@EvolvingLMMs-Lab

    टेक्स्ट, इमेज, वीडियो और ऑडियो कार्यों के लिए वन-फॉर-ऑल मल्टीमॉडल मूल्यांकन टूलकिट।

    4,390+7पिछले 7 दिनों में स्टार का बदलाव
  • VLMEvalKit@open-compass

    लार्ज मल्टी-मोडालिटी मॉडल (LMMs) का ओपन-सोर्स मूल्यांकन टूलकिट, 220+ LMMs, 80+ बेंचमार्क का समर्थन करता है।

    4,375+13पिछले 7 दिनों में स्टार का बदलाव
  • evo@MichaelGrupp

    ओडोमेट्री और SLAM के मूल्यांकन के लिए Python पैकेज

    4,311+1पिछले 7 दिनों में स्टार का बदलाव
  • langwatch@langwatch

    LLM मूल्यांकन और AI एजेंट परीक्षण के लिए प्लेटफ़ॉर्म

    3,522+5पिछले 7 दिनों में स्टार का बदलाव
  • mteb@embeddings-benchmark

    MTEB: भाषाओं और तौर-तरीकों में एम्बेडिंग का अत्याधुनिक मूल्यांकन

    3,414+5पिछले 7 दिनों में स्टार का बदलाव
  • evalscope@modelscope

    कुशल बड़े मॉडल (LLM, VLM, AIGC) मूल्यांकन और प्रदर्शन बेंचमार्किंग के लिए एक सुव्यवस्थित और अनुकूलन योग्य फ्रेमवर्क।

    3,356+25पिछले 7 दिनों में स्टार का बदलाव
  • SuperCLUE@CLUEbenchmark

    SuperCLUE: चीनी सामान्य बड़े मॉडल व्यापक बेंचमार्क | चीनी में फाउंडेशन मॉडल के लिए एक बेंचमार्क

    3,299+0पिछले 7 दिनों में स्टार का बदलाव
  • lmnr@lmnr-ai

    Laminar - AI एजेंट्स के लिए विशेष रूप से निर्मित ओपन-सोर्स ऑब्जर्वेबिलिटी प्लेटफॉर्म। YC S24।

    3,219+9पिछले 7 दिनों में स्टार का बदलाव
  • klipse@viebel

    Klipse टेक ब्लॉग में इंटरैक्टिव कोड स्निपेट एम्बेड करने के लिए एक JavaScript प्लगइन है।

    3,134+0पिछले 7 दिनों में स्टार का बदलाव
  • ChainForge@ianarawjo

    LLM के लिए प्रॉम्प्ट के युद्ध-परीक्षण हेतु एक ओपन-सोर्स विजुअल प्रोग्रामिंग वातावरण।

    3,026-2पिछले 7 दिनों में स्टार का बदलाव
  • yao-meta-skill@yaojingang

    YAO = Yielding AI Outcomes। पुन Useable एजेंट स्किल्स के लिए एक कठोर इंजीनियरिंग, मूल्यांकन, शासन और पोर्टेबिलिटी सिस्टम।

    2,581+24पिछले 7 दिनों में स्टार का बदलाव
  • lighteval@huggingface

    Lighteval एकाधिक backends में LLM का मूल्यांकन करने के लिए आपका ऑल-इन-वन टूलकिट है।

    2,533+3पिछले 7 दिनों में स्टार का बदलाव
  • evaluate@huggingface

    🤗 Evaluate: मशीन लर्निंग मॉडल और डेटासेट का आसानी से मूल्यांकन करने के लिए एक लाइब्रेरी।

    2,478-2पिछले 7 दिनों में स्टार का बदलाव
  • uptrain@uptrain-ai

    UpTrain जनरेटिव AI एप्लिकेशन का मूल्यांकन और सुधार करने के लिए एक ओपन-सोर्स एकीकृत प्लेटफॉर्म है। हम 20+ प्रीकॉन्फ़िगर किए गए चेक के लिए ग्रेड प्रदान करते हैं (भाषा, कोड, एम्बेडिंग उपयोग के मामलों को कवर करते हुए), विफलता के मामलों पर मूल कारण विश्लेषण करते हैं और उन्हें हल करने के तरीके पर अंतर्दृष्टि देते हैं।

    2,364+0पिछले 7 दिनों में स्टार का बदलाव
  • graph-rag-agent@1517005260

    RAG को बेहतर बनाएं: ज्ञान ग्राफ़ निर्माण और खोज के लिए GraphRAG, LightRAG, और Neo4j-llm-graph-builder को एकीकृत किया गया है; निजी RAG तर्क को प्राप्त करने के लिए DeepSearch तकनीक को एकीकृत किया गया है; GraphRAG के लिए कस्टम मूल्यांकन ढांचा बनाया गया है।

    2,332+3पिछले 7 दिनों में स्टार का बदलाव
  • fable-method@Sahir619

    The Fable Workflow: Claude Fable 5 ने कैसे काम किया, जिसे किसी भी मॉडल द्वारा चलाए जा सकने वाले कौशलों में संक्षेपित किया गया है।

    2,274+10पिछले 7 दिनों में स्टार का बदलाव
  • inspector@MCPJam

    MCP सर्वर, MCP ऐप्स और ChatGPT ऐप्स को चैट, निरीक्षण और डिबग करने के लिए परीक्षण और मूल्यांकन प्लेटफ़ॉर्म।

    2,183+6पिछले 7 दिनों में स्टार का बदलाव
  • 📰 LLM आधारित लॉन्ग कॉन्टेक्स्ट मॉडलिंग पर अवश्य पढ़ने योग्य पेपर और ब्लॉग 🔥

    2,164-1पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस