मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · evaluation

evaluation

evaluation टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

80 रिपॉजिटरी
  • evaluation-guidebook@huggingface

    Open LLM Leaderboard का प्रबंधन करते समय और lighteval को डिज़ाइन करते समय हमने जो व्यावहारिक अंतर्दृष्टि और सैद्धांतिक ज्ञान एकत्र किया है, उन्हें साझा करना!

    2,143+2पिछले 7 दिनों में स्टार का बदलाव
  • avalanche@ContinualAI

    Avalanche: PyTorch पर आधारित कंटीन्यूअल लर्निंग के लिए एक एंड-टू-एंड लाइब्रेरी।

    2,088+0पिछले 7 दिनों में स्टार का बदलाव
  • EvalAI@Cloud-CV

    :cloud: :rocket: :bar_chart: :chart_with_upwards_trend: AI में अत्याधुनिक तकनीक का मूल्यांकन

    2,037-2पिछले 7 दिनों में स्टार का बदलाव
  • alpaca_eval@tatsu-lab

    निर्देश-पालन करने वाले भाषा मॉडल के लिए एक स्वचालित मूल्यांकनकर्ता। मानव-सत्यापित, उच्च-गुणवत्ता, सस्ती और तेज़।

    2,012-1पिछले 7 दिनों में स्टार का बदलाव
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020) "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics" के लिए आधिकारिक Python कार्यान्वयन

    1,846+0पिछले 7 दिनों में स्टार का बदलाव
  • WFGY@onestardao

    WFGY, WFGY 5.0 Polaris Protocol की ओर बढ़ रहा है, जो AI रीज़निंग, RAG, एजेंट्स और वास्तविक दुनिया के वर्कफ़्लो के लिए एक बड़ा ओपन-सोर्स रिलीज़ है। इसमें Problem Map, Global Debug Card, WFGY 4.0, और CFV Easter Egg शामिल हैं।

    1,786+1पिछले 7 दिनों में स्टार का बदलाव
  • EmoLLM@SmartFlowAI

    मानसिक स्वास्थ्य लार्ज लैंग्वेज मॉडल (LLM x Mental Health), प्री- & पोस्ट-ट्रेनिंग & डेटासेट & मूल्यांकन & डिप्लॉय & RAG, InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM सीरीज़ मॉडल के साथ

    1,781+1पिछले 7 दिनों में स्टार का बदलाव
  • trpc-agent-go@trpc-group

    ग्राफ वर्कफ़्लो, टूल्स, मेमोरी, A2A, AG-UI, MCP, मूल्यांकन और ऑब्ज़र्वेबिलिटी के साथ प्रोडक्शन एजेंट सिस्टम बनाने के लिए एक Go फ्रेमवर्क।

    1,760+12पिछले 7 दिनों में स्टार का बदलाव
  • ragbits@deepsense-ai

    GenAI एप्लिकेशन के तेजी से विकास के लिए बिल्डिंग ब्लॉक

    1,668+0पिछले 7 दिनों में स्टार का बदलाव
  • सर्वे पेपर "A Survey on Evaluation of Large Language Models" के लिए आधिकारिक GitHub पेज।

    1,608-1पिछले 7 दिनों में स्टार का बदलाव
  • pycm@sepandhaghighi

    Python में मल्टी-क्लास कन्फ्यूजन मैट्रिक्स लाइब्रेरी

    1,506+0पिछले 7 दिनों में स्टार का बदलाव
  • nlg-eval@Maluuba

    प्राकृतिक भाषा पीढ़ी के लिए विभिन्न अनसुपरवाइज्ड स्वचालित मेट्रिक्स के लिए मूल्यांकन कोड।

    1,391+0पिछले 7 दिनों में स्टार का बदलाव
  • lispy@abo-abo

    संक्षिप्त और सरल LISP संपादन

    1,300+0पिछले 7 दिनों में स्टार का बदलाव
  • xai@EthicalML

    XAI - मशीन लर्निंग के लिए एक eXplainability टूलबॉक्स

    1,260+0पिछले 7 दिनों में स्टार का बदलाव
  • intellagent@plurai-ai

    सिमुलेटेड, यथार्थवादी सिंथेटिक इंटरैक्शन का उपयोग करके एजेंटों के व्यापक निदान और अनुकूलन के लिए एक फ्रेमवर्क

    1,257+0पिछले 7 दिनों में स्टार का बदलाव
  • KernelBench@ScalingIntelligence

    KernelBench: क्या LLMs GPU कर्नेल लिख सकते हैं? - बेंचमार्क + Torch -> CUDA (+ अधिक DSLs) के साथ टूलकिट

    1,227+7पिछले 7 दिनों में स्टार का बदलाव
  • kubetorch@run-house

    ML इंफ्रा के लिए PyTorch की तरह, Python में Kubernetes पर AI वर्कलोड को जादुई रूप से वितरित और चलाएं।

    1,224+0पिछले 7 दिनों में स्टार का बदलाव
  • fuzzbench@google

    FuzzBench - एक सेवा के रूप में फ़ज़र बेंचमार्किंग

    1,206+0पिछले 7 दिनों में स्टार का बदलाव
  • torch-fidelity@toshas

    PyTorch में जनरेटिव मॉडल के लिए उच्च-निष्ठा प्रदर्शन मेट्रिक्स

    1,200+1पिछले 7 दिनों में स्टार का बदलाव
  • Tracely-ai@Jwuthri

    AI एजेंट्स के लिए ट्रेस-नेटिव CI/CD — प्रोडक्शन की विफलताएं रिग्रेशन टेस्ट बन जाती हैं जो PR को ब्लॉक करती हैं। स्वचालित रूप से पता लगाएं, क्लस्टर करें, हर्मेटिक केस में फ्रीज करें और $0 में CI में रिप्ले करें।

    1,176-22पिछले 7 दिनों में स्टार का बदलाव
  • ncalc@ncalc

    NCalc .NET के लिए एक तेज़ और हल्का एक्सप्रेशन इवैल्यूएटर लाइब्रेरी है, जिसे लचीलेपन और उच्च प्रदर्शन के लिए डिज़ाइन किया गया है। यह गणितीय और तार्किक ऑपरेशन्स की एक विस्तृत श्रृंखला का समर्थन करता है।

    1,156+2पिछले 7 दिनों में स्टार का बदलाव
  • Gym@NVIDIA-NeMo

    एनवायरनमेंट का उपयोग करके मॉडल और एजेंटों का मूल्यांकन और सुधार करें

    1,155+7पिछले 7 दिनों में स्टार का बदलाव
  • prometheus-eval@prometheus-eval

    Prometheus और GPT4 के साथ अपने LLM के रिस्पॉन्स का मूल्यांकन करें 💯

    1,111+4पिछले 7 दिनों में स्टार का बदलाव
  • langsmith-sdk@langchain-ai

    LangSmith क्लाइंट SDK कार्यान्वयन

    1,049+9पिछले 7 दिनों में स्टार का बदलाव
  • डेटासेट विज़ुअलाइज़ेशन, डेटा प्रोसेसिंग और परिणामों के मूल्यांकन के लिए SemanticKITTI API

    898+3पिछले 7 दिनों में स्टार का बदलाव
  • deepfabric@nolabs-ai

    एक ही पाइपलाइन में उच्च-गुणवत्ता वाले सिंथेटिक्स उत्पन्न करें, प्रशिक्षित करें, मापें और मूल्यांकन करें

    885+3पिछले 7 दिनों में स्टार का बदलाव
  • ClawProBench@suyoumo

    ClawProBench एक लाइव-फर्स्ट बेंचमार्क हार्नेस है, जो OpenClaw रनटाइम में LLM एजेंट्स का मूल्यांकन करने के लिए नियतात्मक ग्रेडिंग और बार-बार परीक्षण की विश्वसनीयता प्रदान करता है।

    823+0पिछले 7 दिनों में स्टार का बदलाव
  • OpenJudge@agentscope-ai

    OpenJudge: समग्र मूल्यांकन और गुणवत्ता पुरस्कारों के लिए एक एकीकृत ढांचा

    820+14पिछले 7 दिनों में स्टार का बदलाव
  • gval@PaesslerAG

    गोलंग में एक्सप्रेशन इवैल्यूएशन

    814+1पिछले 7 दिनों में स्टार का बदलाव
  • web-codegen-scorer@angular

    Web Codegen Scorer LLMs द्वारा उत्पन्न वेब कोड की गुणवत्ता का मूल्यांकन करने के लिए एक टूल है

    774+4पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस