मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · evaluation

evaluation

evaluation टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

80 रिपॉजिटरी
  • RAG-FiT@IntelLabs

    फ़ाइन-ट्यूनिंग का उपयोग करके RAG कार्यों के लिए LLM को बढ़ाने का फ्रेमवर्क।

    768+0पिछले 7 दिनों में स्टार का बदलाव
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] LLMs, VLMs और वीडियो जेनरेटिव मॉडल सहित बड़े मॉडलों को कंप्रेस करने के लिए एक शक्तिशाली टूलकिट।

    747+4पिछले 7 दिनों में स्टार का बदलाव
  • opik-openclaw@comet-ml

    🦞 OpenClaw के लिए आधिकारिक प्लगइन जो एजेंट ट्रेसेस को Opik में एक्सपोर्ट करता है। एजेंट के व्यवहार, लागत, टोकन, त्रुटियों और अन्य चीजों को देखें और मॉनिटर करें।

    725+0पिछले 7 दिनों में स्टार का बदलाव
  • iou-tracker@bochinski

    IOU Tracker का Python कार्यान्वयन

    702+0पिछले 7 दिनों में स्टार का बदलाव
  • ranx@AmenRa

    ⚡️रैंकिंग मूल्यांकन, तुलना और फ्यूजन के लिए एक अत्यंत तेज़ Python लाइब्रेरी 🐍

    698+4पिछले 7 दिनों में स्टार का बदलाव
  • long-form-factuality@google-deepmind

    लार्ज लैंग्वेज मॉडल में लॉन्ग-फॉर्म तथ्यात्मकता की बेंचमार्किंग। हमारे पेपर "लॉन्ग-फॉर्म फैक्चुअलिटी इन लार्ज लैंग्वेज मॉडल्स" के लिए मूल कोड।

    693+2पिछले 7 दिनों में स्टार का बदलाव
  • ClawBench@TIGER-AI-Lab

    दैनिक कार्यों पर ब्राउज़र AI एजेंटों के लिए ओपन-सोर्स बेंचमार्क।

    675+61पिछले 7 दिनों में स्टार का बदलाव
  • Awesome-LLM-Eval: मुख्य रूप से LLM मूल्यांकन के लिए टूल, डेटासेट/बेंचमार्क, डेमो, लीडरबोर्ड, पेपर, डॉक्स और मॉडल की एक क्यूरेटेड सूची।

    656-2पिछले 7 दिनों में स्टार का बदलाव
  • autoprompt@ucinlp

    AutoPrompt: मास्क किए गए भाषा मॉडल के लिए स्वचालित प्रॉम्प्ट निर्माण।

    641+0पिछले 7 दिनों में स्टार का बदलाव
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: लार्ज लैंग्वेज मॉडल में विश्वसनीयता

    632+2पिछले 7 दिनों में स्टार का बदलाव
  • एक C# फ़ाइल में सरल गणित और स्यूडो C# एक्सप्रेशन इवैल्यूएटर। यह छोटे C# जैसे स्क्रिप्ट भी चला सकता है

    630+0पिछले 7 दिनों में स्टार का बदलाव
  • Large Language Models में मशीन अनलर्निंग के लिए एक संसाधन रिपॉजिटरी

    624+0पिछले 7 दिनों में स्टार का बदलाव
  • tcexam@tecnickcom

    TCExam विश्वविद्यालयों, स्कूलों और कंपनियों के लिए एक CBA (कंप्यूटर-आधारित मूल्यांकन) सिस्टम है, जो शिक्षकों और प्रशिक्षकों को सर्वेक्षण, क्विज़, टेस्ट और परीक्षाओं को बनाने, शेड्यूल करने, वितरित करने और रिपोर्ट करने में सक्षम बनाता है

    621+0पिछले 7 दिनों में स्टार का बदलाव
  • simpleeval@danthedeckie

    Python के लिए सरल, सुरक्षित, सैंडबॉक्स्ड और एक्स्टेंसिबल एक्सप्रेशन इवैल्यूएटर

    611+0पिछले 7 दिनों में स्टार का बदलाव
  • MMMU@MMMU-Benchmark

    यह रिपॉजिटरी "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI" पेपर के लिए मूल्यांकन कोड प्रदान करती है।

    594+1पिछले 7 दिनों में स्टार का बदलाव
  • image-matching-toolbox@GrumpyZhou

    यह इमेज के जोड़े से इमेज मैचिंग करने वाली विभिन्न विधियों का मूल्यांकन करने के लिए एक टूलबॉक्स रिपॉजिटरी है

    594+0पिछले 7 दिनों में स्टार का बदलाव
  • text2sql-data@jkkummerfeld

    डेटासेट का संग्रह जो प्रश्नों को SQL क्वेरी के साथ जोड़ता है

    588+1पिछले 7 दिनों में स्टार का बदलाव
  • ParseBench@run-llama

    ParseBench - AI एजेंटों के लिए एक दस्तावेज़ पार्सिंग बेंचमार्क

    565+12पिछले 7 दिनों में स्टार का बदलाव
  • Meta Agents Research Environments एक व्यापक प्लेटफॉर्म है जिसे गतिशील और यथार्थवादी परिदृश्यों में AI एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है। स्थिर बेंचमार्क के विपरीत, यह प्लेटफॉर्म ऐसे विकसित वातावरण पेश करता है जहाँ एजेंटों को नई जानकारी उपलब्ध होने पर अपनी रणनीतियों को अनुकूलित करना पड़ता है, जो वास्तविक दुनिया की चुनौतियों को दर्शाता है।

    551+3पिछले 7 दिनों में स्टार का बदलाव
  • कंपनी के आंतरिक दस्तावेजों पर RAG के लिए डेटासेट और बेंचमार्क।

    546+11पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस