evals
evals टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर evals के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और evals टैग वाली रिपॉजिटरी।
- #1
Waku Waku! Waku Agent एक स्थानीय-प्रथम AI एजेंट हार्नेस है जिसके आप वास्तव में मालिक हैं, जिसमें लूप, मेमोरी, इval शामिल हैं, यह सब कोड में बनाया गया है ताकि बढ़ने पर भी स्पष्ट रहे।
★ 1,649 - #2
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 1,071 - #3
AI एजेंटों के निर्माण और मूल्यांकन के लिए सर्वोत्तम संसाधनों की एक क्यूरेटेड लाइब्रेरी - पेपर, ब्लॉग, टॉक, टूल, बेंचमार्क। BenchFlow द्वारा अनुरक्षित।
★ 865 - #4
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 612 - #5★ 154
- #1★ 27,657+96पिछले 7 दिनों में स्टार का बदलाव
- #2★ 11,298+55पिछले 7 दिनों में स्टार का बदलाव
- #3
AI एजेंट मॉनिटरिंग, LLM कॉस्ट ट्रैकिंग, बेंचमार्किंग और बहुत कुछ के लिए Python SDK। CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2, और CamelAI सहित अधिकांश LLMs और एजेंट फ्रेमवर्क के साथ एकीकृत होता है
★ 5,808+3पिछले 7 दिनों में स्टार का बदलाव - #4
AI सिस्टम बनाएं, मूल्यांकन करें और अनुकूलित करें। इसमें मूल्यांकन, RAG, एजेंट, फाइन-ट्यूनिंग, सिंथेटिक डेटा जनरेशन, डेटासेट प्रबंधन, MCP और बहुत कुछ शामिल है।
★ 5,042+5पिछले 7 दिनों में स्टार का बदलाव - #5★ 4,884+120पिछले 7 दिनों में स्टार का बदलाव
- #6★ 4,450+4पिछले 7 दिनों में स्टार का बदलाव
- #7★ 3,530+2पिछले 7 दिनों में स्टार का बदलाव
- #8
Laminar - AI एजेंट्स के लिए विशेष रूप से निर्मित ओपन-सोर्स ऑब्जर्वेबिलिटी प्लेटफॉर्म। YC S24।
★ 3,219+9पिछले 7 दिनों में स्टार का बदलाव - #9
प्रोडक्शन AI सिस्टम और इval बनाने वाले इंजीनियरों के लिए AI सिस्टम डिज़ाइन गाइड।
★ 2,978+59पिछले 7 दिनों में स्टार का बदलाव - #10
किसी भी वर्कफ़्लो को पुन: प्रयोज्य AI एजेंट स्किल्स में बदलें जो 17 प्लेटफॉर्म पर इंस्टॉल हो सकें — जैसे Claude Code, Copilot, Cursor, Windsurf, Codex, Gemini, Kiro आदि। एक SKILL.md, हर प्लेटफॉर्म के लिए।
★ 2,371+20पिछले 7 दिनों में स्टार का बदलाव - #11
MCP सर्वर, MCP ऐप्स और ChatGPT ऐप्स को चैट, निरीक्षण और डिबग करने के लिए परीक्षण और मूल्यांकन प्लेटफ़ॉर्म।
★ 2,183+6पिछले 7 दिनों में स्टार का बदलाव - #12
AI एजेंट हार्नेस के लिए ऑब्जर्वेबिलिटी और एन्फोर्समेंट। पॉलिसी एन्फोर्समेंट के साथ हर रन और रनटाइम विश्वसनीयता को कैप्चर करें। 40 इन-बिल्ट पॉलिसी, एक लोकल डैशबोर्ड, एक उदार मुफ्त क्लाउड प्लान के साथ किसी खाते की आवश्यकता नहीं है
★ 1,719+203पिछले 7 दिनों में स्टार का बदलाव - #13★ 1,673+3पिछले 7 दिनों में स्टार का बदलाव
- #14
Waku Waku! Waku Agent एक स्थानीय-प्रथम AI एजेंट हार्नेस है जिसके आप वास्तव में मालिक हैं, जिसमें लूप, मेमोरी, इval शामिल हैं, यह सब कोड में बनाया गया है ताकि बढ़ने पर भी स्पष्ट रहे।
★ 1,649+41पिछले 7 दिनों में स्टार का बदलाव - #15
बिल्ट-इन Evals और मॉनिटरिंग के साथ ओपन-सोर्स प्रोडक्शन के लिए तैयार कस्टमर सर्विस
★ 1,539+1पिछले 7 दिनों में स्टार का बदलाव - #16
🥤 RAGLite, DuckDB या PostgreSQL के साथ रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) के लिए एक Python टूलकिट है
★ 1,200+1पिछले 7 दिनों में स्टार का बदलाव - #17
AI एजेंट्स के लिए ट्रेस-नेटिव CI/CD — प्रोडक्शन की विफलताएं रिग्रेशन टेस्ट बन जाती हैं जो PR को ब्लॉक करती हैं। स्वचालित रूप से पता लगाएं, क्लस्टर करें, हर्मेटिक केस में फ्रीज करें और $0 में CI में रिप्ले करें।
★ 1,176-22पिछले 7 दिनों में स्टार का बदलाव - #18
एजेंटिक सिस्टम बनाएं। उन्हें आत्मविश्वास के साथ चलाएं। एजेंटों को व्यवस्थित करें, व्यावसायिक प्रक्रियाओं को स्वचालित करें, प्रत्येक निष्पादन का निरीक्षण करें और मनुष्यों को नियंत्रण में रखें। Heym को अपने स्वयं के इंफ्रास्ट्रक्चर पर तैनात करें।
★ 1,105+55पिछले 7 दिनों में स्टार का बदलाव - #19
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 1,071+174पिछले 7 दिनों में स्टार का बदलाव - #20
एक स्किल क्रिएटर जो अपनी कार्यक्षमता साबित करता है। Claude Code और Codex के लिए साक्ष्य-आधारित स्किल क्रिएशन: बेसलाइन-टेस्टेड जनरेशन, प्रति-स्किल रिग्रेशन मूल्यांकन, इकोसिस्टम डॉक्टर, क्रॉस-रनटाइम कंपाइल और एक ऑप्ट-इन प्रोएक्टिव एडवाइजर।
★ 885+0पिछले 7 दिनों में स्टार का बदलाव - #21
AI एजेंटों के निर्माण और मूल्यांकन के लिए सर्वोत्तम संसाधनों की एक क्यूरेटेड लाइब्रेरी - पेपर, ब्लॉग, टॉक, टूल, बेंचमार्क। BenchFlow द्वारा अनुरक्षित।
★ 865+17पिछले 7 दिनों में स्टार का बदलाव - #22
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 612—पिछले 7 दिनों में स्टार का बदलाव