evals
Repositori open source terpantau bertanda evals, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan evals di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda evals.
- #1
Waku Waku! Waku Agent adalah perangkat agen AI berbasis lokal yang benar-benar Anda miliki, mencakup loop, memori, eval, semuanya dalam kode yang dirancang agar tetap mudah dibaca seiring perkembangannya.
★ 1.621 - #2
CI/CD berbasis trace untuk agen AI — kegagalan produksi menjadi tes regresi yang memblokir PR. Deteksi otomatis, klasterisasi, pembekuan menjadi kasus hermetik, dan pemutaran ulang di CI dengan biaya $0.
★ 1.159 - #3
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 912 - #4
Pustaka pilihan yang berisi sumber daya terbaik untuk membangun dan mengevaluasi AI agent — makalah, blog, ceramah, alat, dan tolok ukur. Dikelola oleh BenchFlow.
★ 849 - #5
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 552
- #1
Mastra adalah kerangka kerja TypeScript modern untuk aplikasi dan agen berbasis AI.
★ 27.561+204Perubahan bintang dalam 7 hari terakhir - #2★ 11.243+101Perubahan bintang dalam 7 hari terakhir
- #3
SDK Python untuk pemantauan agen AI, pelacakan biaya LLM, benchmarking, dan lainnya. Terintegrasi dengan sebagian besar LLM dan kerangka kerja agen termasuk CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2, dan CamelAI.
★ 5.805+16Perubahan bintang dalam 7 hari terakhir - #4
Membangun, Mengevaluasi, dan Mengoptimalkan Sistem AI. Mencakup evaluasi, RAG, agen, fine-tuning, pembuatan data sintetis, manajemen dataset, MCP, dan lainnya.
★ 5.037+7Perubahan bintang dalam 7 hari terakhir - #5★ 4.764+256Perubahan bintang dalam 7 hari terakhir
- #6★ 4.446+14Perubahan bintang dalam 7 hari terakhir
- #7★ 3.528+10Perubahan bintang dalam 7 hari terakhir
- #8
Laminar - platform observabilitas sumber terbuka yang dibuat khusus untuk agen AI. YC S24.
★ 3.210+24Perubahan bintang dalam 7 hari terakhir - #9
Panduan desain sistem AI untuk insinyur yang membangun sistem AI produksi dan evaluasi.
★ 2.919+221Perubahan bintang dalam 7 hari terakhir - #10
Ubah alur kerja apa pun menjadi keterampilan agen AI yang dapat digunakan kembali dan diinstal di 17 platform — Claude Code, Copilot, Cursor, Windsurf, Codex, Gemini, Kiro, dan lainnya. Satu SKILL.md untuk setiap platform.
★ 2.356+56Perubahan bintang dalam 7 hari terakhir - #11
Platform pengujian dan evaluasi untuk mengobrol, memeriksa, dan men-debug server MCP, aplikasi MCP, dan aplikasi ChatGPT.
★ 2.177+23Perubahan bintang dalam 7 hari terakhir - #12★ 1.672+8Perubahan bintang dalam 7 hari terakhir
- #13
Waku Waku! Waku Agent adalah perangkat agen AI berbasis lokal yang benar-benar Anda miliki, mencakup loop, memori, eval, semuanya dalam kode yang dirancang agar tetap mudah dibaca seiring perkembangannya.
★ 1.621+89Perubahan bintang dalam 7 hari terakhir - #14
Observabilitas dan penegakan kebijakan untuk wadah AI agent. Tangkap setiap eksekusi dan keandalan waktu proses dengan penegakan kebijakan. 40 kebijakan bawaan, dasbor lokal, tanpa perlu akun dengan paket cloud gratis yang fleksibel
★ 1.543+215Perubahan bintang dalam 7 hari terakhir - #15
Layanan pelanggan siap produksi sumber terbuka dengan evaluasi dan pemantauan bawaan
★ 1.538+3Perubahan bintang dalam 7 hari terakhir - #16
🥤 RAGLite adalah toolkit Python untuk Retrieval-Augmented Generation (RAG) dengan DuckDB atau PostgreSQL
★ 1.200+1Perubahan bintang dalam 7 hari terakhir - #17
CI/CD berbasis trace untuk agen AI — kegagalan produksi menjadi tes regresi yang memblokir PR. Deteksi otomatis, klasterisasi, pembekuan menjadi kasus hermetik, dan pemutaran ulang di CI dengan biaya $0.
★ 1.159+331Perubahan bintang dalam 7 hari terakhir - #18
Bangun sistem berbasis agen. Jalankan dengan percaya diri. Orkes-kan agen, otomatiskan proses bisnis, periksa setiap eksekusi, dan jaga manusia tetap pegang kendali. Deploy Heym di infrastruktur Anda sendiri.
★ 1.057+87Perubahan bintang dalam 7 hari terakhir - #19
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
★ 912—Perubahan bintang dalam 7 hari terakhir - #20
Pembuat skill yang membuktikan skill-nya berfungsi. Pembuatan skill berbasis bukti untuk Claude Code dan Codex: pembuatan dengan pengujian dasar, evaluasi regresi per skill, pemeriksa ekosistem, kompilasi lintas runtime, dan penasihat proaktif opsional.
★ 885+9Perubahan bintang dalam 7 hari terakhir - #21
Pustaka pilihan yang berisi sumber daya terbaik untuk membangun dan mengevaluasi AI agent — makalah, blog, ceramah, alat, dan tolok ukur. Dikelola oleh BenchFlow.
★ 849+10Perubahan bintang dalam 7 hari terakhir - #22
Hands-on, framework-free Colab notebooks for the AI Engineer / Forward Deployed Engineer (FDE) skill set — model APIs, structured output, tool calling, RAG, evals-as-the-spine, agents (loop from scratch, tool design, guardrails, MCP, Skills), fine-tuning vs LoRA, prompt-injection/security, LLMOps, and customer craft. Runs on the free Groq API.
★ 552—Perubahan bintang dalam 7 hari terakhir