llm-evaluation
Repositori open source terpantau bertanda llm-evaluation, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan llm-evaluation di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda llm-evaluation.
- #1
Pustaka pilihan yang berisi sumber daya terbaik untuk membangun dan mengevaluasi AI agent — makalah, blog, ceramah, alat, dan tolok ukur. Dikelola oleh BenchFlow.
★ 865 - #2
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 623 - #3
Evolutionary multi-agent runtime that breeds, evaluates, and improves autonomous agents across reproducible epochs to converge on optimization of a goal.
★ 352 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
Platform rekayasa AI sumber terbuka: evaluasi LLM, observabilitas, metrik, manajemen prompt, playground, dan dataset. Terintegrasi dengan OpenTelemetry, LangChain, OpenAI SDK, LiteLLM, dan lainnya. 🍊YC W23
★ 34.116+207Perubahan bintang dalam 7 hari terakhir - #2
Platform rekayasa AI sumber terbuka untuk agen, LLM, dan model ML. MLflow memungkinkan tim dari berbagai skala untuk men-debug, mengevaluasi, memantau, dan mengoptimalkan aplikasi AI berkualitas produksi sambil mengontrol biaya serta mengelola akses ke model dan data.
★ 27.783+55Perubahan bintang dalam 7 hari terakhir - #3
Uji prompt, agen, dan RAG Anda. Red teaming/pentesting/pemindaian kerentanan untuk AI. Bandingkan performa GPT, Claude, Gemini, DeepSeek, dan lainnya. Konfigurasi deklaratif sederhana dengan integrasi baris perintah dan CI/CD. Digunakan oleh OpenAI dan Anthropic.
★ 24.767+103Perubahan bintang dalam 7 hari terakhir - #4
Debug, evaluasi, dan pantau aplikasi LLM, sistem RAG, dan alur kerja agen Anda dengan pelacakan komprehensif, evaluasi otomatis, dan dasbor siap produksi.
★ 21.752+84Perubahan bintang dalam 7 hari terakhir - #5★ 18.063+110Perubahan bintang dalam 7 hari terakhir
- #6
Audit independen untuk AI Agent. Dijalankan oleh manusia atau agen itu sendiri untuk menjawab pertanyaan paling krusial dalam Ekonomi AI Agent: Apakah agen melakukan apa yang seharusnya dilakukan? Dengan iFixAi, Anda bisa mendapatkan jawabannya dalam waktu kurang dari 120 detik.
★ 12.643+1.247Perubahan bintang dalam 7 hari terakhir - #7★ 11.298+55Perubahan bintang dalam 7 hari terakhir
- #8★ 9.094+23Perubahan bintang dalam 7 hari terakhir
- #9
非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.1、MiMo-V2、LongCat、gemma4、mistral等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。
★ 6.415+6Perubahan bintang dalam 7 hari terakhir - #10
🧊 Platform observabilitas LLM sumber terbuka. Satu baris kode untuk memantau, mengevaluasi, dan bereksperimen. YC W23 🍓
★ 6.127+11Perubahan bintang dalam 7 hari terakhir - #11
Platform AI Red Teaming full-stack untuk mengamankan ekosistem AI melalui Agent Scan, Skills Scan, MCP scan, AI Infra scan, dan evaluasi jailbreak LLM.
★ 6.117+59Perubahan bintang dalam 7 hari terakhir - #12
🐢 Pustaka pengujian dan evaluasi sumber terbuka untuk LLM Agent
★ 5.801+9Perubahan bintang dalam 7 hari terakhir - #13
Agent OS: agen menjadi lebih pintar dengan sendirinya. Kami menjaga batas: perintah penilaian dan hasil yang diharapkan tidak pernah masuk ke dalam kontrak kesuksesan yang kami berikan. Evaluasi bertahap yang dibatasi wawancara, perulangan evolusi beranggaran. Server MCP, 13 runtime: Claude Code, Codex CLI, Gemini CLI, OpenCode, Copilot, Kiro, dan lainnya.
★ 5.753+25Perubahan bintang dalam 7 hari terakhir - #14
Panduan praktis LLM: Dari dasar-dasar hingga penerapan aplikasi LLM dan RAG tingkat lanjut ke AWS menggunakan praktik terbaik LLMOps
★ 5.310+8Perubahan bintang dalam 7 hari terakhir - #15
AutoRAG: Sekarang agen Anda dapat menemukan apa pun di komputer Anda. Menjadi lebih cerdas jika Anda sering menggunakannya.
★ 5.058+1Perubahan bintang dalam 7 hari terakhir - #16
Toolkit evaluasi multimodal serbaguna untuk tugas teks, gambar, video, dan audio.
★ 4.390+7Perubahan bintang dalam 7 hari terakhir - #17
Kumpulan metode ilmiah, proses, algoritma, dan sistem untuk membangun cerita dan model.
★ 3.676+2Perubahan bintang dalam 7 hari terakhir - #18★ 3.530+2Perubahan bintang dalam 7 hari terakhir
- #19
Laminar - platform observabilitas sumber terbuka yang dibuat khusus untuk agen AI. YC S24.
★ 3.219+9Perubahan bintang dalam 7 hari terakhir - #20
Sumber daya komprehensif tentang AI Generatif, termasuk peta jalan terperinci, proyek, kasus penggunaan, persiapan wawancara, dan persiapan pemrograman.
★ 2.610+1Perubahan bintang dalam 7 hari terakhir - #21
Pemindai Kerentanan LLM Agen / Kit red teaming AI 🧪
★ 1.983+3Perubahan bintang dalam 7 hari terakhir - #22
Platform sumber terbuka end-to-end untuk mengevaluasi, mengawasi, dan meningkatkan aplikasi LLM dan agen AI. Penelusuran · Evaluasi · Simulasi · Kumpulan Data · Gateway · Guardrails. Dapat di-host sendiri. Apache 2.0.
★ 1.909+42Perubahan bintang dalam 7 hari terakhir - #23★ 1.641-1Perubahan bintang dalam 7 hari terakhir
- #24
Alat yang kuat untuk fuzzing LLM otomatis. Dirancang untuk membantu pengembang dan peneliti keamanan mengidentifikasi dan memitigasi potensi jailbreak pada API LLM mereka.
★ 1.573+4Perubahan bintang dalam 7 hari terakhir - #25
Prompty memudahkan pembuatan, pengelolaan,-debugging, dan evaluasi prompt LLM untuk aplikasi AI Anda. Prompty adalah kelas aset dan format untuk prompt LLM yang dirancang untuk meningkatkan keteramatan, keterpahaman, dan portabilitas bagi pengembang.
★ 1.255+1Perubahan bintang dalam 7 hari terakhir - #26
[JMLR 2026] "UQLM: Paket Python untuk Kuantifikasi Ketidakpastian dalam Large Language Models"
★ 1.194+1Perubahan bintang dalam 7 hari terakhir - #27
CI/CD berbasis trace untuk agen AI — kegagalan produksi menjadi tes regresi yang memblokir PR. Deteksi otomatis, klasterisasi, pembekuan menjadi kasus hermetik, dan pemutaran ulang di CI dengan biaya $0.
★ 1.176-22Perubahan bintang dalam 7 hari terakhir - #28
Stack Peningkatan Berkelanjutan untuk Agen. Data lingkungan dan evaluasi kami mendukung peningkatan dan pemantauan agen.
★ 1.060+2Perubahan bintang dalam 7 hari terakhir - #29
Agen riset ekuitas AI dengan alur kerja tangguh, RAG berbasis bukti, laporan versi, dan evaluasi kualitas otomatis.
★ 1.032-2Perubahan bintang dalam 7 hari terakhir - #30
Pustaka pilihan yang berisi sumber daya terbaik untuk membangun dan mengevaluasi AI agent — makalah, blog, ceramah, alat, dan tolok ukur. Dikelola oleh BenchFlow.
★ 865+18Perubahan bintang dalam 7 hari terakhir