evaluation
Repositori open source terpantau bertanda evaluation, diurutkan berdasarkan bintang.
- #31
Berbagi wawasan praktis dan pengetahuan teoretis tentang evaluasi LLM yang kami kumpulkan saat mengelola Open LLM Leaderboard dan merancang lighteval!
★ 2.143+2Perubahan bintang dalam 7 hari terakhir - #32
Avalanche: Pustaka End-to-End untuk Pembelajaran Berkelanjutan berbasis PyTorch.
★ 2.088+0Perubahan bintang dalam 7 hari terakhir - #33★ 2.037-2Perubahan bintang dalam 7 hari terakhir
- #34
Evaluator otomatis untuk model bahasa yang mengikuti instruksi. Tervalidasi oleh manusia, berkualitas tinggi, murah, dan cepat.
★ 2.012-1Perubahan bintang dalam 7 hari terakhir - #35
(IROS 2020, ECCVW 2020) Implementasi Python resmi untuk "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics".
★ 1.846+0Perubahan bintang dalam 7 hari terakhir - #36
WFGY menuju ke WFGY 5.0 Polaris Protocol, rilis open-source utama untuk penalaran AI, RAG, agen, dan alur kerja dunia nyata. Termasuk Problem Map, Global Debug Card, WFGY 4.0, dan CFV Easter Egg.
★ 1.786+1Perubahan bintang dalam 7 hari terakhir - #37
Model Bahasa Besar (LLM) Kesehatan Mental, Pelatihan Pra & Pasca & Dataset & Evaluasi & Penerapan & RAG, dengan model seri InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM
★ 1.781+1Perubahan bintang dalam 7 hari terakhir - #38
Framework Go untuk membangun sistem agen produksi dengan alur kerja berbasis grafik, alat, memori, A2A, AG-UI, MCP, evaluasi, dan observabilitas.
★ 1.760+12Perubahan bintang dalam 7 hari terakhir - #39★ 1.668+0Perubahan bintang dalam 7 hari terakhir
- #40
Halaman resmi GitHub untuk makalah survei "A Survey on Evaluation of Large Language Models".
★ 1.608-1Perubahan bintang dalam 7 hari terakhir - #41★ 1.506+0Perubahan bintang dalam 7 hari terakhir
- #42
Kode evaluasi untuk berbagai metrik otomatis tak terbimbing untuk Natural Language Generation.
★ 1.391+0Perubahan bintang dalam 7 hari terakhir - #43★ 1.300+0Perubahan bintang dalam 7 hari terakhir
- #44★ 1.260+0Perubahan bintang dalam 7 hari terakhir
- #45
Kerangka kerja untuk diagnosis komprehensif dan optimasi agen menggunakan interaksi sintetis yang disimulasikan dan realistis
★ 1.257+0Perubahan bintang dalam 7 hari terakhir - #46
KernelBench: Apakah LLM Dapat Menulis Kernel GPU? - Tolok Ukur + Toolkit dengan Torch -> CUDA (+ lebih banyak DSL)
★ 1.227+7Perubahan bintang dalam 7 hari terakhir - #47
Distribusikan dan jalankan beban kerja AI di Kubernetes secara ajaib dengan Python, seperti PyTorch untuk infrastruktur ML.
★ 1.224+0Perubahan bintang dalam 7 hari terakhir - #48★ 1.206+0Perubahan bintang dalam 7 hari terakhir
- #49
Metrik performa fidelitas tinggi untuk model generatif di PyTorch
★ 1.200+1Perubahan bintang dalam 7 hari terakhir - #50
CI/CD berbasis trace untuk agen AI — kegagalan produksi menjadi tes regresi yang memblokir PR. Deteksi otomatis, klasterisasi, pembekuan menjadi kasus hermetik, dan pemutaran ulang di CI dengan biaya $0.
★ 1.176-22Perubahan bintang dalam 7 hari terakhir - #51
NCalc adalah pustaka evaluator ekspresi yang cepat dan ringan untuk .NET, dirancang untuk fleksibilitas dan performa tinggi. Mendukung berbagai operasi matematika dan logika.
★ 1.156+2Perubahan bintang dalam 7 hari terakhir - #52★ 1.155+7Perubahan bintang dalam 7 hari terakhir
- #53
Evaluasi respons LLM Anda dengan Prometheus dan GPT4 💯
★ 1.111+4Perubahan bintang dalam 7 hari terakhir - #54
Implementasi SDK Klien LangSmith
★ 1.049+8Perubahan bintang dalam 7 hari terakhir - #55
API SemanticKITTI untuk visualisasi dataset, pemrosesan data, dan evaluasi hasil.
★ 898+3Perubahan bintang dalam 7 hari terakhir - #56
Hasilkan Data Sintetis Berkualitas Tinggi, Latih, Ukur, dan Evaluasi dalam Satu Pipeline
★ 885+3Perubahan bintang dalam 7 hari terakhir - #57
ClawProBench adalah harness benchmark live-first untuk mengevaluasi agen LLM di runtime OpenClaw dengan penilaian deterministik dan keandalan uji coba berulang.
★ 823+0Perubahan bintang dalam 7 hari terakhir - #58
OpenJudge: Kerangka Kerja Terpadu untuk Evaluasi Holistik dan Quality Rewards
★ 819+12Perubahan bintang dalam 7 hari terakhir - #59★ 814+1Perubahan bintang dalam 7 hari terakhir
- #60
Web Codegen Scorer adalah alat untuk mengevaluasi kualitas kode web yang dihasilkan oleh LLM.
★ 775+4Perubahan bintang dalam 7 hari terakhir