evaluation
Repositori open source terpantau bertanda evaluation, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan evaluation di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda evaluation.
- #1
Alur Kerja Fable: cara kerja Claude Fable 5, diringkas menjadi keterampilan yang dapat dijalankan oleh model apa pun, dengan evaluasi yang menjaganya tetap jujur. Berpikir / bertindak / membuktikan.
★ 2.267 - #2
CI/CD berbasis trace untuk agen AI — kegagalan produksi menjadi tes regresi yang memblokir PR. Deteksi otomatis, klasterisasi, pembekuan menjadi kasus hermetik, dan pemutaran ulang di CI dengan biaya $0.
★ 1.159 - #3
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1
Platform rekayasa AI sumber terbuka: evaluasi LLM, observabilitas, metrik, manajemen prompt, playground, dan dataset. Terintegrasi dengan OpenTelemetry, LangChain, OpenAI SDK, LiteLLM, dan lainnya. 🍊YC W23
★ 33.909+372Perubahan bintang dalam 7 hari terakhir - #2
Platform rekayasa AI sumber terbuka untuk agen, LLM, dan model ML. MLflow memungkinkan tim dari berbagai skala untuk men-debug, mengevaluasi, memantau, dan mengoptimalkan aplikasi AI berkualitas produksi sambil mengontrol biaya serta mengelola akses ke model dan data.
★ 27.728+114Perubahan bintang dalam 7 hari terakhir - #3
Uji prompt, agen, dan RAG Anda. Red teaming/pentesting/pemindaian kerentanan untuk AI. Bandingkan performa GPT, Claude, Gemini, DeepSeek, dan lainnya. Konfigurasi deklaratif sederhana dengan integrasi baris perintah dan CI/CD. Digunakan oleh OpenAI dan Anthropic.
★ 24.664+215Perubahan bintang dalam 7 hari terakhir - #4
Debug, evaluasi, dan pantau aplikasi LLM, sistem RAG, dan alur kerja agen Anda dengan pelacakan komprehensif, evaluasi otomatis, dan dasbor siap produksi.
★ 21.668+143Perubahan bintang dalam 7 hari terakhir - #5
Platform pengetahuan LLM open-source: mengubah dokumen mentah menjadi RAG yang dapat dikueri, agen penalaran otonom, dan Wiki yang dapat dikelola sendiri.
★ 20.899+581Perubahan bintang dalam 7 hari terakhir - #6★ 15.541+123Perubahan bintang dalam 7 hari terakhir
- #7
Lakukan fine-tuning, evaluasi, dan deploy Qwen, Gemma, atau LLM open weight lainnya dengan mudah!
★ 9.380+3Perubahan bintang dalam 7 hari terakhir - #8
OpenCompass adalah platform evaluasi LLM, mendukung berbagai model (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, dll.) pada 100+ dataset.
★ 7.374+48Perubahan bintang dalam 7 hari terakhir - #9
🧊 Platform observabilitas LLM sumber terbuka. Satu baris kode untuk memantau, mengevaluasi, dan bereksperimen. YC W23 🍓
★ 6.116+23Perubahan bintang dalam 7 hari terakhir - #10
Platform Optimasi AI Agent Generasi Berikutnya: Cozeloop mengatasi tantangan dalam pengembangan AI agent dengan menyediakan kemampuan manajemen siklus hidup penuh mulai dari pengembangan, debugging, evaluasi, hingga pemantauan.
★ 5.706+7Perubahan bintang dalam 7 hari terakhir - #11
AutoRAG: Sekarang agen Anda dapat menemukan apa pun di komputer Anda. Menjadi lebih cerdas jika Anda sering menggunakannya.
★ 5.057+7Perubahan bintang dalam 7 hari terakhir - #12
Membangun, Mengevaluasi, dan Mengoptimalkan Sistem AI. Mencakup evaluasi, RAG, agen, fine-tuning, pembuatan data sintetis, manajemen dataset, MCP, dan lainnya.
★ 5.037+7Perubahan bintang dalam 7 hari terakhir - #13
Toolkit evaluasi multimodal serbaguna untuk tugas teks, gambar, video, dan audio.
★ 4.383+11Perubahan bintang dalam 7 hari terakhir - #14
Toolkit evaluasi open-source untuk large multi-modality models (LMMs), mendukung 220+ LMM, 80+ benchmark
★ 4.362+10Perubahan bintang dalam 7 hari terakhir - #15★ 4.310+7Perubahan bintang dalam 7 hari terakhir
- #16★ 3.517+13Perubahan bintang dalam 7 hari terakhir
- #17★ 3.409+9Perubahan bintang dalam 7 hari terakhir
- #18
Kerangka kerja yang efisien dan dapat disesuaikan untuk evaluasi model besar (LLM, VLM, AIGC) serta tolok ukur performa.
★ 3.331+47Perubahan bintang dalam 7 hari terakhir - #19
SuperCLUE: Benchmark Komprehensif Model Bahasa Besar Bahasa Mandarin | Benchmark untuk Model Dasar dalam Bahasa Mandarin
★ 3.299-1Perubahan bintang dalam 7 hari terakhir - #20
Laminar - platform observabilitas sumber terbuka yang dibuat khusus untuk agen AI. YC S24.
★ 3.210+24Perubahan bintang dalam 7 hari terakhir - #21
Klipse adalah plugin JavaScript untuk menyematkan cuplikan kode interaktif di blog teknologi.
★ 3.134+0Perubahan bintang dalam 7 hari terakhir - #22
Lingkungan pemrograman visual open-source untuk menguji prompt LLM secara mendalam.
★ 3.028+1Perubahan bintang dalam 7 hari terakhir - #23
YAO = Yielding AI Outcomes. Sistem teknik, evaluasi, tata kelola, dan portabilitas yang ketat untuk keterampilan agen yang dapat digunakan kembali.
★ 2.557+160Perubahan bintang dalam 7 hari terakhir - #24
Lighteval adalah perangkat lengkap Anda untuk mengevaluasi LLM di berbagai backend
★ 2.530+8Perubahan bintang dalam 7 hari terakhir - #25
🤗 Evaluate: Pustaka untuk mengevaluasi model dan dataset pembelajaran mesin dengan mudah.
★ 2.480+2Perubahan bintang dalam 7 hari terakhir - #26
UpTrain adalah platform terpadu open-source untuk mengevaluasi dan meningkatkan aplikasi Generative AI. Kami menyediakan penilaian untuk 20+ pemeriksaan yang telah dikonfigurasi sebelumnya (mencakup kasus penggunaan bahasa, kode, dan embedding), melakukan analisis akar penyebab pada kasus kegagalan, serta memberikan wawasan tentang cara mengatasinya.
★ 2.364+3Perubahan bintang dalam 7 hari terakhir - #27
Mengintegrasikan GraphRAG, LightRAG, dan Neo4j-llm-graph-builder untuk konstruksi dan pencarian knowledge graph. Menggabungkan teknologi DeepSearch untuk penalaran RAG privat serta menyediakan kerangka evaluasi khusus untuk GraphRAG.
★ 2.330+8Perubahan bintang dalam 7 hari terakhir - #28
Alur Kerja Fable: cara kerja Claude Fable 5, diringkas menjadi keterampilan yang dapat dijalankan oleh model apa pun, dengan evaluasi yang menjaganya tetap jujur. Berpikir / bertindak / membuktikan.
★ 2.267+23Perubahan bintang dalam 7 hari terakhir - #29
Platform pengujian dan evaluasi untuk mengobrol, memeriksa, dan men-debug server MCP, aplikasi MCP, dan aplikasi ChatGPT.
★ 2.177+23Perubahan bintang dalam 7 hari terakhir - #30
📰 Makalah dan blog wajib baca tentang Pemodelan Konteks Panjang berbasis LLM 🔥
★ 2.165+2Perubahan bintang dalam 7 hari terakhir