Lompat ke konten utama
buildradar
Sign in
Topik · evaluation

evaluation

Repositori open source terpantau bertanda evaluation, diurutkan berdasarkan bintang.

Repositori
80
Total bintang
291.588
Rata-rata bintang
3.645
Porsi
0,02%

Topik yang sering muncul berdampingan dengan evaluation di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda evaluation.

  • fable-method@Sahir619

    Alur Kerja Fable: cara kerja Claude Fable 5, diringkas menjadi keterampilan yang dapat dijalankan oleh model apa pun, dengan evaluasi yang menjaganya tetap jujur. Berpikir / bertindak / membuktikan.

    2.267
  • Tracely-ai@Jwuthri

    CI/CD berbasis trace untuk agen AI — kegagalan produksi menjadi tes regresi yang memblokir PR. Deteksi otomatis, klasterisasi, pembekuan menjadi kasus hermetik, dan pemutaran ulang di CI dengan biaya $0.

    1.159
  • HarnessEval-W@MirroS-Lab

    HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    256
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • langfuse@langfuse

    Platform rekayasa AI sumber terbuka: evaluasi LLM, observabilitas, metrik, manajemen prompt, playground, dan dataset. Terintegrasi dengan OpenTelemetry, LangChain, OpenAI SDK, LiteLLM, dan lainnya. 🍊YC W23

    33.909+372Perubahan bintang dalam 7 hari terakhir
  • mlflow@mlflow

    Platform rekayasa AI sumber terbuka untuk agen, LLM, dan model ML. MLflow memungkinkan tim dari berbagai skala untuk men-debug, mengevaluasi, memantau, dan mengoptimalkan aplikasi AI berkualitas produksi sambil mengontrol biaya serta mengelola akses ke model dan data.

    27.728+114Perubahan bintang dalam 7 hari terakhir
  • promptfoo@promptfoo

    Uji prompt, agen, dan RAG Anda. Red teaming/pentesting/pemindaian kerentanan untuk AI. Bandingkan performa GPT, Claude, Gemini, DeepSeek, dan lainnya. Konfigurasi deklaratif sederhana dengan integrasi baris perintah dan CI/CD. Digunakan oleh OpenAI dan Anthropic.

    24.664+215Perubahan bintang dalam 7 hari terakhir
  • opik@comet-ml

    Debug, evaluasi, dan pantau aplikasi LLM, sistem RAG, dan alur kerja agen Anda dengan pelacakan komprehensif, evaluasi otomatis, dan dasbor siap produksi.

    21.668+143Perubahan bintang dalam 7 hari terakhir
  • WeKnora@Tencent

    Platform pengetahuan LLM open-source: mengubah dokumen mentah menjadi RAG yang dapat dikueri, agen penalaran otonom, dan Wiki yang dapat dikelola sendiri.

    20.899+581Perubahan bintang dalam 7 hari terakhir
  • ragas@vibrantlabsai

    Tingkatkan Evaluasi Aplikasi LLM Anda 🚀

    15.541+123Perubahan bintang dalam 7 hari terakhir
  • oumi@oumi-ai

    Lakukan fine-tuning, evaluasi, dan deploy Qwen, Gemma, atau LLM open weight lainnya dengan mudah!

    9.380+3Perubahan bintang dalam 7 hari terakhir
  • opencompass@open-compass

    OpenCompass adalah platform evaluasi LLM, mendukung berbagai model (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, dll.) pada 100+ dataset.

    7.374+48Perubahan bintang dalam 7 hari terakhir
  • helicone@Helicone

    🧊 Platform observabilitas LLM sumber terbuka. Satu baris kode untuk memantau, mengevaluasi, dan bereksperimen. YC W23 🍓

    6.116+23Perubahan bintang dalam 7 hari terakhir
  • coze-loop@coze-dev

    Platform Optimasi AI Agent Generasi Berikutnya: Cozeloop mengatasi tantangan dalam pengembangan AI agent dengan menyediakan kemampuan manajemen siklus hidup penuh mulai dari pengembangan, debugging, evaluasi, hingga pemantauan.

    5.706+7Perubahan bintang dalam 7 hari terakhir
  • AutoRAG@Marker-Inc-Korea

    AutoRAG: Sekarang agen Anda dapat menemukan apa pun di komputer Anda. Menjadi lebih cerdas jika Anda sering menggunakannya.

    5.057+7Perubahan bintang dalam 7 hari terakhir
  • Kiln@Kiln-AI

    Membangun, Mengevaluasi, dan Mengoptimalkan Sistem AI. Mencakup evaluasi, RAG, agen, fine-tuning, pembuatan data sintetis, manajemen dataset, MCP, dan lainnya.

    5.037+7Perubahan bintang dalam 7 hari terakhir
  • lmms-eval@EvolvingLMMs-Lab

    Toolkit evaluasi multimodal serbaguna untuk tugas teks, gambar, video, dan audio.

    4.383+11Perubahan bintang dalam 7 hari terakhir
  • VLMEvalKit@open-compass

    Toolkit evaluasi open-source untuk large multi-modality models (LMMs), mendukung 220+ LMM, 80+ benchmark

    4.362+10Perubahan bintang dalam 7 hari terakhir
  • evo@MichaelGrupp

    Paket Python untuk evaluasi odometri dan SLAM

    4.310+7Perubahan bintang dalam 7 hari terakhir
  • langwatch@langwatch

    Platform untuk evaluasi LLM dan pengujian agen AI

    3.517+13Perubahan bintang dalam 7 hari terakhir
  • mteb@embeddings-benchmark

    MTEB: Evaluasi mutakhir untuk embedding lintas bahasa dan modalitas

    3.409+9Perubahan bintang dalam 7 hari terakhir
  • evalscope@modelscope

    Kerangka kerja yang efisien dan dapat disesuaikan untuk evaluasi model besar (LLM, VLM, AIGC) serta tolok ukur performa.

    3.331+47Perubahan bintang dalam 7 hari terakhir
  • SuperCLUE@CLUEbenchmark

    SuperCLUE: Benchmark Komprehensif Model Bahasa Besar Bahasa Mandarin | Benchmark untuk Model Dasar dalam Bahasa Mandarin

    3.299-1Perubahan bintang dalam 7 hari terakhir
  • lmnr@lmnr-ai

    Laminar - platform observabilitas sumber terbuka yang dibuat khusus untuk agen AI. YC S24.

    3.210+24Perubahan bintang dalam 7 hari terakhir
  • klipse@viebel

    Klipse adalah plugin JavaScript untuk menyematkan cuplikan kode interaktif di blog teknologi.

    3.134+0Perubahan bintang dalam 7 hari terakhir
  • ChainForge@ianarawjo

    Lingkungan pemrograman visual open-source untuk menguji prompt LLM secara mendalam.

    3.028+1Perubahan bintang dalam 7 hari terakhir
  • yao-meta-skill@yaojingang

    YAO = Yielding AI Outcomes. Sistem teknik, evaluasi, tata kelola, dan portabilitas yang ketat untuk keterampilan agen yang dapat digunakan kembali.

    2.557+160Perubahan bintang dalam 7 hari terakhir
  • lighteval@huggingface

    Lighteval adalah perangkat lengkap Anda untuk mengevaluasi LLM di berbagai backend

    2.530+8Perubahan bintang dalam 7 hari terakhir
  • evaluate@huggingface

    🤗 Evaluate: Pustaka untuk mengevaluasi model dan dataset pembelajaran mesin dengan mudah.

    2.480+2Perubahan bintang dalam 7 hari terakhir
  • uptrain@uptrain-ai

    UpTrain adalah platform terpadu open-source untuk mengevaluasi dan meningkatkan aplikasi Generative AI. Kami menyediakan penilaian untuk 20+ pemeriksaan yang telah dikonfigurasi sebelumnya (mencakup kasus penggunaan bahasa, kode, dan embedding), melakukan analisis akar penyebab pada kasus kegagalan, serta memberikan wawasan tentang cara mengatasinya.

    2.364+3Perubahan bintang dalam 7 hari terakhir
  • graph-rag-agent@1517005260

    Mengintegrasikan GraphRAG, LightRAG, dan Neo4j-llm-graph-builder untuk konstruksi dan pencarian knowledge graph. Menggabungkan teknologi DeepSearch untuk penalaran RAG privat serta menyediakan kerangka evaluasi khusus untuk GraphRAG.

    2.330+8Perubahan bintang dalam 7 hari terakhir
  • fable-method@Sahir619

    Alur Kerja Fable: cara kerja Claude Fable 5, diringkas menjadi keterampilan yang dapat dijalankan oleh model apa pun, dengan evaluasi yang menjaganya tetap jujur. Berpikir / bertindak / membuktikan.

    2.267+23Perubahan bintang dalam 7 hari terakhir
  • inspector@MCPJam

    Platform pengujian dan evaluasi untuk mengobrol, memeriksa, dan men-debug server MCP, aplikasi MCP, dan aplikasi ChatGPT.

    2.177+23Perubahan bintang dalam 7 hari terakhir
  • 📰 Makalah dan blog wajib baca tentang Pemodelan Konteks Panjang berbasis LLM 🔥

    2.165+2Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik