Lompat ke konten utama
buildradar
Sign in
Topik · evaluation

evaluation

Repositori open source terpantau bertanda evaluation, diurutkan berdasarkan bintang.

80 repositori
  • evaluation-guidebook@huggingface

    Berbagi wawasan praktis dan pengetahuan teoretis tentang evaluasi LLM yang kami kumpulkan saat mengelola Open LLM Leaderboard dan merancang lighteval!

    2.143+2Perubahan bintang dalam 7 hari terakhir
  • avalanche@ContinualAI

    Avalanche: Pustaka End-to-End untuk Pembelajaran Berkelanjutan berbasis PyTorch.

    2.088+0Perubahan bintang dalam 7 hari terakhir
  • EvalAI@Cloud-CV

    Mengevaluasi teknologi AI terkini (state of the art).

    2.037-2Perubahan bintang dalam 7 hari terakhir
  • alpaca_eval@tatsu-lab

    Evaluator otomatis untuk model bahasa yang mengikuti instruksi. Tervalidasi oleh manusia, berkualitas tinggi, murah, dan cepat.

    2.012-1Perubahan bintang dalam 7 hari terakhir
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020) Implementasi Python resmi untuk "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics".

    1.846+0Perubahan bintang dalam 7 hari terakhir
  • WFGY@onestardao

    WFGY menuju ke WFGY 5.0 Polaris Protocol, rilis open-source utama untuk penalaran AI, RAG, agen, dan alur kerja dunia nyata. Termasuk Problem Map, Global Debug Card, WFGY 4.0, dan CFV Easter Egg.

    1.786+1Perubahan bintang dalam 7 hari terakhir
  • EmoLLM@SmartFlowAI

    Model Bahasa Besar (LLM) Kesehatan Mental, Pelatihan Pra & Pasca & Dataset & Evaluasi & Penerapan & RAG, dengan model seri InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM

    1.781+1Perubahan bintang dalam 7 hari terakhir
  • trpc-agent-go@trpc-group

    Framework Go untuk membangun sistem agen produksi dengan alur kerja berbasis grafik, alat, memori, A2A, AG-UI, MCP, evaluasi, dan observabilitas.

    1.760+12Perubahan bintang dalam 7 hari terakhir
  • ragbits@deepsense-ai

    Blok bangunan untuk pengembangan cepat aplikasi GenAI

    1.668+0Perubahan bintang dalam 7 hari terakhir
  • Halaman resmi GitHub untuk makalah survei "A Survey on Evaluation of Large Language Models".

    1.608-1Perubahan bintang dalam 7 hari terakhir
  • pycm@sepandhaghighi

    Pustaka confusion matrix multi-kelas di Python

    1.506+0Perubahan bintang dalam 7 hari terakhir
  • nlg-eval@Maluuba

    Kode evaluasi untuk berbagai metrik otomatis tak terbimbing untuk Natural Language Generation.

    1.391+0Perubahan bintang dalam 7 hari terakhir
  • lispy@abo-abo

    Penyuntingan LISP yang singkat dan padat

    1.300+0Perubahan bintang dalam 7 hari terakhir
  • xai@EthicalML

    XAI - Kotak alat explainability untuk machine learning

    1.260+0Perubahan bintang dalam 7 hari terakhir
  • intellagent@plurai-ai

    Kerangka kerja untuk diagnosis komprehensif dan optimasi agen menggunakan interaksi sintetis yang disimulasikan dan realistis

    1.257+0Perubahan bintang dalam 7 hari terakhir
  • KernelBench@ScalingIntelligence

    KernelBench: Apakah LLM Dapat Menulis Kernel GPU? - Tolok Ukur + Toolkit dengan Torch -> CUDA (+ lebih banyak DSL)

    1.227+7Perubahan bintang dalam 7 hari terakhir
  • kubetorch@run-house

    Distribusikan dan jalankan beban kerja AI di Kubernetes secara ajaib dengan Python, seperti PyTorch untuk infrastruktur ML.

    1.224+0Perubahan bintang dalam 7 hari terakhir
  • fuzzbench@google

    FuzzBench - Pembandingan fuzzer sebagai layanan.

    1.206+0Perubahan bintang dalam 7 hari terakhir
  • torch-fidelity@toshas

    Metrik performa fidelitas tinggi untuk model generatif di PyTorch

    1.200+1Perubahan bintang dalam 7 hari terakhir
  • Tracely-ai@Jwuthri

    CI/CD berbasis trace untuk agen AI — kegagalan produksi menjadi tes regresi yang memblokir PR. Deteksi otomatis, klasterisasi, pembekuan menjadi kasus hermetik, dan pemutaran ulang di CI dengan biaya $0.

    1.176-22Perubahan bintang dalam 7 hari terakhir
  • ncalc@ncalc

    NCalc adalah pustaka evaluator ekspresi yang cepat dan ringan untuk .NET, dirancang untuk fleksibilitas dan performa tinggi. Mendukung berbagai operasi matematika dan logika.

    1.156+2Perubahan bintang dalam 7 hari terakhir
  • Gym@NVIDIA-NeMo

    Evaluasi dan tingkatkan model serta agen menggunakan lingkungan

    1.155+7Perubahan bintang dalam 7 hari terakhir
  • prometheus-eval@prometheus-eval

    Evaluasi respons LLM Anda dengan Prometheus dan GPT4 💯

    1.111+4Perubahan bintang dalam 7 hari terakhir
  • langsmith-sdk@langchain-ai

    Implementasi SDK Klien LangSmith

    1.049+8Perubahan bintang dalam 7 hari terakhir
  • API SemanticKITTI untuk visualisasi dataset, pemrosesan data, dan evaluasi hasil.

    898+3Perubahan bintang dalam 7 hari terakhir
  • deepfabric@nolabs-ai

    Hasilkan Data Sintetis Berkualitas Tinggi, Latih, Ukur, dan Evaluasi dalam Satu Pipeline

    885+3Perubahan bintang dalam 7 hari terakhir
  • ClawProBench@suyoumo

    ClawProBench adalah harness benchmark live-first untuk mengevaluasi agen LLM di runtime OpenClaw dengan penilaian deterministik dan keandalan uji coba berulang.

    823+0Perubahan bintang dalam 7 hari terakhir
  • OpenJudge@agentscope-ai

    OpenJudge: Kerangka Kerja Terpadu untuk Evaluasi Holistik dan Quality Rewards

    819+12Perubahan bintang dalam 7 hari terakhir
  • gval@PaesslerAG

    Evaluasi ekspresi dalam golang

    814+1Perubahan bintang dalam 7 hari terakhir
  • web-codegen-scorer@angular

    Web Codegen Scorer adalah alat untuk mengevaluasi kualitas kode web yang dihasilkan oleh LLM.

    775+4Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik