evaluation
Repositori open source terpantau bertanda evaluation, diurutkan berdasarkan bintang.
- #61★ 768+0Perubahan bintang dalam 7 hari terakhir
- #62
[EMNLP 2024 & AAAI 2026] Toolkit canggih untuk mengompresi model besar termasuk LLM, VLM, dan model generatif video.
★ 747+4Perubahan bintang dalam 7 hari terakhir - #63
🦞 Plugin resmi untuk OpenClaw yang mengekspor jejak agen ke Opik. Lihat dan pantau perilaku agen, biaya, token, kesalahan, dan lainnya.
★ 725+0Perubahan bintang dalam 7 hari terakhir - #64
Implementasi Python dari IOU Tracker
★ 702+0Perubahan bintang dalam 7 hari terakhir - #65★ 697+4Perubahan bintang dalam 7 hari terakhir
- #66
Tolok ukur faktualitas bentuk panjang dalam model bahasa besar. Kode asli untuk makalah kami "Long-form factuality in large language models".
★ 693+2Perubahan bintang dalam 7 hari terakhir - #67★ 664+54Perubahan bintang dalam 7 hari terakhir
- #68
Awesome-LLM-Eval: Daftar kurasi alat, dataset/benchmark, demo, papan peringkat, makalah, dokumen, dan model, terutama untuk evaluasi LLM.
★ 656-2Perubahan bintang dalam 7 hari terakhir - #69
AutoPrompt: Pembuatan Prompt Otomatis untuk Masked Language Models.
★ 641+0Perubahan bintang dalam 7 hari terakhir - #70★ 632+2Perubahan bintang dalam 7 hari terakhir
- #71
Evaluator Ekspresi Matematika dan Pseudo C# Sederhana dalam Satu File C#. Juga dapat mengeksekusi skrip kecil mirip C#
★ 630+0Perubahan bintang dalam 7 hari terakhir - #72
Repositori sumber daya untuk machine unlearning pada model bahasa besar (large language models)
★ 623+0Perubahan bintang dalam 7 hari terakhir - #73
TCExam adalah sistem CBA (Penilaian Berbasis Komputer) (ujian elektronik, CBT - Pengujian Berbasis Komputer) untuk universitas, sekolah, dan perusahaan, yang memungkinkan pendidik dan pelatih untuk membuat, menjadwalkan, menyampaikan, dan melaporkan survei, kuis, tes, dan ujian.
★ 619+0Perubahan bintang dalam 7 hari terakhir - #74
Evaluator Ekspresi yang Sederhana, Aman, Tersekat (Sandboxed), dan Dapat Diperluas untuk Python
★ 611+0Perubahan bintang dalam 7 hari terakhir - #75
Ini adalah repositori kotak alat untuk membantu mengevaluasi berbagai metode yang melakukan pencocokan gambar dari sepasang gambar.
★ 594+0Perubahan bintang dalam 7 hari terakhir - #76
Repositori ini berisi kode evaluasi untuk makalah "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 593+1Perubahan bintang dalam 7 hari terakhir - #77
Kumpulan dataset yang memetakan pertanyaan ke kueri SQL.
★ 588+1Perubahan bintang dalam 7 hari terakhir - #78
ParseBench - Tolok Ukur Penguraian Dokumen untuk AI Agent
★ 565+10Perubahan bintang dalam 7 hari terakhir - #79
Meta Agents Research Environments adalah platform komprehensif yang dirancang untuk mengevaluasi agen AI dalam skenario yang dinamis dan realistis. Tidak seperti tolok ukur statis, platform ini memperkenalkan lingkungan yang terus berkembang di mana agen harus menyesuaikan strategi mereka saat informasi baru tersedia, mencerminkan tantangan di dunia nyata.
★ 550+3Perubahan bintang dalam 7 hari terakhir - #80
Dataset dan tolok ukur untuk RAG pada dokumen internal perusahaan.
★ 545+8Perubahan bintang dalam 7 hari terakhir