benchmark
Repositori open source terpantau bertanda benchmark, diurutkan berdasarkan bintang.
- #121
Kumpulan kode deteksi dan lokalisasi objek berbasis titik dan berukuran kecil dari UCAS-VG
★ 694+1Perubahan bintang dalam 7 hari terakhir - #122
Tolok ukur faktualitas bentuk panjang dalam model bahasa besar. Kode asli untuk makalah kami "Long-form factuality in large language models".
★ 693+2Perubahan bintang dalam 7 hari terakhir - #123
Kerangka kerja benchmarking untuk bahasa Julia.
★ 683+0Perubahan bintang dalam 7 hari terakhir - #124
Repositori ini berisi kode untuk "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], dan "MMEB-V3" [COLM 2026]
★ 682+2Perubahan bintang dalam 7 hari terakhir - #125★ 664+54Perubahan bintang dalam 7 hari terakhir
- #126
Toolbox dan tolok ukur pembelajaran representasi visual CAIRI yang diawasi, semi-diawasi, dan mandiri
★ 658+0Perubahan bintang dalam 7 hari terakhir - #127
Awesome-LLM-Eval: Daftar kurasi alat, dataset/benchmark, demo, papan peringkat, makalah, dokumen, dan model, terutama untuk evaluasi LLM.
★ 656-2Perubahan bintang dalam 7 hari terakhir - #128
BenchMARL adalah pustaka untuk pengujian <i>benchmark</i> Multi-Agent Reinforcement Learning (MARL). BenchMARL memungkinkan perbandingan cepat antara berbagai algoritma, tugas, dan model MARL dengan tetap berlandaskan pada dua prinsip inti: reproduksibilitas dan standarisasi.
★ 656+2Perubahan bintang dalam 7 hari terakhir - #129
Benchmark pemrosesan bahasa alami berskala besar pertama untuk Bahasa Indonesia. Kami menyediakan berbagai tugas hilir, model IndoBERT pra-latih, dan kode awal! (AACL-IJCNLP 2020)
★ 655+1Perubahan bintang dalam 7 hari terakhir - #130
Repositori dataset menarik yang saya kumpulkan untuk penelitian ilmu jaringan dan machine learning.
★ 655+0Perubahan bintang dalam 7 hari terakhir - #131
A.S.E (AICGSecEval) adalah tolok ukur evaluasi keamanan kode yang dihasilkan AI tingkat repositori yang dikembangkan oleh Tim Keamanan Kode Tencent Wukong.
★ 655+0Perubahan bintang dalam 7 hari terakhir - #132
Toolkit benchmarking multiplatform Kotlin
★ 644+0Perubahan bintang dalam 7 hari terakhir - #133★ 632+2Perubahan bintang dalam 7 hari terakhir
- #134
AgentLab: Kerangka kerja open-source untuk mengembangkan, menguji, dan membandingkan web agent pada berbagai tugas, dirancang untuk skalabilitas dan reproduksibilitas.
★ 629+1Perubahan bintang dalam 7 hari terakhir - #135
Tolok ukur Federated Learning - Federated Learning pada Silo Data Non-IID: Studi Eksperimental (ICDE 2022)
★ 618+0Perubahan bintang dalam 7 hari terakhir - #136
Matcher pengujian performa untuk RSpec
★ 618+0Perubahan bintang dalam 7 hari terakhir - #137
Benchmark Klasifikasi Teks di PyTorch
★ 608+0Perubahan bintang dalam 7 hari terakhir - #138★ 604+0Perubahan bintang dalam 7 hari terakhir
- #139
Jaringan global probe untuk menjalankan pengujian jaringan seperti ping, traceroute, dan resolusi DNS
★ 597+3Perubahan bintang dalam 7 hari terakhir - #140
Pelacakan Objek Visual
★ 596+1Perubahan bintang dalam 7 hari terakhir - #141
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 594—Perubahan bintang dalam 7 hari terakhir - #142
Alat benchmark framework HTTP yang lebih modern dengan dukungan untuk HTTP/1 dan HTTP/2.
★ 588+2Perubahan bintang dalam 7 hari terakhir - #143★ 580+1Perubahan bintang dalam 7 hari terakhir
- #144
ParseBench - Tolok Ukur Penguraian Dokumen untuk AI Agent
★ 565+10Perubahan bintang dalam 7 hari terakhir - #145
Pustaka serialisasi yang ditulis dalam C++17 - Mengemas struktur C++ ke dalam susunan byte ringkas tanpa makro atau kode boilerplate
★ 560+0Perubahan bintang dalam 7 hari terakhir - #146
Perbandingan performa sederhana dari beberapa bahasa pemrograman (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)
★ 557+1Perubahan bintang dalam 7 hari terakhir - #147
SpeechIO Leaderboard: platform benchmarking yang besar, kuat, komprehensif untuk Automatic Speech Recognition.
★ 553+3Perubahan bintang dalam 7 hari terakhir - #148
Meta Agents Research Environments adalah platform komprehensif yang dirancang untuk mengevaluasi agen AI dalam skenario yang dinamis dan realistis. Tidak seperti tolok ukur statis, platform ini memperkenalkan lingkungan yang terus berkembang di mana agen harus menyesuaikan strategi mereka saat informasi baru tersedia, mencerminkan tantangan di dunia nyata.
★ 550+3Perubahan bintang dalam 7 hari terakhir - #149
Dataset dan tolok ukur untuk RAG pada dokumen internal perusahaan.
★ 545+8Perubahan bintang dalam 7 hari terakhir - #150
Kerangka kerja pengujian dan benchmarking performa untuk aplikasi .NET :chart_with_upwards_trend:
★ 540+0Perubahan bintang dalam 7 hari terakhir