Lompat ke konten utama
buildradar
Sign in
Topik · benchmark

benchmark

Repositori open source terpantau bertanda benchmark, diurutkan berdasarkan bintang.

158 repositori
  • PointTinyBenchmark@ucas-vg

    Kumpulan kode deteksi dan lokalisasi objek berbasis titik dan berukuran kecil dari UCAS-VG

    694+1Perubahan bintang dalam 7 hari terakhir
  • long-form-factuality@google-deepmind

    Tolok ukur faktualitas bentuk panjang dalam model bahasa besar. Kode asli untuk makalah kami "Long-form factuality in large language models".

    693+2Perubahan bintang dalam 7 hari terakhir
  • Kerangka kerja benchmarking untuk bahasa Julia.

    683+0Perubahan bintang dalam 7 hari terakhir
  • VLM2Vec@TIGER-AI-Lab

    Repositori ini berisi kode untuk "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], dan "MMEB-V3" [COLM 2026]

    682+2Perubahan bintang dalam 7 hari terakhir
  • ClawBench@TIGER-AI-Lab

    Benchmark open-source untuk AI agent browser pada tugas sehari-hari.

    664+54Perubahan bintang dalam 7 hari terakhir
  • openmixup@Westlake-AI

    Toolbox dan tolok ukur pembelajaran representasi visual CAIRI yang diawasi, semi-diawasi, dan mandiri

    658+0Perubahan bintang dalam 7 hari terakhir
  • Awesome-LLM-Eval: Daftar kurasi alat, dataset/benchmark, demo, papan peringkat, makalah, dokumen, dan model, terutama untuk evaluasi LLM.

    656-2Perubahan bintang dalam 7 hari terakhir
  • BenchMARL@facebookresearch

    BenchMARL adalah pustaka untuk pengujian <i>benchmark</i> Multi-Agent Reinforcement Learning (MARL). BenchMARL memungkinkan perbandingan cepat antara berbagai algoritma, tugas, dan model MARL dengan tetap berlandaskan pada dua prinsip inti: reproduksibilitas dan standarisasi.

    656+2Perubahan bintang dalam 7 hari terakhir
  • indonlu@IndoNLP

    Benchmark pemrosesan bahasa alami berskala besar pertama untuk Bahasa Indonesia. Kami menyediakan berbagai tugas hilir, model IndoBERT pra-latih, dan kode awal! (AACL-IJCNLP 2020)

    655+1Perubahan bintang dalam 7 hari terakhir
  • datasets@benedekrozemberczki

    Repositori dataset menarik yang saya kumpulkan untuk penelitian ilmu jaringan dan machine learning.

    655+0Perubahan bintang dalam 7 hari terakhir
  • AICGSecEval@Tencent

    A.S.E (AICGSecEval) adalah tolok ukur evaluasi keamanan kode yang dihasilkan AI tingkat repositori yang dikembangkan oleh Tim Keamanan Kode Tencent Wukong.

    655+0Perubahan bintang dalam 7 hari terakhir
  • Toolkit benchmarking multiplatform Kotlin

    644+0Perubahan bintang dalam 7 hari terakhir
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: Kepercayaan dalam Model Bahasa Besar (LLM)

    632+2Perubahan bintang dalam 7 hari terakhir
  • AgentLab@ServiceNow

    AgentLab: Kerangka kerja open-source untuk mengembangkan, menguji, dan membandingkan web agent pada berbagai tugas, dirancang untuk skalabilitas dan reproduksibilitas.

    629+1Perubahan bintang dalam 7 hari terakhir
  • NIID-Bench@Xtra-Computing

    Tolok ukur Federated Learning - Federated Learning pada Silo Data Non-IID: Studi Eksperimental (ICDE 2022)

    618+0Perubahan bintang dalam 7 hari terakhir
  • rspec-benchmark@piotrmurach

    Matcher pengujian performa untuk RSpec

    618+0Perubahan bintang dalam 7 hari terakhir
  • TextClassificationBenchmark@FreedomIntelligence

    Benchmark Klasifikasi Teks di PyTorch

    608+0Perubahan bintang dalam 7 hari terakhir
  • KLUE@KLUE-benchmark

    📖 Tolok ukur NLU bahasa Korea

    604+0Perubahan bintang dalam 7 hari terakhir
  • globalping@jsdelivr

    Jaringan global probe untuk menjalankan pengujian jaringan seperti ping, traceroute, dan resolusi DNS

    597+3Perubahan bintang dalam 7 hari terakhir
  • Pelacakan Objek Visual

    596+1Perubahan bintang dalam 7 hari terakhir
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594Perubahan bintang dalam 7 hari terakhir
  • rewrk@lnx-search

    Alat benchmark framework HTTP yang lebih modern dengan dukungan untuk HTTP/1 dan HTTP/2.

    588+2Perubahan bintang dalam 7 hari terakhir
  • CL-bench@Tencent-Hunyuan

    CL-bench: Benchmark untuk Context Learning

    580+1Perubahan bintang dalam 7 hari terakhir
  • ParseBench@run-llama

    ParseBench - Tolok Ukur Penguraian Dokumen untuk AI Agent

    565+10Perubahan bintang dalam 7 hari terakhir
  • alpaca@p-ranav

    Pustaka serialisasi yang ditulis dalam C++17 - Mengemas struktur C++ ke dalam susunan byte ringkas tanpa makro atau kode boilerplate

    560+0Perubahan bintang dalam 7 hari terakhir
  • Perbandingan performa sederhana dari beberapa bahasa pemrograman (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)

    557+1Perubahan bintang dalam 7 hari terakhir
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: platform benchmarking yang besar, kuat, komprehensif untuk Automatic Speech Recognition.

    553+3Perubahan bintang dalam 7 hari terakhir
  • Meta Agents Research Environments adalah platform komprehensif yang dirancang untuk mengevaluasi agen AI dalam skenario yang dinamis dan realistis. Tidak seperti tolok ukur statis, platform ini memperkenalkan lingkungan yang terus berkembang di mana agen harus menyesuaikan strategi mereka saat informasi baru tersedia, mencerminkan tantangan di dunia nyata.

    550+3Perubahan bintang dalam 7 hari terakhir
  • Dataset dan tolok ukur untuk RAG pada dokumen internal perusahaan.

    545+8Perubahan bintang dalam 7 hari terakhir
  • NBench@petabridge

    Kerangka kerja pengujian dan benchmarking performa untuk aplikasi .NET :chart_with_upwards_trend:

    540+0Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik