Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · benchmark

benchmark

Các kho mã nguồn mở đang theo dõi được gắn thẻ benchmark, sắp xếp theo số sao.

158 kho mã
  • PointTinyBenchmark@ucas-vg

    Bộ mã phát hiện và định vị đối tượng dựa trên điểm của UCAS-VG.

    694+1Thay đổi số sao trong 7 ngày qua
  • long-form-factuality@google-deepmind

    Đánh giá tính xác thực dạng dài trong các mô hình ngôn ngữ lớn. Mã nguồn gốc cho bài báo "Long-form factuality in large language models" của chúng tôi.

    693+2Thay đổi số sao trong 7 ngày qua
  • Một framework đo điểm chuẩn cho ngôn ngữ Julia

    683+0Thay đổi số sao trong 7 ngày qua
  • VLM2Vec@TIGER-AI-Lab

    Kho lưu trữ này chứa mã cho "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] và "MMEB-V3" [COLM 2026]

    682+2Thay đổi số sao trong 7 ngày qua
  • ClawBench@TIGER-AI-Lab

    Bộ tiêu chuẩn đánh giá mã nguồn mở cho các tác nhân AI trên trình duyệt thực hiện các tác vụ hàng ngày.

    675+61Thay đổi số sao trong 7 ngày qua
  • openmixup@Westlake-AI

    CAIRI: Bộ công cụ và tiêu chuẩn đánh giá cho học biểu diễn trực quan có giám sát, bán giám sát và tự giám sát.

    658+0Thay đổi số sao trong 7 ngày qua
  • Awesome-LLM-Eval: danh sách tuyển chọn các công cụ, tập dữ liệu/benchmark, bản demo, bảng xếp hạng, tài liệu và mô hình, chủ yếu dành cho việc đánh giá LLM.

    656-2Thay đổi số sao trong 7 ngày qua
  • AICGSecEval@Tencent

    A.S.E (AICGSecEval) là bộ tiêu chuẩn đánh giá bảo mật mã nguồn do AI tạo ra ở cấp độ kho lưu trữ, được phát triển bởi đội ngũ Tencent Wukong Code Security.

    656+0Thay đổi số sao trong 7 ngày qua
  • BenchMARL@facebookresearch

    BenchMARL là một thư viện để đánh giá hiệu năng Học tăng cường đa tác nhân (MARL). BenchMARL cho phép so sánh nhanh các thuật toán, tác vụ và mô hình MARL khác nhau dựa trên hai nguyên tắc cốt lõi: khả năng tái lập và tiêu chuẩn hóa.

    656+2Thay đổi số sao trong 7 ngày qua
  • datasets@benedekrozemberczki

    Kho lưu trữ các tập dữ liệu hữu ích được thu thập cho nghiên cứu khoa học mạng và học máy.

    655+0Thay đổi số sao trong 7 ngày qua
  • indonlu@IndoNLP

    Điểm chuẩn xử lý ngôn ngữ tự nhiên quy mô lớn đầu tiên cho tiếng Indonesia. Chúng tôi cung cấp nhiều tác vụ hạ nguồn, các mô hình IndoBERT đã được huấn luyện trước và mã nguồn khởi đầu! (AACL-IJCNLP 2020)

    655+1Thay đổi số sao trong 7 ngày qua
  • Bộ công cụ đo lường hiệu năng đa nền tảng cho Kotlin

    644+0Thay đổi số sao trong 7 ngày qua
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: Độ tin cậy trong các mô hình ngôn ngữ lớn

    632+2Thay đổi số sao trong 7 ngày qua
  • AgentLab@ServiceNow

    AgentLab: Một framework mã nguồn mở để phát triển, kiểm thử và đánh giá các web agent trên nhiều tác vụ khác nhau, được thiết kế để có khả năng mở rộng và tái lập.

    630+2Thay đổi số sao trong 7 ngày qua
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    623Thay đổi số sao trong 7 ngày qua
  • rspec-benchmark@piotrmurach

    Các matcher kiểm thử hiệu năng cho RSpec

    618+0Thay đổi số sao trong 7 ngày qua
  • NIID-Bench@Xtra-Computing

    Điểm chuẩn Federated Learning - Federated Learning trên các kho dữ liệu Non-IID: Một nghiên cứu thực nghiệm (ICDE 2022)

    618+0Thay đổi số sao trong 7 ngày qua
  • TextClassificationBenchmark@FreedomIntelligence

    Một Benchmark phân loại văn bản trong PyTorch

    608+0Thay đổi số sao trong 7 ngày qua
  • KLUE@KLUE-benchmark

    📖 Điểm chuẩn NLU tiếng Hàn.

    604+0Thay đổi số sao trong 7 ngày qua
  • globalping@jsdelivr

    Mạng lưới các node toàn cầu để thực hiện các kiểm tra mạng như ping, traceroute và phân giải DNS

    599+3Thay đổi số sao trong 7 ngày qua
  • Theo dõi đối tượng trực quan

    596+1Thay đổi số sao trong 7 ngày qua
  • rewrk@lnx-search

    Công cụ đo điểm chuẩn framework HTTP hiện đại hỗ trợ HTTP/1 và HTTP/2.

    588+2Thay đổi số sao trong 7 ngày qua
  • CL-bench@Tencent-Hunyuan

    CL-bench: Một tiêu chuẩn đánh giá cho học theo ngữ cảnh (Context Learning)

    580+1Thay đổi số sao trong 7 ngày qua
  • ParseBench@run-llama

    ParseBench - Một tiêu chuẩn đánh giá phân tích tài liệu cho các AI Agent

    565+12Thay đổi số sao trong 7 ngày qua
  • alpaca@p-ranav

    Thư viện tuần tự hóa viết bằng C++17 - Đóng gói các cấu trúc C++ thành mảng byte nhỏ gọn mà không cần macro hay mã soạn sẵn

    560+0Thay đổi số sao trong 7 ngày qua
  • So sánh hiệu năng cơ bản của một số ngôn ngữ lập trình (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby).

    557+1Thay đổi số sao trong 7 ngày qua
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard: nền tảng đánh giá hiệu năng toàn diện, mạnh mẽ và quy mô lớn cho Nhận dạng giọng nói tự động (ASR).

    553+3Thay đổi số sao trong 7 ngày qua
  • Meta Agents Research Environments là một nền tảng toàn diện được thiết kế để đánh giá các tác nhân AI trong các tình huống thực tế và năng động. Không giống như các tiêu chuẩn tĩnh, nền tảng này giới thiệu các môi trường phát triển nơi các tác nhân phải điều chỉnh chiến lược khi có thông tin mới, phản ánh các thách thức trong thế giới thực.

    551+3Thay đổi số sao trong 7 ngày qua
  • Tập dữ liệu và điểm chuẩn cho RAG trên các tài liệu nội bộ của công ty.

    546+11Thay đổi số sao trong 7 ngày qua
  • NBench@petabridge

    Khung đo lường hiệu năng và kiểm thử cho các ứng dụng .NET.

    540+0Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề