benchmark
Các kho mã nguồn mở đang theo dõi được gắn thẻ benchmark, sắp xếp theo số sao.
- #121
Bộ mã phát hiện và định vị đối tượng dựa trên điểm của UCAS-VG.
★ 694+1Thay đổi số sao trong 7 ngày qua - #122
Đánh giá tính xác thực dạng dài trong các mô hình ngôn ngữ lớn. Mã nguồn gốc cho bài báo "Long-form factuality in large language models" của chúng tôi.
★ 693+2Thay đổi số sao trong 7 ngày qua - #123
Một framework đo điểm chuẩn cho ngôn ngữ Julia
★ 683+0Thay đổi số sao trong 7 ngày qua - #124
Kho lưu trữ này chứa mã cho "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] và "MMEB-V3" [COLM 2026]
★ 682+2Thay đổi số sao trong 7 ngày qua - #125
Bộ tiêu chuẩn đánh giá mã nguồn mở cho các tác nhân AI trên trình duyệt thực hiện các tác vụ hàng ngày.
★ 675+61Thay đổi số sao trong 7 ngày qua - #126
CAIRI: Bộ công cụ và tiêu chuẩn đánh giá cho học biểu diễn trực quan có giám sát, bán giám sát và tự giám sát.
★ 658+0Thay đổi số sao trong 7 ngày qua - #127
Awesome-LLM-Eval: danh sách tuyển chọn các công cụ, tập dữ liệu/benchmark, bản demo, bảng xếp hạng, tài liệu và mô hình, chủ yếu dành cho việc đánh giá LLM.
★ 656-2Thay đổi số sao trong 7 ngày qua - #128
A.S.E (AICGSecEval) là bộ tiêu chuẩn đánh giá bảo mật mã nguồn do AI tạo ra ở cấp độ kho lưu trữ, được phát triển bởi đội ngũ Tencent Wukong Code Security.
★ 656+0Thay đổi số sao trong 7 ngày qua - #129
BenchMARL là một thư viện để đánh giá hiệu năng Học tăng cường đa tác nhân (MARL). BenchMARL cho phép so sánh nhanh các thuật toán, tác vụ và mô hình MARL khác nhau dựa trên hai nguyên tắc cốt lõi: khả năng tái lập và tiêu chuẩn hóa.
★ 656+2Thay đổi số sao trong 7 ngày qua - #130
Kho lưu trữ các tập dữ liệu hữu ích được thu thập cho nghiên cứu khoa học mạng và học máy.
★ 655+0Thay đổi số sao trong 7 ngày qua - #131
Điểm chuẩn xử lý ngôn ngữ tự nhiên quy mô lớn đầu tiên cho tiếng Indonesia. Chúng tôi cung cấp nhiều tác vụ hạ nguồn, các mô hình IndoBERT đã được huấn luyện trước và mã nguồn khởi đầu! (AACL-IJCNLP 2020)
★ 655+1Thay đổi số sao trong 7 ngày qua - #132
Bộ công cụ đo lường hiệu năng đa nền tảng cho Kotlin
★ 644+0Thay đổi số sao trong 7 ngày qua - #133★ 632+2Thay đổi số sao trong 7 ngày qua
- #134
AgentLab: Một framework mã nguồn mở để phát triển, kiểm thử và đánh giá các web agent trên nhiều tác vụ khác nhau, được thiết kế để có khả năng mở rộng và tái lập.
★ 630+2Thay đổi số sao trong 7 ngày qua - #135
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 623—Thay đổi số sao trong 7 ngày qua - #136
Các matcher kiểm thử hiệu năng cho RSpec
★ 618+0Thay đổi số sao trong 7 ngày qua - #137
Điểm chuẩn Federated Learning - Federated Learning trên các kho dữ liệu Non-IID: Một nghiên cứu thực nghiệm (ICDE 2022)
★ 618+0Thay đổi số sao trong 7 ngày qua - #138
Một Benchmark phân loại văn bản trong PyTorch
★ 608+0Thay đổi số sao trong 7 ngày qua - #139★ 604+0Thay đổi số sao trong 7 ngày qua
- #140
Mạng lưới các node toàn cầu để thực hiện các kiểm tra mạng như ping, traceroute và phân giải DNS
★ 599+3Thay đổi số sao trong 7 ngày qua - #141
Theo dõi đối tượng trực quan
★ 596+1Thay đổi số sao trong 7 ngày qua - #142★ 588+2Thay đổi số sao trong 7 ngày qua
- #143★ 580+1Thay đổi số sao trong 7 ngày qua
- #144
ParseBench - Một tiêu chuẩn đánh giá phân tích tài liệu cho các AI Agent
★ 565+12Thay đổi số sao trong 7 ngày qua - #145
Thư viện tuần tự hóa viết bằng C++17 - Đóng gói các cấu trúc C++ thành mảng byte nhỏ gọn mà không cần macro hay mã soạn sẵn
★ 560+0Thay đổi số sao trong 7 ngày qua - #146
So sánh hiệu năng cơ bản của một số ngôn ngữ lập trình (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby).
★ 557+1Thay đổi số sao trong 7 ngày qua - #147
SpeechIO Leaderboard: nền tảng đánh giá hiệu năng toàn diện, mạnh mẽ và quy mô lớn cho Nhận dạng giọng nói tự động (ASR).
★ 553+3Thay đổi số sao trong 7 ngày qua - #148
Meta Agents Research Environments là một nền tảng toàn diện được thiết kế để đánh giá các tác nhân AI trong các tình huống thực tế và năng động. Không giống như các tiêu chuẩn tĩnh, nền tảng này giới thiệu các môi trường phát triển nơi các tác nhân phải điều chỉnh chiến lược khi có thông tin mới, phản ánh các thách thức trong thế giới thực.
★ 551+3Thay đổi số sao trong 7 ngày qua - #149
Tập dữ liệu và điểm chuẩn cho RAG trên các tài liệu nội bộ của công ty.
★ 546+11Thay đổi số sao trong 7 ngày qua - #150★ 540+0Thay đổi số sao trong 7 ngày qua