benchmark
Các kho mã nguồn mở đang theo dõi được gắn thẻ benchmark, sắp xếp theo số sao.
- #91
Bộ công cụ ước tính độ sâu đơn mắt dựa trên MMSegmentation.
★ 971+0Thay đổi số sao trong 7 ngày qua - #92★ 952+0Thay đổi số sao trong 7 ngày qua
- #93
Các benchmark gRPC khác nhau
★ 939+1Thay đổi số sao trong 7 ngày qua - #94★ 933+0Thay đổi số sao trong 7 ngày qua
- #95★ 924+1Thay đổi số sao trong 7 ngày qua
- #96
Đo lường hiệu năng của Amazon S3 từ bất kỳ vị trí nào.
★ 910-1Thay đổi số sao trong 7 ngày qua - #97
Một thư viện PyTorch dành cho mọi khía cạnh của Học tăng cường (RL) trong Tối ưu hóa tổ hợp (CO).
★ 900+1Thay đổi số sao trong 7 ngày qua - #98★ 894+2Thay đổi số sao trong 7 ngày qua
- #99
Ứng dụng kiểm tra tốc độ/đánh giá hiệu năng lưu trữ (HDD, SSD, RAM) trên Windows, macOS và Android
★ 871+2Thay đổi số sao trong 7 ngày qua - #100★ 863+0Thay đổi số sao trong 7 ngày qua
- #101
Trí tuệ tự nhiên vẫn là một ý tưởng khá hay.
★ 833+0Thay đổi số sao trong 7 ngày qua - #102
[NeurIPS 2025 Spotlight] OpenCUA: Nền tảng mở cho các tác nhân sử dụng máy tính (Computer-Use Agents).
★ 833+4Thay đổi số sao trong 7 ngày qua - #103
📊 So sánh hiệu năng các gói có hỗ trợ xác thực thời gian chạy và TypeScript
★ 830+2Thay đổi số sao trong 7 ngày qua - #104
DeepResearch Bench: Bộ benchmark toàn diện cho các tác nhân nghiên cứu chuyên sâu
★ 827+9Thay đổi số sao trong 7 ngày qua - #105
ClawProBench là một bộ công cụ đánh giá trực tiếp dành cho các tác nhân LLM trong môi trường thực thi OpenClaw với khả năng chấm điểm xác định và độ tin cậy qua các lần thử nghiệm lặp lại.
★ 823+0Thay đổi số sao trong 7 ngày qua - #106★ 817+3Thay đổi số sao trong 7 ngày qua
- #107
Môi trường động để đánh giá các cuộc tấn công và phòng thủ cho các tác nhân LLM.
★ 808+29Thay đổi số sao trong 7 ngày qua - #108
Một bản triển khai khác của trò chơi đánh giá hiệu năng ngôn ngữ lập trình
★ 800-1Thay đổi số sao trong 7 ngày qua - #109
"Không tin tưởng bất cứ ai, hãy đo lường mọi thứ." - Plugin sbt cho JMH (Java Microbenchmark Harness)
★ 796+0Thay đổi số sao trong 7 ngày qua - #110
MobileGym: Nền tảng mô phỏng có thể kiểm chứng và song song hóa cao cho nghiên cứu tác nhân GUI di động · Trình mô phỏng Android chạy trên trình duyệt · Đánh giá có thể kiểm chứng · Đào tạo RL trực tuyến có khả năng mở rộng
★ 786+10Thay đổi số sao trong 7 ngày qua - #111★ 782+3Thay đổi số sao trong 7 ngày qua
- #112
RobustBench: chuẩn đánh giá độ bền đối kháng [NeurIPS 2021 Benchmarks and Datasets Track]
★ 782+0Thay đổi số sao trong 7 ngày qua - #113★ 780+0Thay đổi số sao trong 7 ngày qua
- #114
Một bộ tiêu chuẩn đánh giá tác nhân (agent) với các tác vụ trong một công ty phần mềm mô phỏng.
★ 775+4Thay đổi số sao trong 7 ngày qua - #115
Công cụ kiểm thử áp lực HTTP bằng golang, hỗ trợ đơn lẻ và phân tán, http/1, http/2 và http/3.
★ 771+0Thay đổi số sao trong 7 ngày qua - #116
[EMNLP 2024 & AAAI 2026] Bộ công cụ mạnh mẽ để nén các mô hình lớn bao gồm LLM, VLM và các mô hình tạo video
★ 747+4Thay đổi số sao trong 7 ngày qua - #117
Một bộ benchmark khác cho một số framework Python
★ 721+0Thay đổi số sao trong 7 ngày qua - #118
Điểm chuẩn thô về thông lượng, độ trễ và truyền tải của Hello World trên các framework microservices phổ biến
★ 715+0Thay đổi số sao trong 7 ngày qua - #119
Khung đo lường hiệu năng blockchain để đánh giá hiệu suất của nhiều giải pháp blockchain khác nhau https://wiki.hyperledger.org/display/caliper
★ 705+1Thay đổi số sao trong 7 ngày qua - #120
Các mô hình Frontier chơi trò chơi board game Diplomacy.
★ 699+1Thay đổi số sao trong 7 ngày qua