benchmark
Các kho mã nguồn mở đang theo dõi được gắn thẻ benchmark, sắp xếp theo số sao.
- #61
Đánh giá LLM bằng cách cho chúng đấu trong Street Fighter 3! Phương pháp mới để đánh giá chất lượng của LLM.
★ 1.483+0Thay đổi số sao trong 7 ngày qua - #62
pytest fixture để đo hiệu năng mã nguồn
★ 1.448+0Thay đổi số sao trong 7 ngày qua - #63★ 1.444+1Thay đổi số sao trong 7 ngày qua
- #64
[pip install medmnist] 18 Tập dữ liệu chuẩn hóa cho phân loại hình ảnh y生物 học 2D và 3D
★ 1.399+0Thay đổi số sao trong 7 ngày qua - #65
Trình biên dịch nhanh cho C# Expression Trees và giải pháp thay thế nhẹ LightExpression. Công cụ chẩn đoán và tạo mã cho các biểu thức.
★ 1.375+1Thay đổi số sao trong 7 ngày qua - #66★ 1.367+1Thay đổi số sao trong 7 ngày qua
- #67
Framework Deep Reinforcement Learning mô-đun trong PyTorch. Thư viện đi kèm của cuốn sách "Foundations of Deep Reinforcement Learning".
★ 1.362+0Thay đổi số sao trong 7 ngày qua - #68
Những Tiến Bộ Mới Nhất về Suy Luận Hệ Thống-2
★ 1.353+0Thay đổi số sao trong 7 ngày qua - #69★ 1.266+6Thay đổi số sao trong 7 ngày qua
- #70
GitHub Action để benchmark liên tục nhằm duy trì hiệu năng
★ 1.251+0Thay đổi số sao trong 7 ngày qua - #71★ 1.237+0Thay đổi số sao trong 7 ngày qua
- #72★ 1.232+1Thay đổi số sao trong 7 ngày qua
- #73
KernelBench: LLM có thể viết GPU Kernel không? - Bộ công cụ và benchmark với Torch -> CUDA (+ nhiều DSL khác)
★ 1.227+7Thay đổi số sao trong 7 ngày qua - #74★ 1.192+0Thay đổi số sao trong 7 ngày qua
- #75
Bộ sưu tập các tập lệnh đo hiệu năng máy chủ Linux.
★ 1.190+0Thay đổi số sao trong 7 ngày qua - #76★ 1.188+0Thay đổi số sao trong 7 ngày qua
- #77
Điểm chuẩn (Benchmark) cho cơ sở dữ liệu vector
★ 1.173+2Thay đổi số sao trong 7 ngày qua - #78
JMLR: OmniSafe là một framework cơ sở hạ tầng nhằm đẩy nhanh nghiên cứu về SafeRL.
★ 1.150+1Thay đổi số sao trong 7 ngày qua - #79★ 1.143+5Thay đổi số sao trong 7 ngày qua
- #80
🚀 Trình tạo số nguyên tố nhanh
★ 1.114+1Thay đổi số sao trong 7 ngày qua - #81
ClickBench: Điểm chuẩn dành cho các cơ sở dữ liệu phân tích
★ 1.101+8Thay đổi số sao trong 7 ngày qua - #82★ 1.084+5Thay đổi số sao trong 7 ngày qua
- #83
Công cụ tạo lưu lượng truy cập và đánh giá hiệu năng cho NoSQL Redis và Memcache.
★ 1.053+5Thay đổi số sao trong 7 ngày qua - #84
Model Zoo cho OpenCV DNN và các bài kiểm tra chuẩn (Benchmarks).
★ 1.046+8Thay đổi số sao trong 7 ngày qua - #85
TorchBench là tập hợp các benchmark mã nguồn mở được sử dụng để đánh giá hiệu năng của PyTorch.
★ 1.042-1Thay đổi số sao trong 7 ngày qua - #86
Bộ công cụ đánh giá hiệu năng Python
★ 1.030+1Thay đổi số sao trong 7 ngày qua - #87
Báo cáo hiện thực hóa năng lực DeepSeek V4 × J-Space — bằng chứng chuẩn mực cho thấy J-Space làm giảm tổn thất hiện thực hóa năng lực trên DeepSeek V4.
★ 1.026-8Thay đổi số sao trong 7 ngày qua - #88★ 1.023+2Thay đổi số sao trong 7 ngày qua
- #89
Airspeed Velocity: Một công cụ đo hiệu năng Python đơn giản với báo cáo dựa trên web
★ 1.018+4Thay đổi số sao trong 7 ngày qua - #90★ 988+0Thay đổi số sao trong 7 ngày qua