benchmark
Các kho mã nguồn mở đang theo dõi được gắn thẻ benchmark, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng benchmark trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ benchmark.
- #1
Báo cáo hiện thực hóa năng lực DeepSeek V4 × J-Space — bằng chứng chuẩn mực cho thấy J-Space làm giảm tổn thất hiện thực hóa năng lực trên DeepSeek V4.
★ 1.034 - #2
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #3
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1★ 28.759+60Thay đổi số sao trong 7 ngày qua
- #2
Thư viện .NET mạnh mẽ dùng để đo hiệu năng (benchmarking)
★ 11.485+6Thay đổi số sao trong 7 ngày qua - #3★ 10.517+17Thay đổi số sao trong 7 ngày qua
- #4★ 10.375+13Thay đổi số sao trong 7 ngày qua
- #5★ 7.860+20Thay đổi số sao trong 7 ngày qua
- #6
OpenCompass là một nền tảng đánh giá LLM, hỗ trợ nhiều loại mô hình (Llama3, Mistral, InternLM2, GPT-4, LLaMa2, Qwen, GLM, Claude, v.v.) trên hơn 100+ tập dataset.
★ 7.374+48Thay đổi số sao trong 7 ngày qua - #7
Dự án đánh giá máy chủ VPS Fusion Monster, khuyên dùng phiên bản Go không phụ thuộc môi trường hơn
★ 7.155+16Thay đổi số sao trong 7 ngày qua - #8
Web framework nào là nhanh nhất?
★ 7.085-1Thay đổi số sao trong 7 ngày qua - #9★ 6.782+3Thay đổi số sao trong 7 ngày qua
- #10
YABS - một tập lệnh bash đơn giản để đánh giá hiệu năng máy chủ Linux sử dụng fio, iperf3 & Geekbench
★ 6.654+20Thay đổi số sao trong 7 ngày qua - #11
SWE-bench: Mô hình ngôn ngữ có thể giải quyết các issue GitHub thực tế hay không?
★ 5.734+54Thay đổi số sao trong 7 ngày qua - #12
Benchmarks các thư viện tìm kiếm láng giềng gần nhất xấp xỉ trong Python.
★ 5.720+5Thay đổi số sao trong 7 ngày qua - #13★ 5.601+5Thay đổi số sao trong 7 ngày qua
- #14
Thư viện benchmark dựa trên thống kê dành cho Rust
★ 5.523+5Thay đổi số sao trong 7 ngày qua - #15★ 5.370+2Thay đổi số sao trong 7 ngày qua
- #16
Phần mềm CFD lattice Boltzmann nhanh nhất và tiết kiệm bộ nhớ nhất, chạy trên mọi GPU và CPU thông qua OpenCL. Miễn phí cho mục đích phi thương mại.
★ 5.254+13Thay đổi số sao trong 7 ngày qua - #17★ 5.147+5Thay đổi số sao trong 7 ngày qua
- #18
Kodezi Chronos là một mô hình ngôn ngữ chuyên gỡ lỗi, đạt kết quả tối tân trên SWE-bench Lite (80.33%) và độ chính xác sửa lỗi thực tế 67%, gấp hơn sáu lần so với GPT-4. Được xây dựng với Adaptive Graph-Guided Retrieval và Persistent Debug Memory. Mô hình sẽ ra mắt vào Quý 1 năm 2026 thông qua Kodezi OS.
★ 4.928+12Thay đổi số sao trong 7 ngày qua - #19
Bộ công cụ đánh giá đa phương thức toàn diện cho các tác vụ Văn bản, Hình ảnh, Video và Âm thanh
★ 4.383+11Thay đổi số sao trong 7 ngày qua - #20★ 4.310+7Thay đổi số sao trong 7 ngày qua
- #21
Tiêu chuẩn đánh giá hiểu ngôn ngữ tiếng Trung (Chinese Language Understanding Evaluation Benchmark): bộ dữ liệu, baseline, mô hình tiền huấn luyện, ngữ liệu và bảng xếp hạng
★ 4.279+0Thay đổi số sao trong 7 ngày qua - #22★ 4.211-1Thay đổi số sao trong 7 ngày qua
- #23
Một loạt các mô hình ngôn ngữ lớn được phát triển bởi Baichuan Intelligent Technology
★ 4.083-1Thay đổi số sao trong 7 ngày qua - #24
Công cụ benchmark HTTP(S), kiểm tra/gỡ lỗi và RESTful API
★ 3.767+3Thay đổi số sao trong 7 ngày qua - #25
XcodeBenchmark đo lường thời gian biên dịch của một cơ sở mã lớn trên iMac, MacBook và Mac Pro
★ 3.663+4Thay đổi số sao trong 7 ngày qua - #26
⚡ FlashRAG: Bộ công cụ Python dành cho nghiên cứu RAG hiệu quả (Tài nguyên WWW2025)
★ 3.562+13Thay đổi số sao trong 7 ngày qua - #27★ 3.409+9Thay đổi số sao trong 7 ngày qua
- #28
Phần mềm kiểm thử/đánh giá hiệu năng tự động mã nguồn mở, đa nền tảng Phoronix Test Suite.
★ 3.118+5Thay đổi số sao trong 7 ngày qua - #29
[NeurIPS 2024] OSWorld: Đánh giá chuẩn các tác nhân đa phương thức cho các tác vụ mở trong môi trường máy tính thực tế
★ 3.112+11Thay đổi số sao trong 7 ngày qua - #30
Các dự án số nguyên tố bằng hơn 100 ngôn ngữ lập trình, nhằm so sánh tốc độ và sự thông minh của lập trình viên
★ 3.016-1Thay đổi số sao trong 7 ngày qua