benchmark
标记 benchmark 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 benchmark 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 benchmark 主题的项目。
- #1
DeepSeek V4 × J-Space 能力实现报告 — 基准测试证据显示 J-Space 降低了 DeepSeek V4 (Flash/Pro) 的能力实现损失。
★ 1,026 - #2
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 594 - #3
HarnessEval-W: Agentifying the Evaluation of Visual Worlds
★ 256 - #4
Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.
★ 160
- #1★ 28,796+37近 7 天星标变化
- #2
功能强大的 .NET 基准测试库
★ 11,486+1近 7 天星标变化 - #3★ 10,523+6近 7 天星标变化
- #4★ 10,382+7近 7 天星标变化
- #5★ 7,867+7近 7 天星标变化
- #6
OpenCompass 是一个 LLM 评估平台,支持多种模型(Llama3、Mistral、InternLM2、GPT-4、LLaMa2、Qwen、GLM、Claude 等)以及 100 多个数据集
★ 7,388+14近 7 天星标变化 - #7★ 7,179+24近 7 天星标变化
- #8
哪个是最快的 Web 框架?
★ 7,084-1近 7 天星标变化 - #9★ 6,783+1近 7 天星标变化
- #10
YABS - 一个简单的 bash 脚本,使用 fio、iperf3 与 Geekbench 估算 Linux 服务器性能
★ 6,664+10近 7 天星标变化 - #11★ 5,765+31近 7 天星标变化
- #12
Python 中近似最近邻库的基准测试
★ 5,725+5近 7 天星标变化 - #13★ 5,601+0近 7 天星标变化
- #14
面向 Rust 的统计驱动基准测试库
★ 5,522-1近 7 天星标变化 - #15★ 5,371+1近 7 天星标变化
- #16★ 5,257+3近 7 天星标变化
- #17★ 5,150+3近 7 天星标变化
- #18
Kodezi Chronos 是一个以除错为先的语言模型,在 SWE-bench Lite 上达成 80.33% 的最佳成绩,实际修复准确率 67%,比 GPT-4 高出六倍以上。采用自适应图形导向检索与持久除错记忆。模型将于 2026 年第一季通过 Kodezi OS 推出。
★ 4,935+7近 7 天星标变化 - #19★ 4,390+7近 7 天星标变化
- #20★ 4,311+1近 7 天星标变化
- #21
中文语言理解测评基准 Chinese Language Understanding Evaluation Benchmark:数据集、基线、预训练模型、语料库与排行榜
★ 4,278-1近 7 天星标变化 - #22★ 4,210-1近 7 天星标变化
- #23★ 4,083+0近 7 天星标变化
- #24
HTTP(S) 基准测试工具,测试/调试, 与 restAPI (RESTful)
★ 3,769+2近 7 天星标变化 - #25
XcodeBenchmark 测量在 iMac、MacBook 与 Mac Pro 上大型代码库的编译时间
★ 3,663+0近 7 天星标变化 - #26★ 3,562+0近 7 天星标变化
- #27★ 3,414+5近 7 天星标变化
- #28
Phoronix Test Suite 开源、跨平台的自动化测试与基准测试软件。
★ 3,122+4近 7 天星标变化 - #29★ 3,118+6近 7 天星标变化
- #30★ 3,019+3近 7 天星标变化