benchmark
标记 benchmark 主题、收录中的开源项目,按星标数排序。
- #121
UCAS-VG 基于点的微小物体检测与定位代码集
★ 694+1近 7 天星标变化 - #122
评测大型语言模型中的长文本事实准确性。我们论文“Long-form factuality in large language models”的原始代码。
★ 693+0近 7 天星标变化 - #123★ 691+60近 7 天星标变化
- #124
Julia 语言的基准测试框架
★ 683+0近 7 天星标变化 - #125
此仓库包含“VLM2Vec / MMEB”[ICLR 2025]、“VLM2Vec-V2 / MMEB-V2”[TMLR 2026] 以及“MMEB-V3”[COLM 2026] 的代码
★ 683+1近 7 天星标变化 - #126
BenchMARL 是一个用于多智能体强化学习 (MARL) 基准测试的库。BenchMARL 能够快速比较不同的 MARL 算法、任务与模型,同时坚守其两大核心原则:可重现性与标准化。
★ 659+5近 7 天星标变化 - #127
A.S.E (AICGSecEval) 是由腾讯悟空代码安全团队开发的存储库级 AI 生成代码安全评估基准。
★ 658+2近 7 天星标变化 - #128★ 658+0近 7 天星标变化
- #129
Awesome-LLM-Eval:精选的工具、数据集/基准测试、演示、排行榜、论文、文档与模型列表,主要用于 LLM 评估。一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界。
★ 656+0近 7 天星标变化 - #130★ 655+0近 7 天星标变化
- #131★ 655+0近 7 天星标变化
- #132
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 646—近 7 天星标变化 - #133
Kotlin 多平台性能评测工具包
★ 644+0近 7 天星标变化 - #134★ 633+5近 7 天星标变化
- #135★ 632+0近 7 天星标变化
- #136
联邦学习基准 - 针对 Non-IID 数据孤岛的联邦学习:一项实验研究 (ICDE 2022)
★ 618+0近 7 天星标变化 - #137
用于 RSpec 的性能测试匹配器
★ 618+0近 7 天星标变化 - #138
基于 PyTorch 的文本分类基准测试
★ 608+0近 7 天星标变化 - #139★ 606+0近 7 天星标变化
- #140
用于执行 ping、traceroute 和 DNS 解析等网络测试的全球探测节点网络。
★ 599+3近 7 天星标变化 - #141
视觉对象追踪
★ 596+0近 7 天星标变化 - #142★ 588+1近 7 天星标变化
- #143★ 582+2近 7 天星标变化
- #144
ParseBench - 用于 AI Agent 的文档解析基准测试。
★ 568+9近 7 天星标变化 - #145★ 560+0近 7 天星标变化
- #146
几种编程语言的简易性能比较 (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)
★ 556+0近 7 天星标变化 - #147
SpeechIO Leaderboard:一个大型、稳健且全面的自动语音识别基准测试平台。
★ 553+0近 7 天星标变化 - #148
Meta Agents Research Environments 是一个综合平台,旨在评估动态、真实场景中的 AI 代理。与静态基准测试不同,此平台引入了不断演进的环境,代理必须随着新信息的出现调整策略,以反映现实世界的挑战。
★ 551+1近 7 天星标变化 - #149
针对公司内部文档进行 RAG 的数据集与基准测试。
★ 548+8近 7 天星标变化 - #150★ 540+0近 7 天星标变化