跳到主要内容
buildradar
登录
主题 · benchmark

benchmark

标记 benchmark 主题、收录中的开源项目,按星标数排序。

共 158 个项目
  • PointTinyBenchmark@ucas-vg

    UCAS-VG 基于点的微小物体检测与定位代码集

    694+1近 7 天星标变化
  • long-form-factuality@google-deepmind

    评测大型语言模型中的长文本事实准确性。我们论文“Long-form factuality in large language models”的原始代码。

    693+0近 7 天星标变化
  • ClawBench@TIGER-AI-Lab

    用于浏览器 AI 代理日常任务的开源基准测试

    691+60近 7 天星标变化
  • Julia 语言的基准测试框架

    683+0近 7 天星标变化
  • VLM2Vec@TIGER-AI-Lab

    此仓库包含“VLM2Vec / MMEB”[ICLR 2025]、“VLM2Vec-V2 / MMEB-V2”[TMLR 2026] 以及“MMEB-V3”[COLM 2026] 的代码

    683+1近 7 天星标变化
  • BenchMARL@facebookresearch

    BenchMARL 是一个用于多智能体强化学习 (MARL) 基准测试的库。BenchMARL 能够快速比较不同的 MARL 算法、任务与模型,同时坚守其两大核心原则:可重现性与标准化。

    659+5近 7 天星标变化
  • AICGSecEval@Tencent

    A.S.E (AICGSecEval) 是由腾讯悟空代码安全团队开发的存储库级 AI 生成代码安全评估基准。

    658+2近 7 天星标变化
  • openmixup@Westlake-AI

    CAIRI 监督式、半监督式与自监督式视觉表征学习工具箱与基准测试

    658+0近 7 天星标变化
  • Awesome-LLM-Eval:精选的工具、数据集/基准测试、演示、排行榜、论文、文档与模型列表,主要用于 LLM 评估。一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界。

    656+0近 7 天星标变化
  • indonlu@IndoNLP

    针对印尼语的首个大型自然语言处理基准测试。我们提供多个下游任务、预训练的 IndoBERT 模型以及入门代码!(AACL-IJCNLP 2020)

    655+0近 7 天星标变化
  • datasets@benedekrozemberczki

    我为网络科学与机器学习研究而收集的一些非常酷的数据集仓库。

    655+0近 7 天星标变化
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    646近 7 天星标变化
  • Kotlin 多平台性能评测工具包

    644+0近 7 天星标变化
  • AgentLab@ServiceNow

    AgentLab:一个用于在各种任务上开发、测试与评测 web agent 的开源框架,专为可扩展性与可复现性而设计。

    633+5近 7 天星标变化
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM:大型语言模型的信任度

    632+0近 7 天星标变化
  • NIID-Bench@Xtra-Computing

    联邦学习基准 - 针对 Non-IID 数据孤岛的联邦学习:一项实验研究 (ICDE 2022)

    618+0近 7 天星标变化
  • rspec-benchmark@piotrmurach

    用于 RSpec 的性能测试匹配器

    618+0近 7 天星标变化
  • TextClassificationBenchmark@FreedomIntelligence

    基于 PyTorch 的文本分类基准测试

    608+0近 7 天星标变化
  • KLUE@KLUE-benchmark

    📖 韩语 NLU 基准测试

    606+0近 7 天星标变化
  • globalping@jsdelivr

    用于执行 ping、traceroute 和 DNS 解析等网络测试的全球探测节点网络。

    599+3近 7 天星标变化
  • 视觉对象追踪

    596+0近 7 天星标变化
  • rewrk@lnx-search

    一个更现代化的 HTTP 框架基准测试工具,支持 HTTP/1 与 HTTP/2 测试。

    588+1近 7 天星标变化
  • CL-bench@Tencent-Hunyuan

    CL-bench:一个用于情境学习的基准测试

    582+2近 7 天星标变化
  • ParseBench@run-llama

    ParseBench - 用于 AI Agent 的文档解析基准测试。

    568+9近 7 天星标变化
  • alpaca@p-ranav

    以 C++17 编写的序列化库 — 将 C++ 结构打包成紧凑的字节数组,无需任何宏或样板代码。

    560+0近 7 天星标变化
  • 几种编程语言的简易性能比较 (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)

    556+0近 7 天星标变化
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard:一个大型、稳健且全面的自动语音识别基准测试平台。

    553+0近 7 天星标变化
  • Meta Agents Research Environments 是一个综合平台,旨在评估动态、真实场景中的 AI 代理。与静态基准测试不同,此平台引入了不断演进的环境,代理必须随着新信息的出现调整策略,以反映现实世界的挑战。

    551+1近 7 天星标变化
  • 针对公司内部文档进行 RAG 的数据集与基准测试。

    548+8近 7 天星标变化
  • NBench@petabridge

    .NET 应用程序的性能基准测试与评测框架。

    540+0近 7 天星标变化
← 返回主题列表