跳到主要内容
buildradar
Sign in
主题 · benchmark

benchmark

标记 benchmark 主题、收录中的开源项目,按星标数排序。

项目数
158
总星标数
337,451
平均星标数
2,136
占比
0.02%

常跟 benchmark 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 benchmark 主题的项目。

  • DeepSeek V4 × J-Space 能力实现报告 — 基准测试证据显示 J-Space 降低了 DeepSeek V4 (Flash/Pro) 的能力实现损失。

    1,026
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594
  • HarnessEval-W@MirroS-Lab

    HarnessEval-W: Agentifying the Evaluation of Visual Worlds

    256
  • EvoTrace@jinzijian

    Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

    160
  • hyperfine@sharkdp

    命令行基准测试工具

    28,796+37近 7 天星标变化
  • 功能强大的 .NET 基准测试库

    11,486+1近 7 天星标变化
  • oha@hatoo

    Ohayou(おはよう),HTTP 负载生成器,灵感来自 rakyll/hey,具 tui 动画效果

    10,523+6近 7 天星标变化
  • benchmark@google

    微基准测试支持库

    10,382+7近 7 天星标变化
  • mmpose@open-mmlab

    OpenMMLab 姿态估计工具箱与基准测试

    7,867+7近 7 天星标变化
  • opencompass@open-compass

    OpenCompass 是一个 LLM 评估平台,支持多种模型(Llama3、Mistral、InternLM2、GPT-4、LLaMa2、Qwen、GLM、Claude 等)以及 100 多个数据集

    7,388+14近 7 天星标变化
  • ecs@spiritLHLS

    VPS 融合怪服务器测评项目,更推荐使用无环境依赖的 Go 版本

    7,179+24近 7 天星标变化
  • web-frameworks@the-benchmarker

    哪个是最快的 Web 框架?

    7,084-1近 7 天星标变化
  • sysbench@akopytov

    可脚本化的数据库与系统性能基准测试。

    6,783+1近 7 天星标变化
  • YABS - 一个简单的 bash 脚本,使用 fio、iperf3 与 Geekbench 估算 Linux 服务器性能

    6,664+10近 7 天星标变化
  • SWE-bench@SWE-bench

    SWE-bench:语言模型能否解决真实世界的 Github 问题?

    5,765+31近 7 天星标变化
  • ann-benchmarks@erikbern

    Python 中近似最近邻库的基准测试

    5,725+5近 7 天星标变化
  • dperf@baidu

    dperf:基于 DPDK 的高性能网络负载测试工具

    5,601+0近 7 天星标变化
  • criterion.rs@bheisler

    面向 Rust 的统计驱动基准测试库

    5,522-1近 7 天星标变化
  • across@teddysun

    Across the Great Wall we can reach every corner in the world

    5,371+1近 7 天星标变化
  • FluidX3D@ProjectPhysX

    最快且最省内存的 Lattice Boltzmann CFD 软件,支持所有 GPU 与 CPU via OpenCL,非商业用途免费

    5,257+3近 7 天星标变化
  • mmaction2@open-mmlab

    OpenMMLab 的下一代视频理解工具箱和基准

    5,150+3近 7 天星标变化
  • Chronos@Kodezi

    Kodezi Chronos 是一个以除错为先的语言模型,在 SWE-bench Lite 上达成 80.33% 的最佳成绩,实际修复准确率 67%,比 GPT-4 高出六倍以上。采用自适应图形导向检索与持久除错记忆。模型将于 2026 年第一季通过 Kodezi OS 推出。

    4,935+7近 7 天星标变化
  • lmms-eval@EvolvingLMMs-Lab

    涵盖文本、图像、视频和音频任务的全能多模态评估工具包

    4,390+7近 7 天星标变化
  • evo@MichaelGrupp

    用于评估里程计与 SLAM 的 Python 包

    4,311+1近 7 天星标变化
  • CLUE@CLUEbenchmark

    中文语言理解测评基准 Chinese Language Understanding Evaluation Benchmark:数据集、基线、预训练模型、语料库与排行榜

    4,278-1近 7 天星标变化
  • coost@idealvin

    一个小型的C++11增强库

    4,210-1近 7 天星标变化
  • Baichuan2@baichuan-inc

    由百川智能科技开发的一系列大型语言模型

    4,083+0近 7 天星标变化
  • HTTP(S) 基准测试工具,测试/调试, 与 restAPI (RESTful)

    3,769+2近 7 天星标变化
  • XcodeBenchmark@devMEremenko

    XcodeBenchmark 测量在 iMac、MacBook 与 Mac Pro 上大型代码库的编译时间

    3,663+0近 7 天星标变化
  • FlashRAG@RUC-NLPIR

    FlashRAG:Python RAG 研究工具包

    3,562+0近 7 天星标变化
  • mteb@embeddings-benchmark

    MTEB:跨语言与多模态嵌入的最先进评估

    3,414+5近 7 天星标变化
  • phoronix-test-suite@phoronix-test-suite

    Phoronix Test Suite 开源、跨平台的自动化测试与基准测试软件。

    3,122+4近 7 天星标变化
  • OSWorld@xlang-ai

    [NeurIPS 2024] OSWorld:在真实电脑环境中评测开放式任务的多模态 Agent。

    3,118+6近 7 天星标变化
  • Primes@PlummersSoftwareLLC

    使用 100 多种编程语言编写的质数项目,用以比较它们的速度以及程序员的聪明才智

    3,019+3近 7 天星标变化
← 返回主题列表