主题 · benchmark
benchmark
标记 benchmark 主题、收录中的开源项目,按星标数排序。
共 158 个项目
- #91
基于 MMSegmentation 的单目深度估计工具箱。
★ 971+0近 7 天星标变化 - #92★ 952-1近 7 天星标变化
- #93
各种 gRPC 性能测试
★ 939+1近 7 天星标变化 - #94★ 933+0近 7 天星标变化
- #95★ 924+0近 7 天星标变化
- #96
从任何位置测量 Amazon S3 的性能。
★ 910+0近 7 天星标变化 - #97★ 900+0近 7 天星标变化
- #98★ 895+1近 7 天星标变化
- #99
Windows、macOS 与 Android 存储设备(HDD、SSD、RAM)速度测试与效能效能评测应用程序
★ 870+0近 7 天星标变化 - #100★ 864+1近 7 天星标变化
- #101★ 834+2近 7 天星标变化
- #102
自然智慧仍然是一个相当不错的点子。
★ 833+0近 7 天星标变化 - #103
📊 具备运行时验证与 TypeScript 支持的软件包性能比较基准
★ 830-1近 7 天星标变化 - #104
DeepResearch Bench:深度研究代理的综合基准测试
★ 827+5近 7 天星标变化 - #105
ClawProBench 是一个实时优先的基准测试工具,用于评估 OpenClaw 运行环境中的 LLM 代理,具备确定性评分与重复试验的可靠性。
★ 823+0近 7 天星标变化 - #106★ 816+0近 7 天星标变化
- #107★ 808+19近 7 天星标变化
- #108
计算机语言性能基准游戏的又一个实现
★ 800-1近 7 天星标变化 - #109★ 796+0近 7 天星标变化
- #110
MobileGym:用于 Mobile GUI Agent 研究的可验证高并发模拟平台 · 浏览器里运行的安卓模拟器 · Browser-hosted Android Simulator · 可验证评估 · 可扩展的线上 RL 训练
★ 787+5近 7 天星标变化 - #111
RobustBench:标准化的对抗性鲁棒性基准 [NeurIPS 2021 Benchmarks and Datasets Track]
★ 782+0近 7 天星标变化 - #112★ 782+2近 7 天星标变化
- #113★ 780+0近 7 天星标变化
- #114
一个包含模拟软件公司任务的 Agent 评测基准
★ 776+1近 7 天星标变化 - #115
golang HTTP 压力测试工具,支持单机与分布式、http/1、http/2 与 http/3。
★ 771+0近 7 天星标变化 - #116
[EMNLP 2024 & AAAI 2026] 一个强大的大型模型压缩工具包,包含 LLM、VLM 及视频生成模型。
★ 747+3近 7 天星标变化 - #117
另一个针对某些 Python 框架的基准测试
★ 721+0近 7 天星标变化 - #118
热门微服务框架上 Hello World 吞吐量、延迟与传输的原始性能测试数据
★ 715+0近 7 天星标变化 - #119★ 704+0近 7 天星标变化
- #120
游玩桌上游戏《外交风云》(Diplomacy)的前沿模型。
★ 699-1近 7 天星标变化