主题 · benchmark
benchmark
标记 benchmark 主题、收录中的开源项目,按星标数排序。
共 158 个项目
- #31★ 2,800+0近 7 天星标变化
- #32
基于 springboot 与 spring security 的 Java web 常见漏洞与安全代码
★ 2,675+0近 7 天星标变化 - #33★ 2,647+0近 7 天星标变化
- #34★ 2,629+0近 7 天星标变化
- #35
针对较小 LLMs 优化的测试框架
★ 2,528+0近 7 天星标变化 - #36★ 2,525+0近 7 天星标变化
- #37
[ECCV2024] 用于多模态理解的视频基础模型与数据
★ 2,374+0近 7 天星标变化 - #38★ 2,362+0近 7 天星标变化
- #39★ 2,329+0近 7 天星标变化
- #40★ 2,283+0近 7 天星标变化
- #41★ 2,264+0近 7 天星标变化
- #42★ 2,247+0近 7 天星标变化
- #43
📰 关于基于 LLM 的长上下文建模必读论文与博客 🔥
★ 2,164+0近 7 天星标变化 - #44
:zap: Go web 框架基准测试
★ 2,135+0近 7 天星标变化 - #45
对多个允许将网页应用程序“转换”为桌面应用程序的框架进行客观比较。
★ 1,989+0近 7 天星标变化 - #46★ 1,987+0近 7 天星标变化
- #47★ 1,973+0近 7 天星标变化
- #48
τ-Bench:真实世界领域中工具-代理-用户交互的基准测试
★ 1,938+0近 7 天星标变化 - #49
在 C++ 20、C、CUDA、PTX 与汇编语言中探索“较不慢”的编码实践,从数值与 SIMD 到协程、范围、异常处理、网络与用户空间 IO
★ 1,923+0近 7 天星标变化 - #50★ 1,806+0近 7 天星标变化
- #51★ 1,771+0近 7 天星标变化
- #52★ 1,757+0近 7 天星标变化
- #53
SkillsBench 用于评估技能的运作效果以及 agent 使用技能的效率。
★ 1,742+0近 7 天星标变化 - #54★ 1,733+0近 7 天星标变化
- #55
快速找出 Rust 中的性能瓶颈——适用于 CPU、内存、SQL、HTTP、I/O 与异步代码的单一性能分析器。
★ 1,707+0近 7 天星标变化 - #56
BEHAVIOR-1K:一个加速具身 AI 研究的平台。加入我们的 Discord 以获得支持:https://discord.gg/bccR5vGFEx
★ 1,677+0近 7 天星标变化 - #57★ 1,624+0近 7 天星标变化
- #58
综述论文 "A Survey on Evaluation of Large Language Models" 的官方 GitHub 页面。
★ 1,608+0近 7 天星标变化 - #59★ 1,527+0近 7 天星标变化
- #60
:bar_chart: 在 Python 中对多个对象跟踪器 (MOT) 进行性能评测
★ 1,487+0近 7 天星标变化