benchmark
標記 benchmark 主題、收錄中的開源專案,依星數排序。
- #121
UCAS-VG 基於點的微小物體偵測與定位程式碼集
★ 694+1近 7 天星數變化 - #122
評測大型語言模型中的長文本事實準確性。我們論文「Long-form factuality in large language models」的原始程式碼。
★ 693+2近 7 天星數變化 - #123★ 691+72近 7 天星數變化
- #124
Julia 語言的基準測試框架
★ 683+0近 7 天星數變化 - #125
此儲存庫包含「VLM2Vec / MMEB」[ICLR 2025]、「VLM2Vec-V2 / MMEB-V2」[TMLR 2026] 以及「MMEB-V3」[COLM 2026] 的程式碼
★ 682+2近 7 天星數變化 - #126
BenchMARL 是一個用於多智能體強化學習 (MARL) 基準測試的函式庫。BenchMARL 能夠快速比較不同的 MARL 演算法、任務與模型,同時堅守其兩大核心原則:可重現性與標準化。
★ 659+2近 7 天星數變化 - #127★ 658+0近 7 天星數變化
- #128
A.S.E (AICGSecEval) 是由騰訊悟空程式碼安全團隊開發的儲存庫級 AI 生成程式碼安全評估基準。
★ 657+1近 7 天星數變化 - #129
Awesome-LLM-Eval:精選的工具、資料集/基準測試、展示、排行榜、論文、文件與模型清單,主要用於 LLM 評估。一個由工具、基準/數據、演示、排行榜和大模型等組成的精選列表,主要面向基礎大模型評測,旨在探求生成式AI的技術邊界。
★ 656-2近 7 天星數變化 - #130★ 655+0近 7 天星數變化
- #131★ 655+1近 7 天星數變化
- #132
Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.
★ 646—近 7 天星數變化 - #133
Kotlin 多平台效能評測工具組
★ 644+0近 7 天星數變化 - #134★ 632+3近 7 天星數變化
- #135★ 632+2近 7 天星數變化
- #136
聯邦學習基準 - 針對 Non-IID 資料孤島的聯邦學習:一項實驗研究 (ICDE 2022)
★ 618+0近 7 天星數變化 - #137
用於 RSpec 的效能測試匹配器
★ 618+0近 7 天星數變化 - #138
基於 PyTorch 的文本分類基準測試
★ 608+0近 7 天星數變化 - #139★ 604+0近 7 天星數變化
- #140
用於執行 ping、traceroute 和 DNS 解析等網路測試的全球探測節點網路。
★ 599+5近 7 天星數變化 - #141
視覺物件追蹤
★ 596+1近 7 天星數變化 - #142★ 588+2近 7 天星數變化
- #143★ 582+1近 7 天星數變化
- #144
ParseBench - 用於 AI Agent 的文件解析基準測試。
★ 567+12近 7 天星數變化 - #145★ 560+0近 7 天星數變化
- #146
幾種程式語言的簡易效能比較 (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)
★ 556+1近 7 天星數變化 - #147
SpeechIO Leaderboard:一個大型、穩健且全面的自動語音識別基準測試平台。
★ 553+3近 7 天星數變化 - #148
Meta Agents Research Environments 是一個綜合平台,旨在評估動態、真實場景中的 AI 代理。與靜態基準測試不同,此平台引入了不斷演進的環境,代理必須隨著新資訊的出現調整策略,以反映現實世界的挑戰。
★ 551+4近 7 天星數變化 - #149
針對公司內部文件進行 RAG 的資料集與基準測試。
★ 548+12近 7 天星數變化 - #150★ 540+0近 7 天星數變化