跳到主要內容
buildradar
Sign in
主題 · benchmark

benchmark

標記 benchmark 主題、收錄中的開源專案,依星數排序。

共 158 個專案
  • PointTinyBenchmark@ucas-vg

    UCAS-VG 基於點的微小物體偵測與定位程式碼集

    694+1近 7 天星數變化
  • long-form-factuality@google-deepmind

    評測大型語言模型中的長文本事實準確性。我們論文「Long-form factuality in large language models」的原始程式碼。

    693+2近 7 天星數變化
  • ClawBench@TIGER-AI-Lab

    用於瀏覽器 AI 代理日常任務的開源基準測試

    691+72近 7 天星數變化
  • Julia 語言的基準測試框架

    683+0近 7 天星數變化
  • VLM2Vec@TIGER-AI-Lab

    此儲存庫包含「VLM2Vec / MMEB」[ICLR 2025]、「VLM2Vec-V2 / MMEB-V2」[TMLR 2026] 以及「MMEB-V3」[COLM 2026] 的程式碼

    682+2近 7 天星數變化
  • BenchMARL@facebookresearch

    BenchMARL 是一個用於多智能體強化學習 (MARL) 基準測試的函式庫。BenchMARL 能夠快速比較不同的 MARL 演算法、任務與模型,同時堅守其兩大核心原則:可重現性與標準化。

    659+2近 7 天星數變化
  • openmixup@Westlake-AI

    CAIRI 監督式、半監督式與自我監督式視覺表徵學習工具箱與基準測試

    658+0近 7 天星數變化
  • AICGSecEval@Tencent

    A.S.E (AICGSecEval) 是由騰訊悟空程式碼安全團隊開發的儲存庫級 AI 生成程式碼安全評估基準。

    657+1近 7 天星數變化
  • Awesome-LLM-Eval:精選的工具、資料集/基準測試、展示、排行榜、論文、文件與模型清單,主要用於 LLM 評估。一個由工具、基準/數據、演示、排行榜和大模型等組成的精選列表,主要面向基礎大模型評測,旨在探求生成式AI的技術邊界。

    656-2近 7 天星數變化
  • datasets@benedekrozemberczki

    我為網路科學與機器學習研究而收集的一些非常酷的資料集儲存庫。

    655+0近 7 天星數變化
  • indonlu@IndoNLP

    針對印尼語的第一個大型自然語言處理基準測試。我們提供多個下游任務、預訓練的 IndoBERT 模型以及入門程式碼!(AACL-IJCNLP 2020)

    655+1近 7 天星數變化
  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    646近 7 天星數變化
  • Kotlin 多平台效能評測工具組

    644+0近 7 天星數變化
  • AgentLab@ServiceNow

    AgentLab:一個用於在各種任務上開發、測試與評測 web agent 的開源框架,專為可擴充性與可重現性而設計。

    632+3近 7 天星數變化
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM:大型語言模型的信任度

    632+2近 7 天星數變化
  • NIID-Bench@Xtra-Computing

    聯邦學習基準 - 針對 Non-IID 資料孤島的聯邦學習:一項實驗研究 (ICDE 2022)

    618+0近 7 天星數變化
  • rspec-benchmark@piotrmurach

    用於 RSpec 的效能測試匹配器

    618+0近 7 天星數變化
  • TextClassificationBenchmark@FreedomIntelligence

    基於 PyTorch 的文本分類基準測試

    608+0近 7 天星數變化
  • KLUE@KLUE-benchmark

    📖 韓語 NLU 基準測試

    604+0近 7 天星數變化
  • globalping@jsdelivr

    用於執行 ping、traceroute 和 DNS 解析等網路測試的全球探測節點網路。

    599+5近 7 天星數變化
  • 視覺物件追蹤

    596+1近 7 天星數變化
  • rewrk@lnx-search

    一個更現代化的 HTTP 框架基準測試工具,支援 HTTP/1 與 HTTP/2 測試。

    588+2近 7 天星數變化
  • CL-bench@Tencent-Hunyuan

    CL-bench:一個用於情境學習的基準測試

    582+1近 7 天星數變化
  • ParseBench@run-llama

    ParseBench - 用於 AI Agent 的文件解析基準測試。

    567+12近 7 天星數變化
  • alpaca@p-ranav

    以 C++17 編寫的序列化函式庫 — 將 C++ 結構打包成緊湊的位元組陣列,無需任何巨集或樣板程式碼。

    560+0近 7 天星數變化
  • 幾種程式語言的簡易效能比較 (JavaScript, Kotlin, Rust, Swift, Nim, Python, Go, Haskell, D, C++, Java, C#, Object Pascal, Ada, Lua, Ruby)

    556+1近 7 天星數變化
  • Leaderboard@SpeechColab

    SpeechIO Leaderboard:一個大型、穩健且全面的自動語音識別基準測試平台。

    553+3近 7 天星數變化
  • Meta Agents Research Environments 是一個綜合平台,旨在評估動態、真實場景中的 AI 代理。與靜態基準測試不同,此平台引入了不斷演進的環境,代理必須隨著新資訊的出現調整策略,以反映現實世界的挑戰。

    551+4近 7 天星數變化
  • 針對公司內部文件進行 RAG 的資料集與基準測試。

    548+12近 7 天星數變化
  • NBench@petabridge

    .NET 應用程式的效能基準測試與評測框架。

    540+0近 7 天星數變化
← 返回主題列表