跳到主要內容
buildradar
Sign in
主題 · evaluation-metrics

evaluation-metrics

標記 evaluation-metrics 主題、收錄中的開源專案,依星數排序。

專案數
12
總星數
39,801
平均星數
3,317
佔比
0.00%

常跟 evaluation-metrics 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 evaluation-metrics 主題的專案。

  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    160
  • deepeval@confident-ai

    LLM 評估框架

    18,063+110近 7 天星數變化
  • agentops@AgentOps-AI

    Python SDK,用於 AI 代理監控、LLM 成本追蹤、效能基準測試等,支援多數 LLM 與代理框架,包括 CrewAI、Agno、OpenAI Agents SDK、Langchain、Autogen、AG2、CamelAI

    5,808+3近 7 天星數變化
  • tiny-universe@datawhalechina

    《大模型白盒子构建指南》:一個全手搓的 Tiny-Universe

    5,040+9近 7 天星數變化
  • lighteval@huggingface

    Lighteval 是您跨多種後端評估 LLM 的全方位工具包

    2,533+3近 7 天星數變化
  • evaluation-guidebook@huggingface

    分享我們在管理 Open LLM Leaderboard 與設計 lighteval 期間所累積關於 LLM 評估的實務見解與理論知識!

    2,143+2近 7 天星數變化
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020)「3D 多物件追蹤:基準與新評估指標」官方 Python 實作

    1,846+0近 7 天星數變化
  • jiwer@jitsi

    使用字詞錯誤率(WER)等相似度指標評估您的語音轉文字系統

    928+2近 7 天星數變化
  • OCTIS@MIND-Lab

    OCTIS: 比較主題模型就是這麼簡單!一個用於最佳化與評估主題模型的 python 套件(已被 EACL2021 demo 專題接受)

    804+0近 7 天星數變化
  • COMET@Unbabel

    用於機器翻譯評估的神經框架

    778+1近 7 天星數變化
  • ranx@AmenRa

    ⚡️ 用於排序評估、比較與融合的極速 Python 函式庫 🐍

    698+5近 7 天星數變化
  • :chart_with_upwards_trend: 實作八種用於評估兩張影像相似度的評估指標。這八種指標分別為:RMSE、PSNR、SSIM、ISSM、FSIM、SRE、SAM 與 UIQ。

    647+0近 7 天星數變化
  • continuous-eval@relari-ai

    基於 LLM 應用程式的資料驅動評估

    517+1近 7 天星數變化
← 返回主題列表