跳到主要内容
buildradar
Sign in
主题 · evaluation-metrics

evaluation-metrics

标记 evaluation-metrics 主题、收录中的开源项目,按星标数排序。

项目数
12
总星标数
39,801
平均星标数
3,317
占比
0.00%

常跟 evaluation-metrics 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 evaluation-metrics 主题的项目。

  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    160
  • deepeval@confident-ai

    LLM 评估框架

    18,063+110近 7 天星标变化
  • agentops@AgentOps-AI

    Python SDK,用于 AI 代理监控、LLM 成本追踪、基准测试等,集成多数 LLM 和代理框架,包括 CrewAI、Agno、OpenAI Agents SDK、Langchain、Autogen、AG2、CamelAI

    5,808+3近 7 天星标变化
  • tiny-universe@datawhalechina

    《大模型白盒子构建指南》:一个全手搓的 Tiny-Universe

    5,040+9近 7 天星标变化
  • lighteval@huggingface

    Lighteval 是您跨多种后端评估 LLM 的全方位工具包

    2,533+3近 7 天星标变化
  • evaluation-guidebook@huggingface

    分享我们在管理 Open LLM Leaderboard 与设计 lighteval 期间所积累关于 LLM 评估的实务见解与理论知识!

    2,143+2近 7 天星标变化
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020)“3D 多目标跟踪:基准与新评估指标”官方 Python 实现

    1,846+0近 7 天星标变化
  • jiwer@jitsi

    使用词错误率(WER)等相似度指标评估您的语音转文字系统

    928+2近 7 天星标变化
  • OCTIS@MIND-Lab

    OCTIS: 比较主题模型就是这么简单!一个用于优化与评估主题模型的 python 软件包(已被 EACL2021 demo 专题接收)

    804+0近 7 天星标变化
  • COMET@Unbabel

    用于机器翻译评估的神经框架

    778+1近 7 天星标变化
  • ranx@AmenRa

    ⚡️ 用于排序评估、比较与融合的极速 Python 库 🐍

    698+5近 7 天星标变化
  • :chart_with_upwards_trend: 实现八种用于评估两张图像相似度的评估指标。这八种指标分别为:RMSE、PSNR、SSIM、ISSM、FSIM、SRE、SAM 与 UIQ。

    647+0近 7 天星标变化
  • continuous-eval@relari-ai

    基于 LLM 应用程序的数据驱动评估

    517+1近 7 天星标变化
← 返回主题列表