본문으로 건너뛰기
buildradar
Sign in
토픽 · evaluation-metrics

evaluation-metrics

evaluation-metrics 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
12
총 스타
39,801
평균 스타
3,317
비중
0.00%

같은 리포지토리에 evaluation-metrics 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 evaluation-metrics 태그가 달린 리포지토리예요.

  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    151
  • deepeval@confident-ai

    LLM 평가 프레임워크

    18,063+110최근 7일 스타 변화
  • agentops@AgentOps-AI

    AI 에이전트 모니터링, LLM 비용 추적, 벤치마킹 등을 위한 Python SDK. CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2, CamelAI를 비롯한 대부분의 LLM 및 에이전트 프레임워크와 통합됩니다.

    5,808+3최근 7일 스타 변화
  • tiny-universe@datawhalechina

    '대규모 언어 모델 화이트박스 구축 가이드': 처음부터 직접 만드는 Tiny-Universe

    5,040+9최근 7일 스타 변화
  • lighteval@huggingface

    Lighteval은 다양한 백엔드에서 LLM을 평가하기 위한 올인원 툴킷입니다

    2,533+3최근 7일 스타 변화
  • evaluation-guidebook@huggingface

    Open LLM Leaderboard를 관리하고 lighteval을 설계하면서 얻은 LLM 평가에 관한 실용적인 통찰력과 이론적 지식 공유

    2,143+2최근 7일 스타 변화
  • AB3DMOT@xinshuoweng

    "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics" 논문의 공식 Python 구현 (IROS 2020, ECCVW 2020)

    1,846+0최근 7일 스타 변화
  • jiwer@jitsi

    단어 오류율(WER)과 같은 유사도 지표로 speech-to-text 시스템을 평가하세요.

    927+1최근 7일 스타 변화
  • OCTIS@MIND-Lab

    OCTIS: 토픽 모델 비교가 간단해집니다! 토픽 모델을 최적화하고 평가하기 위한 파이썬 패키지 (EACL2021 데모 트랙 채택)

    804+0최근 7일 스타 변화
  • COMET@Unbabel

    기계 번역(MT) 평가를 위한 신경망 프레임워크입니다.

    778+1최근 7일 스타 변화
  • ranx@AmenRa

    ⚡️랭킹 평가, 비교, 융합을 위한 초고속 Python 라이브러리 🐍

    697+4최근 7일 스타 변화
  • 두 이미지 간의 유사도를 평가하기 위한 8가지 지표(RMSE, PSNR, SSIM, ISSM, FSIM, SRE, SAM, UIQ) 구현

    647+0최근 7일 스타 변화
  • continuous-eval@relari-ai

    LLM 기반 애플리케이션을 위한 데이터 기반 평가

    517+1최근 7일 스타 변화
← 토픽 목록으로