Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · evaluation-metrics

evaluation-metrics

Các kho mã nguồn mở đang theo dõi được gắn thẻ evaluation-metrics, sắp xếp theo số sao.

Kho mã
12
Tổng số sao
39.801
Số sao trung bình
3.317
Tỷ trọng
0,00%

Những chủ đề thường xuất hiện cùng evaluation-metrics trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ evaluation-metrics.

  • eval@frontier-harness-eval

    Public results and task definitions for FrontierHarness Eval

    160
  • deepeval@confident-ai

    Khung đánh giá LLM (LLM Evaluation Framework)

    18.063+110Thay đổi số sao trong 7 ngày qua
  • agentops@AgentOps-AI

    Python SDK dùng để giám sát AI agent, theo dõi chi phí LLM, chấm điểm hiệu năng và nhiều tính năng khác. Tích hợp với hầu hết các LLM và agent framework bao gồm CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2 và CamelAI

    5.808+3Thay đổi số sao trong 7 ngày qua
  • tiny-universe@datawhalechina

    Hướng dẫn xây dựng hộp trắng mô hình lớn (LLM): Một Tiny-Universe hoàn toàn tự làm

    5.040+9Thay đổi số sao trong 7 ngày qua
  • lighteval@huggingface

    Lighteval là bộ công cụ toàn diện giúp đánh giá LLM trên nhiều backend khác nhau

    2.533+3Thay đổi số sao trong 7 ngày qua
  • evaluation-guidebook@huggingface

    Chia sẻ cả kiến thức thực tế và lý thuyết về đánh giá LLM mà chúng tôi thu thập được trong quá trình quản lý Open LLM Leaderboard và thiết kế lighteval!

    2.143+2Thay đổi số sao trong 7 ngày qua
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020) Triển khai Python chính thức cho "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics"

    1.846+0Thay đổi số sao trong 7 ngày qua
  • jiwer@jitsi

    Đánh giá hệ thống chuyển đổi giọng nói thành văn bản bằng các thước đo độ tương đồng như tỷ lệ lỗi từ (WER)

    928+2Thay đổi số sao trong 7 ngày qua
  • OCTIS@MIND-Lab

    OCTIS: So sánh các mô hình chủ đề thật đơn giản! Một gói Python để tối ưu hóa và đánh giá các mô hình chủ đề (được chấp nhận tại EACL2021 demo track)

    804+0Thay đổi số sao trong 7 ngày qua
  • COMET@Unbabel

    Một khung thần kinh (Neural Framework) để đánh giá MT

    778+1Thay đổi số sao trong 7 ngày qua
  • ranx@AmenRa

    Thư viện Python cực nhanh để đánh giá, so sánh và hợp nhất xếp hạng

    697+4Thay đổi số sao trong 7 ngày qua
  • Triển khai tám chỉ số đánh giá để đo lường độ tương đồng giữa hai hình ảnh. Tám chỉ số bao gồm: RMSE, PSNR, SSIM, ISSM, FSIM, SRE, SAM và UIQ.

    647+0Thay đổi số sao trong 7 ngày qua
  • continuous-eval@relari-ai

    Đánh giá dựa trên dữ liệu cho các ứng dụng hỗ trợ LLM

    517+1Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề