Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · evaluation

evaluation

Các kho mã nguồn mở đang theo dõi được gắn thẻ evaluation, sắp xếp theo số sao.

80 kho mã
  • RAG-FiT@IntelLabs

    Khung làm việc để tăng cường LLM cho các tác vụ RAG bằng cách tinh chỉnh.

    768+0Thay đổi số sao trong 7 ngày qua
  • LightCompress@ModelTC

    [EMNLP 2024 & AAAI 2026] Bộ công cụ mạnh mẽ để nén các mô hình lớn bao gồm LLM, VLM và các mô hình tạo video

    747+4Thay đổi số sao trong 7 ngày qua
  • opik-openclaw@comet-ml

    Plugin chính thức cho OpenClaw giúp xuất dấu vết (trace) của agent sang Opik. Theo dõi hành vi, chi phí, token, lỗi và nhiều thông tin khác của agent.

    725+0Thay đổi số sao trong 7 ngày qua
  • iou-tracker@bochinski

    Triển khai IOU Tracker bằng Python

    702+0Thay đổi số sao trong 7 ngày qua
  • ranx@AmenRa

    Thư viện Python cực nhanh để đánh giá, so sánh và hợp nhất xếp hạng

    697+4Thay đổi số sao trong 7 ngày qua
  • long-form-factuality@google-deepmind

    Đánh giá tính xác thực dạng dài trong các mô hình ngôn ngữ lớn. Mã nguồn gốc cho bài báo "Long-form factuality in large language models" của chúng tôi.

    693+2Thay đổi số sao trong 7 ngày qua
  • ClawBench@TIGER-AI-Lab

    Bộ tiêu chuẩn đánh giá mã nguồn mở cho các tác nhân AI trên trình duyệt thực hiện các tác vụ hàng ngày.

    664+61Thay đổi số sao trong 7 ngày qua
  • Awesome-LLM-Eval: danh sách tuyển chọn các công cụ, tập dữ liệu/benchmark, bản demo, bảng xếp hạng, tài liệu và mô hình, chủ yếu dành cho việc đánh giá LLM.

    656-2Thay đổi số sao trong 7 ngày qua
  • autoprompt@ucinlp

    AutoPrompt: Xây dựng Prompt tự động cho các mô hình ngôn ngữ Masked.

    641+0Thay đổi số sao trong 7 ngày qua
  • TrustLLM@HowieHwong

    [ICML 2024] TrustLLM: Độ tin cậy trong các mô hình ngôn ngữ lớn

    632+2Thay đổi số sao trong 7 ngày qua
  • Một trình đánh giá biểu thức toán học và giả C# đơn giản trong một tệp C# duy nhất. Cũng có thể thực thi các tập lệnh nhỏ giống C#.

    630+0Thay đổi số sao trong 7 ngày qua
  • Kho lưu trữ tài nguyên về machine unlearning trong các mô hình ngôn ngữ lớn

    624+0Thay đổi số sao trong 7 ngày qua
  • tcexam@tecnickcom

    TCExam là một hệ thống đánh giá dựa trên máy tính (CBA) dành cho các trường đại học, trường học và doanh nghiệp, cho phép các nhà giáo dục và đào tạo soạn thảo, lập lịch, phân phối và báo cáo các khảo sát, câu đố, bài kiểm tra và kỳ thi.

    621+0Thay đổi số sao trong 7 ngày qua
  • simpleeval@danthedeckie

    Trình đánh giá biểu thức đơn giản, an toàn, được sandbox và có thể mở rộng cho Python

    611+0Thay đổi số sao trong 7 ngày qua
  • MMMU@MMMU-Benchmark

    Kho lưu trữ này chứa mã đánh giá cho bài báo "MMMU: Một điểm chuẩn hiểu và suy luận đa phương thức đa ngành lớn cho AGI chuyên gia"

    594+1Thay đổi số sao trong 7 ngày qua
  • image-matching-toolbox@GrumpyZhou

    Đây là kho lưu trữ bộ công cụ giúp đánh giá các phương pháp khớp hình ảnh từ một cặp ảnh.

    594+0Thay đổi số sao trong 7 ngày qua
  • text2sql-data@jkkummerfeld

    Bộ sưu tập các tập dữ liệu ghép nối câu hỏi với các truy vấn SQL.

    588+1Thay đổi số sao trong 7 ngày qua
  • ParseBench@run-llama

    ParseBench - Một tiêu chuẩn đánh giá phân tích tài liệu cho các AI Agent

    565+12Thay đổi số sao trong 7 ngày qua
  • Meta Agents Research Environments là một nền tảng toàn diện được thiết kế để đánh giá các tác nhân AI trong các tình huống thực tế và năng động. Không giống như các tiêu chuẩn tĩnh, nền tảng này giới thiệu các môi trường phát triển nơi các tác nhân phải điều chỉnh chiến lược khi có thông tin mới, phản ánh các thách thức trong thế giới thực.

    551+3Thay đổi số sao trong 7 ngày qua
  • Tập dữ liệu và điểm chuẩn cho RAG trên các tài liệu nội bộ của công ty.

    546+11Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề