evaluation
Các kho mã nguồn mở đang theo dõi được gắn thẻ evaluation, sắp xếp theo số sao.
- #61★ 768+0Thay đổi số sao trong 7 ngày qua
- #62
[EMNLP 2024 & AAAI 2026] Bộ công cụ mạnh mẽ để nén các mô hình lớn bao gồm LLM, VLM và các mô hình tạo video
★ 747+4Thay đổi số sao trong 7 ngày qua - #63
Plugin chính thức cho OpenClaw giúp xuất dấu vết (trace) của agent sang Opik. Theo dõi hành vi, chi phí, token, lỗi và nhiều thông tin khác của agent.
★ 725+0Thay đổi số sao trong 7 ngày qua - #64
Triển khai IOU Tracker bằng Python
★ 702+0Thay đổi số sao trong 7 ngày qua - #65★ 697+4Thay đổi số sao trong 7 ngày qua
- #66
Đánh giá tính xác thực dạng dài trong các mô hình ngôn ngữ lớn. Mã nguồn gốc cho bài báo "Long-form factuality in large language models" của chúng tôi.
★ 693+2Thay đổi số sao trong 7 ngày qua - #67
Bộ tiêu chuẩn đánh giá mã nguồn mở cho các tác nhân AI trên trình duyệt thực hiện các tác vụ hàng ngày.
★ 664+61Thay đổi số sao trong 7 ngày qua - #68
Awesome-LLM-Eval: danh sách tuyển chọn các công cụ, tập dữ liệu/benchmark, bản demo, bảng xếp hạng, tài liệu và mô hình, chủ yếu dành cho việc đánh giá LLM.
★ 656-2Thay đổi số sao trong 7 ngày qua - #69
AutoPrompt: Xây dựng Prompt tự động cho các mô hình ngôn ngữ Masked.
★ 641+0Thay đổi số sao trong 7 ngày qua - #70★ 632+2Thay đổi số sao trong 7 ngày qua
- #71
Một trình đánh giá biểu thức toán học và giả C# đơn giản trong một tệp C# duy nhất. Cũng có thể thực thi các tập lệnh nhỏ giống C#.
★ 630+0Thay đổi số sao trong 7 ngày qua - #72
Kho lưu trữ tài nguyên về machine unlearning trong các mô hình ngôn ngữ lớn
★ 624+0Thay đổi số sao trong 7 ngày qua - #73
TCExam là một hệ thống đánh giá dựa trên máy tính (CBA) dành cho các trường đại học, trường học và doanh nghiệp, cho phép các nhà giáo dục và đào tạo soạn thảo, lập lịch, phân phối và báo cáo các khảo sát, câu đố, bài kiểm tra và kỳ thi.
★ 621+0Thay đổi số sao trong 7 ngày qua - #74
Trình đánh giá biểu thức đơn giản, an toàn, được sandbox và có thể mở rộng cho Python
★ 611+0Thay đổi số sao trong 7 ngày qua - #75
Kho lưu trữ này chứa mã đánh giá cho bài báo "MMMU: Một điểm chuẩn hiểu và suy luận đa phương thức đa ngành lớn cho AGI chuyên gia"
★ 594+1Thay đổi số sao trong 7 ngày qua - #76
Đây là kho lưu trữ bộ công cụ giúp đánh giá các phương pháp khớp hình ảnh từ một cặp ảnh.
★ 594+0Thay đổi số sao trong 7 ngày qua - #77
Bộ sưu tập các tập dữ liệu ghép nối câu hỏi với các truy vấn SQL.
★ 588+1Thay đổi số sao trong 7 ngày qua - #78
ParseBench - Một tiêu chuẩn đánh giá phân tích tài liệu cho các AI Agent
★ 565+12Thay đổi số sao trong 7 ngày qua - #79
Meta Agents Research Environments là một nền tảng toàn diện được thiết kế để đánh giá các tác nhân AI trong các tình huống thực tế và năng động. Không giống như các tiêu chuẩn tĩnh, nền tảng này giới thiệu các môi trường phát triển nơi các tác nhân phải điều chỉnh chiến lược khi có thông tin mới, phản ánh các thách thức trong thế giới thực.
★ 551+3Thay đổi số sao trong 7 ngày qua - #80
Tập dữ liệu và điểm chuẩn cho RAG trên các tài liệu nội bộ của công ty.
★ 546+11Thay đổi số sao trong 7 ngày qua