evaluation
Các kho mã nguồn mở đang theo dõi được gắn thẻ evaluation, sắp xếp theo số sao.
- #31
Chia sẻ cả kiến thức thực tế và lý thuyết về đánh giá LLM mà chúng tôi thu thập được trong quá trình quản lý Open LLM Leaderboard và thiết kế lighteval!
★ 2.143+0Thay đổi số sao trong 7 ngày qua - #32
Avalanche: Thư viện toàn diện dành cho Học liên tục (Continual Learning) dựa trên PyTorch.
★ 2.088+0Thay đổi số sao trong 7 ngày qua - #33
:cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Đánh giá trạng thái công nghệ tiên tiến nhất trong AI
★ 2.037-2Thay đổi số sao trong 7 ngày qua - #34
Trình đánh giá tự động cho các mô hình ngôn ngữ tuân theo hướng dẫn. Được xác thực bởi con người, chất lượng cao, chi phí rẻ và nhanh chóng.
★ 2.012+0Thay đổi số sao trong 7 ngày qua - #35
(IROS 2020, ECCVW 2020) Triển khai Python chính thức cho "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics"
★ 1.846+1Thay đổi số sao trong 7 ngày qua - #36
WFGY đang hướng tới WFGY 5.0 Polaris Protocol, một bản phát hành mã nguồn mở lớn dành cho suy luận AI, RAG, agent và quy trình làm việc thực tế. Bao gồm Bản đồ vấn đề, Thẻ gỡ lỗi toàn cầu, WFGY 4.0 và Trứng phục sinh CFV.
★ 1.786+1Thay đổi số sao trong 7 ngày qua - #37
Mô hình ngôn ngữ lớn về sức khỏe tâm thần (LLM x Mental Health), Tiền huấn luyện & Tinh chỉnh, Bộ dữ liệu, Đánh giá, Triển khai & RAG, với các dòng mô hình InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM
★ 1.781+1Thay đổi số sao trong 7 ngày qua - #38
Một Go framework để xây dựng các hệ thống agent môi trường sản xuất với luồng công việc dạng đồ thị, công cụ, bộ nhớ, A2A, AG-UI, MCP, đánh giá và khả năng quan sát.
★ 1.760+25Thay đổi số sao trong 7 ngày qua - #39★ 1.668+0Thay đổi số sao trong 7 ngày qua
- #40
Trang GitHub chính thức cho bài báo khảo sát "A Survey on Evaluation of Large Language Models".
★ 1.608-1Thay đổi số sao trong 7 ngày qua - #41★ 1.506+0Thay đổi số sao trong 7 ngày qua
- #42
Mã nguồn đánh giá cho các số liệu tự động không giám sát khác nhau trong Natural Language Generation.
★ 1.391+0Thay đổi số sao trong 7 ngày qua - #43★ 1.300+0Thay đổi số sao trong 7 ngày qua
- #44★ 1.260+1Thay đổi số sao trong 7 ngày qua
- #45
Một framework để chuẩn đoán và tối ưu hóa toàn diện các tác nhân sử dụng các tương tác tổng hợp thực tế, được mô phỏng
★ 1.257+0Thay đổi số sao trong 7 ngày qua - #46
KernelBench: LLM có thể viết GPU Kernel không? - Bộ công cụ và benchmark với Torch -> CUDA (+ nhiều DSL khác)
★ 1.227+13Thay đổi số sao trong 7 ngày qua - #47
Phân phối và chạy các workload AI trên Kubernetes một cách kỳ diệu bằng Python, giống như PyTorch cho cơ sở hạ tầng ML.
★ 1.224+0Thay đổi số sao trong 7 ngày qua - #48★ 1.206+0Thay đổi số sao trong 7 ngày qua
- #49
Các chỉ số hiệu năng độ trung thực cao cho các mô hình tạo sinh trong PyTorch
★ 1.200+3Thay đổi số sao trong 7 ngày qua - #50
CI/CD gốc truy vết cho các AI agent — các lỗi trong môi trường sản xuất trở thành các bài kiểm thử hồi quy chặn PR. Tự động phát hiện, phân cụm, đóng băng thành các ca khép kín, phát lại trong CI với giá $0.
★ 1.176+134Thay đổi số sao trong 7 ngày qua - #51
NCalc là một thư viện đánh giá biểu thức nhanh và nhẹ dành cho .NET, được thiết kế cho sự linh hoạt và hiệu suất cao. Nó hỗ trợ nhiều phép toán logic và toán học.
★ 1.156+2Thay đổi số sao trong 7 ngày qua - #52★ 1.155+13Thay đổi số sao trong 7 ngày qua
- #53
Đánh giá phản hồi LLM của bạn với Prometheus và GPT4 💯
★ 1.111+0Thay đổi số sao trong 7 ngày qua - #54
Các triển khai LangSmith Client SDK.
★ 1.047+6Thay đổi số sao trong 7 ngày qua - #55
API SemanticKITTI để trực quan hóa tập dữ liệu, xử lý dữ liệu và đánh giá kết quả.
★ 898+0Thay đổi số sao trong 7 ngày qua - #56
Tạo dữ liệu tổng hợp chất lượng cao, huấn luyện, đo lường và đánh giá trong một quy trình duy nhất.
★ 885+2Thay đổi số sao trong 7 ngày qua - #57
ClawProBench là một bộ công cụ đánh giá trực tiếp dành cho các tác nhân LLM trong môi trường thực thi OpenClaw với khả năng chấm điểm xác định và độ tin cậy qua các lần thử nghiệm lặp lại.
★ 823+1Thay đổi số sao trong 7 ngày qua - #58
OpenJudge: Một khung thống nhất để đánh giá toàn diện và khen thưởng chất lượng
★ 817+10Thay đổi số sao trong 7 ngày qua - #59★ 814+1Thay đổi số sao trong 7 ngày qua
- #60
Web Codegen Scorer là công cụ đánh giá chất lượng mã web được tạo bởi các mô hình LLM.
★ 775+5Thay đổi số sao trong 7 ngày qua