evaluation-framework
Các kho mã nguồn mở đang theo dõi được gắn thẻ evaluation-framework, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng evaluation-framework trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ evaluation-framework.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Kiểm tra prompt, agent và RAG của bạn. Kiểm tra bảo mật/thử nghiệm xâm nhập/quét lỗ hổng cho AI. So sánh hiệu năng của GPT, Claude, Gemini, DeepSeek và nhiều mô hình khác. Cấu hình khai báo đơn giản với dòng lệnh và tích hợp CI/CD. Được sử dụng bởi OpenAI và Anthropic.
★ 24.664+215Thay đổi số sao trong 7 ngày qua - #2★ 17.953+184Thay đổi số sao trong 7 ngày qua
- #3
Một framework để đánh giá few-shot cho các mô hình ngôn ngữ.
★ 13.827+89Thay đổi số sao trong 7 ngày qua - #4
Xây dựng, Đánh giá và Tối ưu hóa các Hệ thống AI. Bao gồm đánh giá, RAG, tác nhân, fine-tuning, tạo dữ liệu tổng hợp, quản lý tập dữ liệu, MCP và nhiều tính năng khác.
★ 5.040+7Thay đổi số sao trong 7 ngày qua - #5
Lighteval là bộ công cụ toàn diện giúp đánh giá LLM trên nhiều backend khác nhau
★ 2.533+8Thay đổi số sao trong 7 ngày qua - #6
:cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Đánh giá trạng thái công nghệ tiên tiến nhất trong AI
★ 2.037-2Thay đổi số sao trong 7 ngày qua - #7
Nền tảng mã nguồn mở, đầu cuối để đánh giá, theo dõi và cải thiện các ứng dụng LLM và AI agent. Truy vết · Đánh giá · Mô phỏng · Tập dữ liệu · Gateway · Guardrails. Có thể tự lưu trữ. Apache 2.0.
★ 1.890+89Thay đổi số sao trong 7 ngày qua - #8
Kho lưu trữ cho hướng dẫn toàn diện về AI Agents
★ 1.528+422Thay đổi số sao trong 7 ngày qua - #9
AgentLab: Một framework mã nguồn mở để phát triển, kiểm thử và đánh giá các web agent trên nhiều tác vụ khác nhau, được thiết kế để có khả năng mở rộng và tái lập.
★ 627+2Thay đổi số sao trong 7 ngày qua - #10
Đánh giá dựa trên dữ liệu cho các ứng dụng hỗ trợ LLM
★ 517+1Thay đổi số sao trong 7 ngày qua