Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · evaluation

evaluation

Các kho mã nguồn mở đang theo dõi được gắn thẻ evaluation, sắp xếp theo số sao.

80 kho mã
  • evaluation-guidebook@huggingface

    Chia sẻ cả kiến thức thực tế và lý thuyết về đánh giá LLM mà chúng tôi thu thập được trong quá trình quản lý Open LLM Leaderboard và thiết kế lighteval!

    2.143+0Thay đổi số sao trong 7 ngày qua
  • avalanche@ContinualAI

    Avalanche: Thư viện toàn diện dành cho Học liên tục (Continual Learning) dựa trên PyTorch.

    2.088+0Thay đổi số sao trong 7 ngày qua
  • EvalAI@Cloud-CV

    :cloud: :rocket: :bar_chart: :chart_with_upwards_trend: Đánh giá trạng thái công nghệ tiên tiến nhất trong AI

    2.037-2Thay đổi số sao trong 7 ngày qua
  • alpaca_eval@tatsu-lab

    Trình đánh giá tự động cho các mô hình ngôn ngữ tuân theo hướng dẫn. Được xác thực bởi con người, chất lượng cao, chi phí rẻ và nhanh chóng.

    2.012+0Thay đổi số sao trong 7 ngày qua
  • AB3DMOT@xinshuoweng

    (IROS 2020, ECCVW 2020) Triển khai Python chính thức cho "3D Multi-Object Tracking: A Baseline and New Evaluation Metrics"

    1.846+1Thay đổi số sao trong 7 ngày qua
  • WFGY@onestardao

    WFGY đang hướng tới WFGY 5.0 Polaris Protocol, một bản phát hành mã nguồn mở lớn dành cho suy luận AI, RAG, agent và quy trình làm việc thực tế. Bao gồm Bản đồ vấn đề, Thẻ gỡ lỗi toàn cầu, WFGY 4.0 và Trứng phục sinh CFV.

    1.786+1Thay đổi số sao trong 7 ngày qua
  • EmoLLM@SmartFlowAI

    Mô hình ngôn ngữ lớn về sức khỏe tâm thần (LLM x Mental Health), Tiền huấn luyện & Tinh chỉnh, Bộ dữ liệu, Đánh giá, Triển khai & RAG, với các dòng mô hình InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM

    1.781+1Thay đổi số sao trong 7 ngày qua
  • trpc-agent-go@trpc-group

    Một Go framework để xây dựng các hệ thống agent môi trường sản xuất với luồng công việc dạng đồ thị, công cụ, bộ nhớ, A2A, AG-UI, MCP, đánh giá và khả năng quan sát.

    1.760+25Thay đổi số sao trong 7 ngày qua
  • ragbits@deepsense-ai

    Các khối xây dựng để phát triển nhanh chóng các ứng dụng GenAI

    1.668+0Thay đổi số sao trong 7 ngày qua
  • Trang GitHub chính thức cho bài báo khảo sát "A Survey on Evaluation of Large Language Models".

    1.608-1Thay đổi số sao trong 7 ngày qua
  • pycm@sepandhaghighi

    Thư viện ma trận nhầm lẫn đa lớp trong Python.

    1.506+0Thay đổi số sao trong 7 ngày qua
  • nlg-eval@Maluuba

    Mã nguồn đánh giá cho các số liệu tự động không giám sát khác nhau trong Natural Language Generation.

    1.391+0Thay đổi số sao trong 7 ngày qua
  • lispy@abo-abo

    Chỉnh sửa LISP ngắn gọn và tuyệt vời

    1.300+0Thay đổi số sao trong 7 ngày qua
  • xai@EthicalML

    XAI - Bộ công cụ giải thích cho machine learning

    1.260+1Thay đổi số sao trong 7 ngày qua
  • intellagent@plurai-ai

    Một framework để chuẩn đoán và tối ưu hóa toàn diện các tác nhân sử dụng các tương tác tổng hợp thực tế, được mô phỏng

    1.257+0Thay đổi số sao trong 7 ngày qua
  • KernelBench@ScalingIntelligence

    KernelBench: LLM có thể viết GPU Kernel không? - Bộ công cụ và benchmark với Torch -> CUDA (+ nhiều DSL khác)

    1.227+13Thay đổi số sao trong 7 ngày qua
  • kubetorch@run-house

    Phân phối và chạy các workload AI trên Kubernetes một cách kỳ diệu bằng Python, giống như PyTorch cho cơ sở hạ tầng ML.

    1.224+0Thay đổi số sao trong 7 ngày qua
  • fuzzbench@google

    FuzzBench - Dịch vụ đo lường hiệu năng fuzzer.

    1.206+0Thay đổi số sao trong 7 ngày qua
  • torch-fidelity@toshas

    Các chỉ số hiệu năng độ trung thực cao cho các mô hình tạo sinh trong PyTorch

    1.200+3Thay đổi số sao trong 7 ngày qua
  • Tracely-ai@Jwuthri

    CI/CD gốc truy vết cho các AI agent — các lỗi trong môi trường sản xuất trở thành các bài kiểm thử hồi quy chặn PR. Tự động phát hiện, phân cụm, đóng băng thành các ca khép kín, phát lại trong CI với giá $0.

    1.176+134Thay đổi số sao trong 7 ngày qua
  • ncalc@ncalc

    NCalc là một thư viện đánh giá biểu thức nhanh và nhẹ dành cho .NET, được thiết kế cho sự linh hoạt và hiệu suất cao. Nó hỗ trợ nhiều phép toán logic và toán học.

    1.156+2Thay đổi số sao trong 7 ngày qua
  • Gym@NVIDIA-NeMo

    Đánh giá và cải thiện các model và agent bằng cách sử dụng các môi trường

    1.155+13Thay đổi số sao trong 7 ngày qua
  • prometheus-eval@prometheus-eval

    Đánh giá phản hồi LLM của bạn với Prometheus và GPT4 💯

    1.111+0Thay đổi số sao trong 7 ngày qua
  • langsmith-sdk@langchain-ai

    Các triển khai LangSmith Client SDK.

    1.047+6Thay đổi số sao trong 7 ngày qua
  • API SemanticKITTI để trực quan hóa tập dữ liệu, xử lý dữ liệu và đánh giá kết quả.

    898+0Thay đổi số sao trong 7 ngày qua
  • deepfabric@nolabs-ai

    Tạo dữ liệu tổng hợp chất lượng cao, huấn luyện, đo lường và đánh giá trong một quy trình duy nhất.

    885+2Thay đổi số sao trong 7 ngày qua
  • ClawProBench@suyoumo

    ClawProBench là một bộ công cụ đánh giá trực tiếp dành cho các tác nhân LLM trong môi trường thực thi OpenClaw với khả năng chấm điểm xác định và độ tin cậy qua các lần thử nghiệm lặp lại.

    823+1Thay đổi số sao trong 7 ngày qua
  • OpenJudge@agentscope-ai

    OpenJudge: Một khung thống nhất để đánh giá toàn diện và khen thưởng chất lượng

    817+10Thay đổi số sao trong 7 ngày qua
  • gval@PaesslerAG

    Đánh giá biểu thức trong golang

    814+1Thay đổi số sao trong 7 ngày qua
  • web-codegen-scorer@angular

    Web Codegen Scorer là công cụ đánh giá chất lượng mã web được tạo bởi các mô hình LLM.

    775+5Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề