datasets
Các kho mã nguồn mở đang theo dõi được gắn thẻ datasets, sắp xếp theo số sao.
- #61★ 939+0Thay đổi số sao trong 7 ngày qua
- #62
theo dõi các tập dữ liệu y tế, tập trung vào hình ảnh y tế
★ 926+2Thay đổi số sao trong 7 ngày qua - #63
Backend cung cấp năng lượng cho trình xem tập dữ liệu trên các trang tập dữ liệu Hugging Face thông qua API công khai.
★ 900+1Thay đổi số sao trong 7 ngày qua - #64
Croissant là định dạng cấp cao dành cho tập dữ liệu máy học, kết hợp bốn lớp phong phú.
★ 897+5Thay đổi số sao trong 7 ngày qua - #65
🚀🚀🚀 Bộ sưu tập các dự án công khai ấn tượng về Mô hình ngôn ngữ lớn (LLM), Mô hình ngôn ngữ thị giác (VLM), Hành động ngôn ngữ thị giác (VLA), Nội dung do AI tạo (AIGC), cùng các bộ dữ liệu và ứng dụng liên quan.
★ 815+1Thay đổi số sao trong 7 ngày qua - #66
Các liên kết hữu ích về nội dung khác nhau liên quan đến AI, Thị giác máy tính và Robot.
★ 783+0Thay đổi số sao trong 7 ngày qua - #67★ 754+1Thay đổi số sao trong 7 ngày qua
- #68
Bộ sưu tập các tập dữ liệu prompt và tập dữ liệu hướng dẫn tuyệt vời để huấn luyện ChatLLM như chatgpt.
★ 744+1Thay đổi số sao trong 7 ngày qua - #69
Định dạng tệp mới và có khả năng mở rộng để lưu trữ các tập dữ liệu dạng cột lớn.
★ 733+2Thay đổi số sao trong 7 ngày qua - #70
Danh sách tổng hợp các bài báo, luận văn, tập dữ liệu và công cụ liên quan đến việc ứng dụng Machine Learning trong Kỹ thuật phần mềm
★ 733+0Thay đổi số sao trong 7 ngày qua - #71
Open Bandit Pipeline: một thư viện Python cho các thuật toán bandit và đánh giá off-policy
★ 708+1Thay đổi số sao trong 7 ngày qua - #72
Khung quản lý tập dữ liệu, một thư viện Python và công cụ CLI để xây dựng, phân tích và quản lý các tập dữ liệu thị giác máy tính.
★ 689+0Thay đổi số sao trong 7 ngày qua - #73
Chia sẻ logo, phương tiện, hình ảnh mẫu, trọng số mô hình được huấn luyện trước, dữ liệu tập hợp và tài sản phát hành của Ultralytics.
★ 665+5Thay đổi số sao trong 7 ngày qua - #74
Điểm chuẩn xử lý ngôn ngữ tự nhiên quy mô lớn đầu tiên cho tiếng Indonesia. Chúng tôi cung cấp nhiều tác vụ hạ nguồn, các mô hình IndoBERT đã được huấn luyện trước và mã nguồn khởi đầu! (AACL-IJCNLP 2020)
★ 655+1Thay đổi số sao trong 7 ngày qua - #75
Bộ sưu tập các tập dữ liệu cho phân đoạn / phát hiện độ nổi bật. Chào đón các PR.
★ 640+0Thay đổi số sao trong 7 ngày qua - #76
ExerciseDB API là một API cơ sở dữ liệu bài tập thể dục cho phép người dùng truy cập dữ liệu bài tập chất lượng cao gồm hơn 11.000 bài tập. API này cung cấp thông tin chi tiết về từng bài tập, bao gồm các bộ phận cơ thể mục tiêu, thiết bị cần thiết, video, ảnh gif, hình ảnh hướng dẫn trực quan và hướng dẫn từng bước.
★ 622+19Thay đổi số sao trong 7 ngày qua - #77
Kho lưu trữ này cung cấp danh sách toàn diện các tập dữ liệu vệ tinh radar và quang học được tuyển chọn cho các tác vụ phát hiện, phân loại, phân đoạn ngữ nghĩa và phân đoạn cá thể tàu thuyền. Các tập dữ liệu này lý tưởng cho các ứng dụng thị giác máy tính, học máy, viễn thám và phân tích hàng hải.
★ 606+0Thay đổi số sao trong 7 ngày qua - #78
Tài nguyên về các tập dữ liệu mô bệnh học.
★ 571+1Thay đổi số sao trong 7 ngày qua - #79
Cleora AI là mô hình mã nguồn mở đa năng giúp học các embedding thực thể ổn định và quy nạp một cách hiệu quả, có khả năng mở rộng cho dữ liệu quan hệ không đồng nhất. Được tạo bởi đội ngũ Synerise.com.
★ 541+1Thay đổi số sao trong 7 ngày qua - #80
Tổng hợp các tài nguyên hữu ích về tổng quát hóa miền (domain generalization), bao gồm bài báo, mã nguồn, v.v.
★ 539+1Thay đổi số sao trong 7 ngày qua - #81
Các bài báo và tập dữ liệu về tinh chỉnh và tuân thủ chỉ dẫn (Instruction Tuning and Following).
★ 511-1Thay đổi số sao trong 7 ngày qua