Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · dataset

dataset

Các kho mã nguồn mở đang theo dõi được gắn thẻ dataset, sắp xếp theo số sao.

Kho mã
148
Tổng số sao
831.242
Số sao trung bình
5.617
Tỷ trọng
0,04%

Những chủ đề thường xuất hiện cùng dataset trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ dataset.

  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594
  • public-apis@public-apis

    Danh sách tổng hợp các API miễn phí

    474.657+1.881Thay đổi số sao trong 7 ngày qua
  • label-studio@HumanSignal

    Label Studio là một công cụ gán nhãn và chú thích dữ liệu đa loại với định dạng đầu ra chuẩn hóa

    28.191+29Thay đổi số sao trong 7 ngày qua
  • exercises-dataset@hasaneyldrm

    Bộ dữ liệu thể hình gồm 1.324 bài tập — ảnh động GIF, ảnh thu nhỏ 180x180, dữ liệu nhóm cơ & thiết bị, và hướng dẫn từng bước bằng 6 ngôn ngữ. Lớp dữ liệu bài tập đằng sau ứng dụng LogPress.

    21.288+201Thay đổi số sao trong 7 ngày qua
  • faker@joke2k

    Faker là một gói Python tạo dữ liệu giả cho bạn.

    19.386+3Thay đổi số sao trong 7 ngày qua
  • cvat@cvat-ai

    Computer Vision Annotation Tool (CVAT) là nền tảng hàng đầu để xây dựng các tập dữ liệu trực quan chất lượng cao cho thị giác AI. Nó cung cấp các sản phẩm mã nguồn mở, đám mây và doanh nghiệp, cũng như các dịch vụ gán nhãn, dành cho việc chú thích hình ảnh, video và 3D với tính năng gán nhãn hỗ trợ bởi AI, đảm bảo chất lượng, cộng tác nhóm, phân tích và API dành cho nhà phát triển.

    16.636+18Thay đổi số sao trong 7 ngày qua
  • LaTeX-OCR@lukas-blecher

    pix2tex: Sử dụng ViT để chuyển đổi hình ảnh phương trình thành mã LaTeX.

    16.549+0Thay đổi số sao trong 7 ngày qua
  • easy-dataset@ConardLi

    Một công cụ mạnh mẽ để tạo tập dữ liệu cho việc tinh chỉnh LLM, RAG và Đánh giá (Eval)

    14.874+20Thay đổi số sao trong 7 ngày qua
  • doccano@doccano

    Công cụ chú thích mã nguồn mở dành cho các kỹ sư học máy.

    10.762+2Thay đổi số sao trong 7 ngày qua
  • techniques@satellite-image-deep-learning

    Các kỹ thuật học sâu với hình ảnh vệ tinh và trên không

    10.241+1Thay đổi số sao trong 7 ngày qua
  • Corpus tiếng Trung quy mô lớn dành cho NLP (Large Scale Chinese Corpus for NLP)

    9.912+2Thay đổi số sao trong 7 ngày qua
  • Dữ liệu tương thích trình duyệt cho các công nghệ Web được hiển thị trên MDN

    5.736+6Thay đổi số sao trong 7 ngày qua
  • Bộ sưu tập mô hình NLP tiếng Trung được huấn luyện trước chất lượng cao, mô hình lớn, mô hình đa phương thức và mô hình ngôn ngữ lớn

    5.584+2Thay đổi số sao trong 7 ngày qua
  • Danh sách được tuyển chọn các tập dữ liệu và công cụ cho quá trình hậu huấn luyện.

    4.760+1Thay đổi số sao trong 7 ngày qua
  • esProc@SPLWare

    esProc SPL là một ngôn ngữ lập trình dựa trên JVM được thiết kế để tính toán dữ liệu có cấu trúc, đóng vai trò là công cụ phân tích dữ liệu và công cụ tính toán nhúng.

    4.686+2Thay đổi số sao trong 7 ngày qua
  • transformer@hyunwoongko

    Transformer: Triển khai PyTorch của "Attention Is All You Need"

    4.651+3Thay đổi số sao trong 7 ngày qua
  • datasets@tensorflow

    TFDS là tập hợp các tập dữ liệu sẵn sàng sử dụng với TensorFlow, Jax, ...

    4.583+2Thay đổi số sao trong 7 ngày qua
  • img2dataset@rom1504

    Dễ dàng chuyển đổi các tập hợp lớn URL hình ảnh thành một bộ dữ liệu hình ảnh. Có thể tải xuống, thay đổi kích thước và đóng gói 100 triệu URL trong 20 giờ trên một máy duy nhất.

    4.445+2Thay đổi số sao trong 7 ngày qua
  • Kho ngữ liệu tên tiếng Trung. Trình tạo tên người. Họ, tên, cách gọi tiếng Trung, tên tiếng Nhật, tên dịch, tên tiếng Anh. Có thể dùng cho việc tách từ tiếng Trung và nhận dạng thực thể tên người.

    4.328+1Thay đổi số sao trong 7 ngày qua
  • sql-translator@whoiskatrin

    SQL Translator là một công cụ chuyển đổi truy vấn ngôn ngữ tự nhiên thành mã SQL bằng trí tuệ nhân tạo. Dự án này hoàn toàn miễn phí và mã nguồn mở.

    4.321+0Thay đổi số sao trong 7 ngày qua
  • CLUE@CLUEbenchmark

    Tiêu chuẩn đánh giá hiểu ngôn ngữ tiếng Trung (Chinese Language Understanding Evaluation Benchmark): bộ dữ liệu, baseline, mô hình tiền huấn luyện, ngữ liệu và bảng xếp hạng

    4.278-1Thay đổi số sao trong 7 ngày qua
  • 📈 Cơ sở dữ liệu và tài liệu nghiên cứu về phát hiện lỗi công nghiệp lớn nhất hiện nay. Liên tục tổng hợp các tập dữ liệu mã nguồn mở và các bài báo quan trọng trong lĩnh vực nghiên cứu lỗi bề mặt.

    4.104+1Thay đổi số sao trong 7 ngày qua
  • csghub@OpenCSGs

    CSGHub là một nền tảng mã nguồn mở hoàn toàn mới để quản lý LLM, được phát triển bởi đội ngũ OpenCSG. Cung cấp cả giải pháp mã nguồn mở và on-premise/SaaS, với các tính năng có thể so sánh với Hugging Face. Kiểm soát toàn bộ vòng đời của LLM, tập dữ liệu và tác nhân, tương thích Python SDK với Hugging Face. Tham gia cùng chúng tôi! ⭐️

    4.104+3Thay đổi số sao trong 7 ngày qua
  • Danh sách tài liệu nghiên cứu và tập dữ liệu về phát hiện bất thường/lỗi hình ảnh công nghiệp (đang cập nhật).

    3.756+7Thay đổi số sao trong 7 ngày qua
  • Trình tạo dữ liệu tổng hợp cho nhận dạng văn bản

    3.693+2Thay đổi số sao trong 7 ngày qua
  • dataset@linhandev

    Danh sách tập dữ liệu hình ảnh y khoa 『An Index for Medical Imaging Datasets』

    3.606+1Thay đổi số sao trong 7 ngày qua
  • StringZilla@ashvardanian

    Chuỗi ký tự nhanh hơn tới 100 lần cho C, C++, CUDA, Python, Rust, Swift, JS, & Go, tận dụng NEON, AVX2, AVX-512, SVE, GPGPU, & SWAR để tăng tốc tìm kiếm, băm, sắp xếp, khoảng cách chỉnh sửa, bản phác thảo và các thao tác bộ nhớ 🦖

    3.549+6Thay đổi số sao trong 7 ngày qua
  • waymo-open-dataset@waymo-research

    Bộ dữ liệu mở Waymo

    3.404+4Thay đổi số sao trong 7 ngày qua
  • Trích xuất dữ liệu từ nhiều nguồn Internet khác nhau vào pandas DataFrame.

    3.240+2Thay đổi số sao trong 7 ngày qua
  • color-names@meodai

    Danh sách lớn các tên màu được tuyển chọn thủ công 🌈

    2.987+3Thay đổi số sao trong 7 ngày qua
  • whylogs@whylabs

    Thư viện ghi nhật ký dữ liệu mã nguồn mở cho các mô hình machine learning và data pipeline. 📚 Cung cấp khả năng hiển thị chất lượng dữ liệu & hiệu suất mô hình theo thời gian. 🛡️ Hỗ trợ thu thập dữ liệu bảo vệ quyền riêng tư, đảm bảo an toàn & tính mạnh mẽ. 📈

    2.831+0Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề