본문으로 건너뛰기
buildradar
Sign in
토픽 · dataset

dataset

dataset 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
148
총 스타
831,242
평균 스타
5,617
비중
0.04%

같은 리포지토리에 dataset 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 dataset 태그가 달린 리포지토리예요.

  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    594
  • public-apis@public-apis

    무료 API 모음 리스트

    474,657+1,881최근 7일 스타 변화
  • label-studio@HumanSignal

    Label Studio는 표준화된 출력 포맷을 제공하는 멀티 타입 데이터 라벨링 및 주석 도구입니다.

    28,191+29최근 7일 스타 변화
  • exercises-dataset@hasaneyldrm

    1,324개의 운동 데이터셋 — 애니메이션 GIF, 180×180 썸네일, 근육 그룹 및 장비 데이터, 6개 국어의 단계별 설명. LogPress 앱의 백엔드 운동 데이터 레이어.

    21,288+201최근 7일 스타 변화
  • faker@joke2k

    Faker는 가짜 데이터를 생성해 주는 파이썬 패키지입니다.

    19,386+3최근 7일 스타 변화
  • cvat@cvat-ai

    Computer Vision Annotation Tool (CVAT)은 비전 AI를 위한 고품질 시각적 데이터셋 구축을 지원하는 선도적인 플랫폼입니다. AI 보조 라벨링, 품질 보증, 팀 협업, 분석, 개발자 API를 통해 이미지, 비디오, 3D 어노테이션을 위한 오픈소스, 클라우드, 엔터프라이즈 제품 및 라벨링 서비스를 제공합니다.

    16,636+18최근 7일 스타 변화
  • LaTeX-OCR@lukas-blecher

    pix2tex: ViT를 사용하여 수식 이미지를 LaTeX 코드로 변환

    16,549+0최근 7일 스타 변화
  • easy-dataset@ConardLi

    LLM 파인튜닝, RAG, 평가를 위한 데이터셋 생성을 지원하는 강력한 도구

    14,874+20최근 7일 스타 변화
  • doccano@doccano

    머신러닝 실무자를 위한 오픈소스 주석(어노테이션) 도구입니다.

    10,762+2최근 7일 스타 변화
  • techniques@satellite-image-deep-learning

    위성 및 항공 이미지 기반 딥러닝 기법

    10,241+1최근 7일 스타 변화
  • 대규모 중국어 자연어 처리 말뭉치

    9,912+2최근 7일 스타 변화
  • MDN에 표시되는 웹 기술용 브라우저 호환성 데이터

    5,736+6최근 7일 스타 변화
  • 멋진 사전 학습된 중국어 NLP 모델, 고품질 중국어 사전 학습 모델 및 대형 모델, 멀티모달 모델, 대형 언어 모델 모음

    5,584+2최근 7일 스타 변화
  • 사후 학습을 위한 데이터셋 및 도구 선별 목록

    4,760+1최근 7일 스타 변화
  • esProc@SPLWare

    esProc SPL은 구조화된 데이터 연산을 위해 설계된 JVM 기반 프로그래밍 언어로, 데이터 분석 도구이자 임베디드 컴퓨팅 엔진 역할을 합니다.

    4,686+2최근 7일 스타 변화
  • transformer@hyunwoongko

    Transformer: "Attention Is All You Need" 논문의 PyTorch 구현체

    4,651+3최근 7일 스타 변화
  • datasets@tensorflow

    TFDS는 TensorFlow, Jax 등과 함께 사용할 수 있는 데이터셋 모음입니다.

    4,583+2최근 7일 스타 변화
  • img2dataset@rom1504

    대규모 이미지 URL 세트를 이미지 데이터셋으로 쉽게 변환합니다. 단일 머신에서 20시간 만에 1억 개의 URL을 다운로드, 크기 조정 및 패키징할 수 있습니다.

    4,445+2최근 7일 스타 변화
  • 중국어 인명 말뭉치. 인명 생성기. 중국어 성명, 성, 이름, 호칭, 일본어 인명, 번역된 인명, 영문 인명. 중국어 형태소 분석 및 개체명 인식에 사용 가능.

    4,328+1최근 7일 스타 변화
  • sql-translator@whoiskatrin

    SQL Translator는 인공지능을 사용하여 자연어 쿼리를 SQL 코드로 변환하는 도구입니다. 이 프로젝트는 100% 무료 오픈소스입니다.

    4,321+0최근 7일 스타 변화
  • CLUE@CLUEbenchmark

    중국어 언어 이해 평가 벤치마크: 데이터셋, 베이스라인, 사전 학습된 모델, 코퍼스 및 리더보드

    4,278-1최근 7일 스타 변화
  • csghub@OpenCSGs

    CSGHub은 OpenCSG 팀이 개발한 LLM 관리를 위한 새로운 오픈소스 플랫폼입니다. Hugging Face에 필적하는 기능을 갖춘 오픈소스 및 온프레미스/SaaS 솔루션을 제공합니다. Hugging Face와 호환되는 Python SDK를 통해 LLM, 데이터셋, 에이전트의 라이프사이클을 완전히 제어할 수 있습니다. 참여해 주세요! ⭐️

    4,104+3최근 7일 스타 변화
  • 📈 현재 가장 큰 규모의 산업용 결함 검출 데이터베이스 및 논문 모음. 표면 결함 연구 분야에서 중요한 오픈소스 데이터베이스와 핵심 논문을 지속적으로 요약합니다.

    4,104+1최근 7일 스타 변화
  • 산업용 이미지 이상/결함 탐지를 위한 논문 목록 및 데이터셋(지속적으로 업데이트됨).

    3,756+7최근 7일 스타 변화
  • 텍스트 인식을 위한 합성 데이터 생성기

    3,693+2최근 7일 스타 변화
  • dataset@linhandev

    의학 영상 데이터셋 목록 'An Index for Medical Imaging Datasets'

    3,606+1최근 7일 스타 변화
  • StringZilla@ashvardanian

    NEON, AVX2, AVX-512, SVE, GPGPU 및 SWAR을 활용하여 검색, 해싱, 정렬, 편집 거리, 스케치, 메모리 작업을 가속화하며 C, C++, CUDA, Python, Rust, Swift, JS 및 Go에서 최대 100배 빠른 문자열 처리 🦖

    3,549+6최근 7일 스타 변화
  • waymo-open-dataset@waymo-research

    Waymo 오픈 데이터셋

    3,404+4최근 7일 스타 변화
  • 다 다양한 인터넷 소스의 데이터를 pandas DataFrame으로 추출

    3,240+2최근 7일 스타 변화
  • color-names@meodai

    엄선된 색상 이름 모음 🌈

    2,987+3최근 7일 스타 변화
  • whylogs@whylabs

    머신러닝 모델 및 데이터 파이프라인을 위한 오픈소스 데이터 로깅 라이브러리 📚 시간에 따른 데이터 품질 및 모델 성능에 대한 가시성 제공 🛡️ 개인정보 보호를 지원하는 데이터 수집으로 안전성과 견고성 보장 📈

    2,831+0최근 7일 스타 변화
← 토픽 목록으로