跳到主要内容
buildradar
Sign in
主题 · dataset

dataset

标记 dataset 主题、收录中的开源项目,按星标数排序。

项目数
148
总星标数
831,242
平均星标数
5,617
占比
0.04%

常跟 dataset 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 dataset 主题的项目。

  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    623
  • public-apis@public-apis

    免费 API 的汇总清单

    474,657+1,881近 7 天星标变化
  • label-studio@HumanSignal

    Label Studio 是一款多类型数据标注与注释工具,具标准化输出格式

    28,191+29近 7 天星标变化
  • exercises-dataset@hasaneyldrm

    1,324 练习健身数据集 — 动画 GIF、180×180 缩略图、肌肉群与设备数据,以及 6 种语言的逐步说明。LogPress 应用背后的练习数据层

    21,288+201近 7 天星标变化
  • faker@joke2k

    Faker 是一个用于生成假数据的 Python 包

    19,386+3近 7 天星标变化
  • cvat@cvat-ai

    Computer Vision Annotation Tool(CVAT)是构建高质量视觉数据集的领先平台,支持图像、视频与 3D 标注,提供开源、云端与企业版产品,以及标注服务,具备 AI 辅助标注、质量保证、团队协作、分析与开发者 API。

    16,636+18近 7 天星标变化
  • LaTeX-OCR@lukas-blecher

    pix2tex:使用 ViT 将方程式图片转换为 LaTeX 代码

    16,549+0近 7 天星标变化
  • easy-dataset@ConardLi

    用于创建 LLM 微调、RAG 与评估数据集的强大工具

    14,874+20近 7 天星标变化
  • doccano@doccano

    开源的机器学习标注工具

    10,762+2近 7 天星标变化
  • techniques@satellite-image-deep-learning

    卫星与航拍影像深度学习技术

    10,241+1近 7 天星标变化
  • 大规模中文自然语言处理语料库 Large Scale Chinese Corpus for NLP

    9,912+2近 7 天星标变化
  • MDN 上显示的 Web 技术浏览器兼容性数据

    5,736+6近 7 天星标变化
  • Awesome Pretrained Chinese NLP Models,高质量中文预训练模型、大模型、多模态模型与大语言模型集合。

    5,584+2近 7 天星标变化
  • 经过筛选的后训练数据集与工具清单

    4,760+1近 7 天星标变化
  • esProc@SPLWare

    esProc SPL 是一种基于 JVM 的编程语言,设计用于结构化数据计算,兼具数据分析工具与嵌入式计算引擎功能。

    4,686+2近 7 天星标变化
  • transformer@hyunwoongko

    Transformer:PyTorch 实作「Attention Is All You Need」

    4,651+3近 7 天星标变化
  • datasets@tensorflow

    TFDS 是一套可直接使用于 TensorFlow、Jax 等的资料集集合

    4,583+2近 7 天星标变化
  • img2dataset@rom1504

    轻松将大量图片网址转为图片数据集。可下载、调整尺寸并打包 100M 网址,单机 20 小时完成

    4,445+2近 7 天星标变化
  • 中文人名语料库。人名生成器。中文姓名、姓氏、名字、称呼、日本人名、翻译人名、英文人名。可用于中文分词、人名实体识别

    4,328+1近 7 天星标变化
  • sql-translator@whoiskatrin

    SQL Translator 是一个使用人工智能将自然语言查询转换为 SQL 代码的工具。此项目 100% 免费且开源

    4,321+0近 7 天星标变化
  • CLUE@CLUEbenchmark

    中文语言理解测评基准 Chinese Language Understanding Evaluation Benchmark:数据集、基线、预训练模型、语料库与排行榜

    4,278-1近 7 天星标变化
  • csghub@OpenCSGs

    CSGHub 是一个全新的开源平台,用于管理 LLM,开发者为 OpenCSG 团队。它提供开源与本地/ SaaS 解决方案,功能可与 Hugging Face 相比。完全掌控 LLM、数据集与代理的生命周期,Python SDK 兼容 Hugging Face。加入我们!⭐️

    4,104+3近 7 天星标变化
  • 📈 目前最大的工业缺陷检测数据库及论文集,持续整理开源数据集与关键论文,对表面缺陷研究极为重要。

    4,104+1近 7 天星标变化
  • 工业异常/瑕疵检测论文与数据集列表(持续更新)

    3,756+7近 7 天星标变化
  • 文字识别合成数据生成器

    3,693+2近 7 天星标变化
  • dataset@linhandev

    医学影像数据集列表 『An Index for Medical Imaging Datasets』

    3,606+1近 7 天星标变化
  • StringZilla@ashvardanian

    为 C、C++、CUDA、Python、Rust、Swift、JS 和 Go 提供高达 100 倍速的字符串处理,利用 NEON、AVX2、AVX-512、SVE、GPGPU 和 SWAR 来加速搜索、哈希、排序、编辑距离、sketches 和内存操作 🦖

    3,549+6近 7 天星标变化
  • waymo-open-dataset@waymo-research

    Waymo 开放数据集。

    3,404+4近 7 天星标变化
  • 从各种互联网来源提取数据到 pandas DataFrame。

    3,240+2近 7 天星标变化
  • color-names@meodai

    精心挑选的颜色名称大型列表 🌈

    2,987+3近 7 天星标变化
  • whylogs@whylabs

    用于机器学习模型和数据管道的开源数据日志库。📚 提供对数据质量和模型长期性能的可见性。🛡️ 支持隐私保护的数据收集,确保安全与鲁棒性。📈

    2,831+0近 7 天星标变化
← 返回主题列表