跳到主要内容
buildradar
登录
主题 · datasets

datasets

标记 datasets 主题、收录中的开源项目,按星标数排序。

共 81 个项目
  • commons@datasets

    DataHub 公共组件。有趣且重要的数据集

    941+2近 7 天星标变化
  • 追踪医疗数据集,专注于医学影像

    926+1近 7 天星标变化
  • dataset-viewer@huggingface

    通过公开 API 驱动 Hugging Face 数据集页面上数据集查看器的后端。

    899+0近 7 天星标变化
  • croissant@mlcommons

    Croissant 是一个用于机器学习数据集的高级格式,集成了四个丰富的层。

    898+5近 7 天星标变化
  • 🚀🚀🚀 收集一些关于大型语言模型(LLM)、视觉语言模型(VLM)、视觉语言动作(VLA)、AI 生成内容(AIGC)以及相关数据集与应用的优秀公开项目。

    813-1近 7 天星标变化
  • 关于 AI、计算机视觉与机器人的各类实用链接。

    784+1近 7 天星标变化
  • OpenML@openml

    开放式机器学习

    754+0近 7 天星标变化
  • 收录各种指令数据集与提示词数据集,用于训练 ChatLLM 等模型。

    744+1近 7 天星标变化
  • nimble@facebookincubator

    用于存储大型列式数据集的新型可扩展文件格式。

    733+3近 7 天星标变化
  • ml4se@saltudelft

    与机器学习应用于软件工程相关的论文、学位论文、数据集与工具精选清单

    733+0近 7 天星标变化
  • zr-obp@st-tech

    Open Bandit Pipeline:用于 bandit 算法与 off-policy 评估的 python 库

    709+2近 7 天星标变化
  • datumaro@open-edge-platform

    数据集管理框架,是用来构建、分析与管理 Computer Vision 数据集的 Python 程式库与 CLI 工具。

    689+2近 7 天星标变化
  • assets@ultralytics

    共享的 Ultralytics 徽标、媒体、示例图片、预训练模型权重、数据集产物与发布资产。

    667+4近 7 天星标变化
  • indonlu@IndoNLP

    针对印尼语的首个大型自然语言处理基准测试。我们提供多个下游任务、预训练的 IndoBERT 模型以及入门代码!(AACL-IJCNLP 2020)

    655+0近 7 天星标变化
  • 一些分割与显著性检测的数据集集合。欢迎 PR...:smile:

    640+0近 7 天星标变化
  • ExerciseDB API 是一个健身运动数据库 API,让用户能存取包含超过 11,000 种高质量运动资料。此 API 提供每个运动的详细资讯,包含目标肌肉群、所需器材、影片、动态图、视觉化指导图片以及逐步操作说明。

    630+18近 7 天星标变化
  • 这个仓库提供了一份全面的雷达与光学卫星数据集清单,专为船舶检测、分类、语义分割与实例分割任务而策划。这些数据集非常适合应用于计算机视觉、机器学习、遥感与海事分析领域。

    607+0近 7 天星标变化
  • 组织病理学数据集资源

    571+1近 7 天星标变化
  • cleora@BaseModelAI

    Cleora AI 是一个通用开源模型,用于高效、可扩展地学习异质关联数据的稳定与归纳式实体嵌入。由 Synerise.com 团队开发。

    544+2近 7 天星标变化
  • 关于领域泛化(Domain Generalization)的精选资源,包含论文、代码等

    539+0近 7 天星标变化
  • 关于指令微调 (Instruction Tuning) 与指令遵循 (Instruction Following) 的论文与数据集

    511+0近 7 天星标变化
← 返回主题列表