跳到主要内容
buildradar
登录
主题 · dataset

dataset

标记 dataset 主题、收录中的开源项目,按星标数排序。

共 148 个项目
  • 自 2020 年以来的公开 BTC 交易背景上下文。

    1,216+0近 7 天星标变化
  • M2DGR@SJTU-ViSYS

    M2DGR:一个地面机器人的多模态与多场景数据集(RA-L2021 & ICRA2022)

    1,201+0近 7 天星标变化
  • chat-dataset-baseline@hikariming

    人工精调的中文对话数据集和一段 chatglm 的微调代码

    1,191+0近 7 天星标变化
  • torchxrayvision@mlmed

    TorchXRayVision:胸部 X 光数据集与模型的库。包含分类器、分割与自动编码器。

    1,188+0近 7 天星标变化
  • covid-19@datasets

    2019 年新型冠状病毒病例时间序列数据

    1,165+0近 7 天星标变化
  • domains@tb0hdan

    全球单一最大互联网域数据集

    1,157+0近 7 天星标变化
  • Twitter 数据集及相关资源列表。

    1,125+0近 7 天星标变化
  • game-datasets@leomaurodesenv

    :video_game: 精选的优秀游戏数据集清单,以及用于游戏人工智能的工具

    1,118+6近 7 天星标变化
  • SoundMind@xid32

    我们介绍了音频逻辑推理(ALR)数据集,包含 6,446 个专为复杂推理任务设计的文本-音频标注样本。基于此资源,我们提出了 SoundMind,这是一种量身打造的基于规则的强化学习(RL)算法,旨在赋予音频语言模型(ALMs)深度双模态推理能力。

    1,113+0近 7 天星标变化
  • insuranceqa-corpus-zh@chatopera

    :helicopter: 保险行业语料库,聊天机器人

    1,064-1近 7 天星标变化
  • hagrid@hukenovs

    手势识别图像数据集

    1,059+6近 7 天星标变化
  • TransportationNetworks@bstabler

    用于研究的交通网络

    1,051+2近 7 天星标变化
  • MMSA@thuiar

    MMSA 是一个用于多模态情感分析的统一框架。

    1,046+2近 7 天星标变化
  • name-dataset@philipperemy

    用于生成姓名的 Python 库

    1,019+0近 7 天星标变化
  • ThoughtSource@OpenBioLink

    大型语言模型中思维链推理相关数据与工具的中央开源资源。由 Samwald 研究群开发:https://samwald.info/

    1,015+0近 7 天星标变化
  • 精选的生物力学与人体动作分析公开资源列表:数据集、处理工具、模拟软件、教育视频、讲座等。

    1,010+0近 7 天星标变化
  • githut@madnight

    Github 语言统计

    1,004-1近 7 天星标变化
  • Mobius@microsoft

    Apache Spark 的 C# 与 F# 语言绑定与扩展

    948+0近 7 天星标变化
  • OmniAnomaly@NetManAIOps

    KDD 2019:通过随机循环神经网络实现多元时间序列的鲁棒异常检测

    948+3近 7 天星标变化
  • semantic-segmentation@sithu31296

    基于 PyTorch 的 SOTA 语义分割模型

    942+0近 7 天星标变化
  • tfrecord@vahidk

    独立的 TFRecord 读取/写入器,搭配 PyTorch 数据加载器使用

    902+0近 7 天星标变化
  • 用于可视化数据集、处理数据及评估结果的 SemanticKITTI API。

    899+4近 7 天星标变化
  • deepfabric@nolabs-ai

    在单一管线中生成高质量合成数据、训练、测量与评估

    885+1近 7 天星标变化
  • magpie@magpie-align

    [ICLR 2025] 通过提示已对齐的 LLMs 从零开始进行对齐数据合成。您的高效且高质量合成数据生成管线!

    882+3近 7 天星标变化
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA:电脑使用代理的开放基础

    834+2近 7 天星标变化
  • MINT-1T@mlfoundations

    🍃 MINT-1T:一个包含一万亿个 token 的多模态交错数据集。

    833+1近 7 天星标变化
  • PrimeKG@mims-harvard

    精准医疗知识图谱 (PrimeKG)

    823+3近 7 天星标变化
  • opendata@NationalGalleryOfArt

    国家美术馆开放数据计划

    820+6近 7 天星标变化
  • pycococreator@waspinator

    用于创建 COCO 数据集的辅助函数

    783-1近 7 天星标变化
  • Total-Text-Dataset@cs-chan

    Total Text 数据集。包含 1555 张图像,具备三种以上的文字方向:水平、多方向与弯曲,是独一无二的数据集。

    771-1近 7 天星标变化
← 返回主题列表