跳到主要內容
buildradar
登入
主題 · dataset

dataset

標記 dataset 主題、收錄中的開源專案,依星數排序。

專案數
148
總星數
831,242
平均星數
5,617
佔比
0.04%

常跟 dataset 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 dataset 主題的專案。

  • SkillCorpus@EverMind-AI

    Open-source infrastructure that turns scattered SKILL.md files into curated, retrieval-ready agent-skill corpora—with retrieval and evaluation tooling included.

    646
  • public-apis@public-apis

    免費 API 的彙總清單

    474,657+0近 7 天星數變化
  • label-studio@HumanSignal

    Label Studio 是一款多類型資料標註與註解工具,具標準化輸出格式

    28,191+0近 7 天星數變化
  • exercises-dataset@hasaneyldrm

    1,324 练习健身数据集 — 动画 GIF、180×180 缩略图、肌肉群与设备数据,以及 6 种语言的逐步说明。LogPress 应用背后的练习数据层

    21,288+0近 7 天星數變化
  • faker@joke2k

    Faker 是一個用於產生假資料的 Python 套件

    19,386+0近 7 天星數變化
  • cvat@cvat-ai

    Computer Vision Annotation Tool(CVAT)是建構高品質視覺資料集的領先平台,支援影像、影片與 3D 標註,提供開源、雲端與企業版產品,以及標註服務,具備 AI 輔助標註、品質保證、團隊協作、分析與開發者 API。

    16,636+0近 7 天星數變化
  • LaTeX-OCR@lukas-blecher

    pix2tex:使用 ViT 將方程式圖片轉換為 LaTeX 代碼

    16,549+0近 7 天星數變化
  • easy-dataset@ConardLi

    用於建立 LLM 微調、RAG 與評估資料集的強大工具

    14,874+0近 7 天星數變化
  • doccano@doccano

    開源的機器學習標註工具

    10,762+0近 7 天星數變化
  • techniques@satellite-image-deep-learning

    衛星與航拍影像深度學習技術

    10,241+0近 7 天星數變化
  • 大規模中文自然語言處理語料庫 Large Scale Chinese Corpus for NLP

    9,912+0近 7 天星數變化
  • MDN 所展示的 Web 技術瀏覽器相容性資料

    5,736+0近 7 天星數變化
  • Awesome Pretrained Chinese NLP Models,高品質中文預訓練模型、 大模型、多模態模型與大語言模型集合。

    5,584+0近 7 天星數變化
  • 經過篩選的後訓練資料集與工具清單

    4,760+0近 7 天星數變化
  • esProc@SPLWare

    esProc SPL 是一種基於 JVM 的程式語言,設計用於結構化資料計算,兼具資料分析工具與嵌入式計算引擎功能。

    4,686+0近 7 天星數變化
  • transformer@hyunwoongko

    Transformer:PyTorch 實作「Attention Is All You Need」

    4,651+0近 7 天星數變化
  • datasets@tensorflow

    TFDS 是一套可直接使用於 TensorFlow、Jax 等的資料集集合

    4,583+0近 7 天星數變化
  • img2dataset@rom1504

    輕鬆將大量圖片網址轉為圖片資料集。可下載、調整尺寸並打包 100M 網址,單機 20 小時完成

    4,445+0近 7 天星數變化
  • 中文人名語料庫。人名生成器。中文姓名、姓氏、名字、稱呼、日本人名、翻譯人名、英文人名。可用於中文分詞、人名實體識別

    4,328+0近 7 天星數變化
  • sql-translator@whoiskatrin

    SQL Translator 是一個使用人工智慧將自然語言查詢轉換為 SQL 代碼的工具。此專案 100% 免費且開源

    4,321+0近 7 天星數變化
  • CLUE@CLUEbenchmark

    中文語言理解測評基準 Chinese Language Understanding Evaluation Benchmark:資料集、基線、預訓練模型、語料庫與排行榜

    4,278+0近 7 天星數變化
  • csghub@OpenCSGs

    CSGHub 是一個全新的開源平台,用於管理 LLM,開發者為 OpenCSG 團隊。它提供開源與本地/ SaaS 解決方案,功能可與 Hugging Face 相比。完全掌控 LLM、資料集與代理的生命周期,Python SDK 兼容 Hugging Face。加入我們!⭐️

    4,104+0近 7 天星數變化
  • 📈 目前最大的工業缺陷檢測資料庫及論文集,持續整理開源資料集與關鍵論文,對表面缺陷研究極為重要。

    4,104+0近 7 天星數變化
  • 工業異常/瑕疵檢測論文與資料集列表(持續更新)

    3,756+0近 7 天星數變化
  • 文字辨識合成資料生成器

    3,693+0近 7 天星數變化
  • dataset@linhandev

    醫學影像資料集列表 『An Index for Medical Imaging Datasets』

    3,606+0近 7 天星數變化
  • StringZilla@ashvardanian

    為 C、C++、CUDA、Python、Rust、Swift、JS 和 Go 提供高達 100 倍速的字串處理,利用 NEON、AVX2、AVX-512、SVE、GPGPU 和 SWAR 來加速搜尋、雜湊、排序、編輯距離、sketches 和記憶體操作 🦖

    3,549+0近 7 天星數變化
  • waymo-open-dataset@waymo-research

    Waymo 開放資料集。

    3,404+0近 7 天星數變化
  • 从各种互联网来源提取数据到 pandas DataFrame。

    3,240+0近 7 天星數變化
  • color-names@meodai

    精心挑選的顏色名稱大型列表 🌈

    2,987+0近 7 天星數變化
  • whylogs@whylabs

    用於機器學習模型與資料管道的開源資料記錄函式庫。📚 提供對資料品質與模型長期效能的可視性。🛡️ 支援保護隱私的資料收集,確保安全與穩健性。📈

    2,831+0近 7 天星數變化
← 返回主題列表