跳到主要內容
buildradar
Sign in
主題 · dataset

dataset

標記 dataset 主題、收錄中的開源專案,依星數排序。

共 148 個專案
  • WhatsMyName@WebBreacher

    由社群維護的 700 多個網站資料集,可用於透過使用者名稱尋找帳號——支援 OSINT 與數位足跡工具。

    2,820+13近 7 天星數變化
  • datasets@unsplash

    🎁 超過 7,400,000 張 Unsplash 圖片,可用於研究與機器學習

    2,783+3近 7 天星數變化
  • CCPD@detectRecog

    [ECCV 2018] CCPD:一個多樣化且標註良好的車牌檢測與識別資料集

    2,651+4近 7 天星數變化
  • colour@colour-science

    適用於 Python 的色彩科學

    2,647+4近 7 天星數變化
  • 中文醫學 NLP 公開資源整理:術語集/語料庫/詞向量/預訓練模型/知識圖譜/命名實體識別/QA/資訊抽取/模型/論文/etc

    2,627+2近 7 天星數變化
  • 180 個免費的 CSS3、Figma、Sketch 與 PSD 漸層 —— 另外包含適用於設計工具、產生器和 AI agent 的 JSON 資料集。

    2,473+0近 7 天星數變化
  • 將 ISO 3166-1 國家列表與聯合國地理方案 (UN Geoscheme) 區域代碼合併,提供即用型的 JSON、XML、CSV 資料集

    2,470-1近 7 天星數變化
  • Objectron@google-research-datasets

    Objectron 是一個以物件為中心的短影片片段資料集。此外,這些影片還包含 AR 工作階段元資料,包括相機姿態、稀疏點雲和平面。在每個影片中,相機在物件周圍和上方移動,從不同視角捕捉它。每個物件都標註了 3D 邊界框。3D 邊界框描述了物件的位置、方向和尺寸

    2,349+0近 7 天星數變化
  • 用於遙測變化檢測的資料集、工具、方法、綜述論文與競賽的全面且最新彙整。

    2,315+3近 7 天星數變化
  • beir@beir-cellar

    一個資訊檢索的異質基準測試。簡單易用,可在 15 個以上不同的 IR 資料集上評估您的模型。

    2,283+5近 7 天星數變化
  • voice_datasets@jim-schwoebel

    🔊 語音與聲音運算開源資料集的完整清單(95+ 個資料集)。

    2,223+1近 7 天星數變化
  • 一個全域的公有領域地圖資料集,提供三種比例尺,並具備緊密整合的向量與光柵資料。

    2,192+2近 7 天星數變化
  • clusterdata@alibaba

    收集自阿里巴巴生產環境叢集的叢集資料,用於叢集管理研究

    2,176+12近 7 天星數變化
  • universal-data-tool@UniversalDataTool

    透過簡單的網頁介面或桌面應用程式,協作並標註任何類型的資料、影像、文字或文件。

    2,071-1近 7 天星數變化
  • fastdup@visual-layer

    fastdup 是一款強大且免費的工具,旨在從影像與影片資料集中快速產生有價值的洞見。它有助於提高影像和標籤的品質,同時大幅降低資料維運成本,並具備無與倫比的可擴充性。

    1,906-1近 7 天星數變化
  • 基於圖/Transformer 的詐欺、異常與離群值偵測論文與資源精選列表

    1,889+0近 7 天星數變化
  • 精選的雷達資料集、偵測、追蹤與融合資源列表

    1,880+1近 7 天星數變化
  • ESC-50@karolpiczak

    ESC-50:環境音訊分類資料集

    1,865+3近 7 天星數變化
  • 與 Deepfake 檢測相關的工具、論文和程式碼清單

    1,823+4近 7 天星數變化
  • 越南行政單位的全面性 SQL 與 GIS 資料集,包含省份、地區、坊/社以及地理空間邊界。

    1,784+4近 7 天星數變化
  • EmoLLM@SmartFlowAI

    心理健康大模型 (LLM x Mental Health), Pre & Post-training & Dataset & Evaluation & Depoly & RAG, 搭配 InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM 系列模型

    1,781+1近 7 天星數變化
  • VBench@Vchitect

    [CVPR2024 Highlight] VBench - 我們評估影片生成

    1,757+7近 7 天星數變化
  • Jackrong-llm-finetuning-guide@R6410418
    1,672+4近 7 天星數變化
  • DataProfiler@capitalone

    你的資料裡有什麼?從資料集中萃取 Schema、統計數據與實體

    1,579+0近 7 天星數變化
  • streaming@mosaicml

    用於高效神經網路訓練的資料串流函式庫

    1,554+2近 7 天星數變化
  • HumanML3D@EricGuo5513

    HumanML3D:一個大型且多樣化的 3D 人體動作語言資料集。

    1,524+2近 7 天星數變化
  • chatterbot-corpus@gunthercox

    一個多語言對話語料庫

    1,417+0近 7 天星數變化
  • MedMNIST@MedMNIST

    [pip install medmnist] 用於 2D 與 3D 生物醫學影像分類的 18 個標準化資料集

    1,399+0近 7 天星數變化
  • 公司名語料庫。機構名語料庫。公司簡稱、縮寫、品牌詞、企業名。可用於中文分詞、機構名實體識別。

    1,296+0近 7 天星數變化
  • RecSysDatasets@RUCAIBox

    這是推薦系統 (RS) 的公開資料來源儲存庫。

    1,255-3近 7 天星數變化
← 返回主題列表