跳到主要內容
buildradar
Sign in
主題 · document-analysis

document-analysis

標記 document-analysis 主題、收錄中的開源專案,依星數排序。

專案數
12
總星數
104,057
平均星數
8,671
佔比
0.01%

常跟 document-analysis 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 document-analysis 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • MinerU@opendatalab

    將複雜文件(如 PDF 與 Office 文件)轉換為適合 LLM 使用的 markdown/JSON,以供 Agentic 工作流程使用。

    79,045+298近 7 天星數變化
  • Dolphin@bytedance

    “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting” 官方倉庫,ACL,2025 年

    9,049+0近 7 天星數變化
  • docetl@ucbepic

    基於 LLM 的代理式資料處理與 ETL 系統

    4,074+34近 7 天星數變化
  • PdfPig@UglyToad

    在 C# 中讀取並提取 PDF 的文字與其他內容(PDFBox 的移植版)

    2,556+4近 7 天星數變化
  • docext@NanoNets

    本地部署、無需 OCR 的非結構化資料萃取、Markdown 轉換與基準測試工具包。(https://idp-leaderboard.org/)

    2,086-1近 7 天星數變化
  • AdvancedLiterateMachinery@AlibabaResearch

    朝向先進文學機器(Advanced Literate Machinery)的原創創新點子與演算法集合。本專案由阿里巴巴集團通義實驗室語言技術實驗室 OCR 團隊維護。

    1,835+1近 7 天星數變化
  • documind@DocumindHQ

    使用 AI 從文件中萃取結構化資料的開源平台。

    1,520-1近 7 天星數變化
  • OpenOCR@Topdu

    OpenOCR:一個用於通用 OCR 研究與應用的開源工具包,整合了統一的訓練與評估基準、商業級 OCR 與文件解析系統,以及對多篇學術論文核心實作的忠實重現。

    1,441+2近 7 天星數變化
  • dedoc@ispras

    Dedoc 是一個用於自動化解析文件並將其轉換為統一格式的函式庫(服務)。它能自動從電子文字文件中提取內容、邏輯結構、表格和元資訊。(文件解析;文件內容提取;邏輯結構提取;PDF 解析器;掃描文件解析器;DOCX 解析器;HTML 解析器)

    733+1近 7 天星數變化
  • MinerU-Diffusion@opendatalab

    [ECCV 2026] 一種基於擴散模型的文件 OCR 框架,以區塊級平行擴散解碼取代自回歸解碼

    615+0近 7 天星數變化
  • PICK-pytorch@wenwenyu

    論文「PICK: Processing Key Information Extraction from Documents using Improved Graph Learning-Convolutional Networks」(ICPR 2020) 程式碼

    570+0近 7 天星數變化
  • assemblyline@CybercentreCanada

    AssemblyLine 4:檔案分類與惡意軟體分析

    534+3近 7 天星數變化
← 返回主題列表