跳到主要内容
buildradar
Sign in
主题 · document-analysis

document-analysis

标记 document-analysis 主题、收录中的开源项目,按星标数排序。

项目数
12
总星标数
104,057
平均星标数
8,671
占比
0.01%

常跟 document-analysis 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 document-analysis 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • MinerU@opendatalab

    将复杂文件(如 PDF 与 Office 文件)转换为适合 LLM 使用的 markdown/JSON,以供 Agentic 工作流程使用。

    79,045+298近 7 天星标变化
  • Dolphin@bytedance

    “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting” 官方仓库,ACL,2025 年

    9,049+0近 7 天星标变化
  • docetl@ucbepic

    基于 LLM 的代理式数据处理与 ETL 系统

    4,074+34近 7 天星标变化
  • PdfPig@UglyToad

    在 C# 中读取并提取 PDF 的文字与其他内容(PDFBox 的移植版)

    2,556+4近 7 天星标变化
  • docext@NanoNets

    本地部署、无需 OCR 的非结构化数据提取、Markdown 转换与基准测试工具包。(https://idp-leaderboard.org/)

    2,086-1近 7 天星标变化
  • AdvancedLiterateMachinery@AlibabaResearch

    朝向高级文学机器(Advanced Literate Machinery)的原创创新点子与算法集合。本项目由阿里巴巴集团通义实验室语言技术实验室 OCR 团队维护。

    1,835+1近 7 天星标变化
  • documind@DocumindHQ

    使用 AI 从文件中提取结构化数据的开源平台。

    1,520-1近 7 天星标变化
  • OpenOCR@Topdu

    OpenOCR:一个用于通用 OCR 研究与应用的开源工具包,整合了统一的训练与评估基准、商业级 OCR 与文档解析系统,以及对多篇学术论文核心实现的忠实重现。

    1,441+2近 7 天星标变化
  • dedoc@ispras

    Dedoc 是一个用于自动化解析文件并将其转换为统一格式的库(服务)。它能自动从电子文字文件中提取内容、逻辑结构、表格和元信息。(文件解析;文件内容提取;逻辑结构提取;PDF 解析器;扫描文件解析器;DOCX 解析器;HTML 解析器)

    733+1近 7 天星标变化
  • MinerU-Diffusion@opendatalab

    [ECCV 2026] 一种基于扩散模型的文件 OCR 框架,以区块级并行扩散解码取代自回归解码

    615+0近 7 天星标变化
  • PICK-pytorch@wenwenyu

    论文“PICK: Processing Key Information Extraction from Documents using Improved Graph Learning-Convolutional Networks”(ICPR 2020) 代码

    570+0近 7 天星标变化
  • assemblyline@CybercentreCanada

    AssemblyLine 4:文件分类与恶意软件分析

    534+3近 7 天星标变化
← 返回主题列表