跳到主要内容
buildradar
Sign in
主题 · document-parsing

document-parsing

标记 document-parsing 主题、收录中的开源项目,按星标数排序。

项目数
13
总星标数
212,871
平均星标数
16,375
占比
0.01%

常跟 document-parsing 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 document-parsing 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • PaddleOCR@PaddlePaddle

    将 PDF 或图像文件转换为 AI 可用的结构化数据。轻量且功能强大的 OCR 工具套件,桥接图像/PDF 与 LLM,支持超过 100 种语言。

    88,730+276近 7 天星标变化
  • docling@docling-project

    让你的文档为生成式 AI 做好准备

    65,908+182近 7 天星标变化
  • opendataloader-pdf@opendataloader-project

    PDF 解析器,将数据转为 AI 可用格式。自动化 PDF 可访问性。开源。

    28,905+49近 7 天星标变化
  • unstructured@Unstructured-IO

    将文件轻松转换为结构化数据。Unstructured 是开源 ETL 解决方案,可将复杂文档转换为干净的结构化格式供语言模型使用。访问我们网站了解企业级平台产品,支持生产级工作流、分割、增强、切块与嵌入。

    15,381+19近 7 天星标变化
  • llama_cloud_services@run-llama

    云端中的知识代理与管理

    4,264+2近 7 天星标变化
  • ade-cli@landing-ai

    LandingAI 的 Agentic Document Extraction (ADE) 官方 CLI——从终端解析文档并提取符合架构的数据

    2,410+1近 7 天星标变化
  • ExtractThinker@enoch3712

    ExtractThinker 是一个针对 LLM 的文档智能库,提供 ORM 风格的交互以实现灵活且强大的文档工作流程。

    1,596+1近 7 天星标变化
  • docstrange@NanoNets

    通过智能结构化数据提取与先进 OCR 技术,从任何文件、图片、PDF、Word 文件、PPT 或网址中提取并将数据转换为多种格式(Markdown、JSON、CSV、HTML)。

    1,534+1近 7 天星标变化
  • OpenOCR@Topdu

    OpenOCR:一个用于通用 OCR 研究与应用的开源工具包,整合了统一的训练与评估基准、商业级 OCR 与文档解析系统,以及对多篇学术论文核心实现的忠实重现。

    1,441+2近 7 天星标变化
  • TurboOCR@aiptimizer

    TurboOCR,>200 img/s OmnidocBench。TensorRT FP16、PP-OCRv6、HTTP + gRPC

    1,060+20近 7 天星标变化
  • haiku.rag@ggozad

    用于本地与自托管文件搜索的 Agentic RAG:基于嵌入式 LanceDB 的混合检索、重排序与多模态 RAG,并整合 Docling 解析与 MCP 服务器

    601+14近 7 天星标变化
  • ParseBench@run-llama

    ParseBench - 用于 AI Agent 的文档解析基准测试。

    567+12近 7 天星标变化
  • NexusRAG@LeDat98

    Hybrid RAG system combining vector search, knowledge graph (LightRAG), and cross-encoder reranking — with Docling document parsing, visual intelligence (image/table captioning), agentic streaming chat, and inline citations. Powered by Gemini or local Ollama models.

    519+12近 7 天星标变化
← 返回主题列表