text-extraction
标记 text-extraction 主题、收录中的开源项目,按星标数排序。
相关主题
常跟 text-extraction 一起出现在同一个项目上的主题。
近期新秀
近 90 天内创建、标记 text-extraction 主题的项目。
近 90 天内还没有新项目标记这个主题。
- #1
快速的 Rust PDF 检测、分类与文字提取库,能智能辨别扫描版与文字版 PDF,帮助做出智能路由决策。
★ 18,547+1,664近 7 天星标变化 - #2★ 12,235+39近 7 天星标变化
- #3
具 Rust 核心的多语言文档智能框架。从 101 种格式(115 种文件扩展名)提取文本、元数据、图像和结构化数据,并支持 371 种代码语言的代码智能。提供 15 种语言绑定 — Rust、Python、Ruby、Java、Go、PHP、Elixir、C#、TypeScript — 以及 CLI、REST API 与 MCP 服务器
★ 9,254+21近 7 天星标变化 - #4
Python 与命令行工具,用于在网络上收集文本和元数据:爬取、抓取、抽取,输出为 CSV、JSON、HTML、MD、TXT、XML
★ 6,754+26近 7 天星标变化 - #5★ 3,703+1近 7 天星标变化
- #6★ 3,109+1近 7 天星标变化
- #7
Tika-Python 是 Apache Tika™ REST 服务的 Python 绑定,允许在 Python 社区中原生调用 Tika。
★ 1,667+0近 7 天星标变化 - #8
适用于 Python 与 Rust 的最快 PDF 库。支持文字提取、图片提取、Markdown 转换、PDF 创建与编辑。平均 0.8ms,比业界领导者快 5 倍,3,830 个 PDF 测试 100% 通过率。采用 MIT/Apache-2.0 授权。
★ 1,017+11近 7 天星标变化 - #9★ 921+1近 7 天星标变化
- #10
使用视觉 LLM 将 PDF 转为 markdown — 保留表格、排版与结构
★ 902+1近 7 天星标变化 - #11
高性能且符合 CommonMark 规范的 HTML 转 Markdown 转换器。由 Kreuzberg 团队维护。Kreuzberg 是一个以 Rust 为核心的高速多语言文档智能引擎。它使用流式解析器和内置 OCR 从 98+ 种文档格式中提取结构化数据。
★ 864+4近 7 天星标变化 - #12★ 823-1近 7 天星标变化
- #13★ 757+1近 7 天星标变化
- #14★ 554+0近 7 天星标变化
- #15★ 536+0近 7 天星标变化