跳到主要内容
buildradar
Sign in
主题 · text-extraction

text-extraction

标记 text-extraction 主题、收录中的开源项目,按星标数排序。

项目数
15
总星标数
61,632
平均星标数
4,109
占比
0.00%

常跟 text-extraction 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 text-extraction 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • pdf-inspector@firecrawl

    快速的 Rust PDF 检测、分类与文字提取库,能智能辨别扫描版与文字版 PDF,帮助做出智能路由决策。

    18,547+1,664近 7 天星标变化
  • liteparse@run-llama

    快速、实用且开源的文档解析器

    12,235+39近 7 天星标变化
  • xberg@xberg-io

    具 Rust 核心的多语言文档智能框架。从 101 种格式(115 种文件扩展名)提取文本、元数据、图像和结构化数据,并支持 371 种代码语言的代码智能。提供 15 种语言绑定 — Rust、Python、Ruby、Java、Go、PHP、Elixir、C#、TypeScript — 以及 CLI、REST API 与 MCP 服务器

    9,254+21近 7 天星标变化
  • trafilatura@adbar

    Python 与命令行工具,用于在网络上收集文本和元数据:爬取、抓取、抽取,输出为 CSV、JSON、HTML、MD、TXT、XML

    6,754+26近 7 天星标变化
  • sumy@miso-belica

    自动摘要文字文件和 HTML 页面的模块

    3,703+1近 7 天星标变化
  • unipdf@unidoc

    Golang PDF 函数库,用于创建与处理 PDF 文件(纯 Go)。

    3,109+1近 7 天星标变化
  • tika-python@chrismattmann

    Tika-Python 是 Apache Tika™ REST 服务的 Python 绑定,允许在 Python 社区中原生调用 Tika。

    1,667+0近 7 天星标变化
  • pdf_oxide@yfedoseev

    适用于 Python 与 Rust 的最快 PDF 库。支持文字提取、图片提取、Markdown 转换、PDF 创建与编辑。平均 0.8ms,比业界领导者快 5 倍,3,830 个 PDF 测试 100% 通过率。采用 MIT/Apache-2.0 授权。

    1,017+11近 7 天星标变化
  • zpdf@Lulzx

    使用 Zig 编写的零拷贝 PDF 文本提取库。具备高性能、内存映射解析与 SIMD 加速。

    921+1近 7 天星标变化
  • api-llm-ocr@yigitkonur

    使用视觉 LLM 将 PDF 转为 markdown — 保留表格、排版与结构

    902+1近 7 天星标变化
  • html-to-markdown@xberg-io

    高性能且符合 CommonMark 规范的 HTML 转 Markdown 转换器。由 Kreuzberg 团队维护。Kreuzberg 是一个以 Rust 为核心的高速多语言文档智能引擎。它使用流式解析器和内置 OCR 从 98+ 种文档格式中提取结构化数据。

    864+4近 7 天星标变化
  • jusText@miso-belica

    基于启发式的样板移除工具

    823-1近 7 天星标变化
  • datashare@ICIJ

    一个文档专用的自架搜索引擎

    757+1近 7 天星标变化
  • pdftools@ropensci

    PDF 文件的文字提取、渲染与转换

    554+0近 7 天星标变化
  • srt@cdown

    用于解析、修改与组合 SRT 文件的简单库与工具集。

    536+0近 7 天星标变化
← 返回主题列表