text-extraction
標記 text-extraction 主題、收錄中的開源專案,依星數排序。
相關主題
常跟 text-extraction 一起出現在同一個專案上的主題。
近期新秀
近 90 天內建立、標記 text-extraction 主題的專案。
近 90 天內還沒有新專案標記這個主題。
- #1
快速的 Rust PDF 檢測、分類與文字抽取函式庫,能智慧辨識掃描版與文字版 PDF,協助做出智能路由決策。
★ 18,547+1,664近 7 天星數變化 - #2★ 12,235+39近 7 天星數變化
- #3
具 Rust 核心的多語言文件智慧框架。從 101 種格式(115 種檔案副檔名)提取文字、元資料、影像與結構化資料,並支援 371 種程式語言的程式碼智慧。提供 15 種語言綁定 — Rust、Python、Ruby、Java、Go、PHP、Elixir、C#、TypeScript — 以及 CLI、REST API 與 MCP 伺服器
★ 9,254+21近 7 天星數變化 - #4
Python 與命令列工具,用於在網路上收集文字與中繼資料:爬蟲、擷取、抽取,輸出為 CSV、JSON、HTML、MD、TXT、XML
★ 6,754+26近 7 天星數變化 - #5★ 3,703+1近 7 天星數變化
- #6★ 3,109+1近 7 天星數變化
- #7
Tika-Python 是 Apache Tika™ REST 服務的 Python 綁定,允許在 Python 社群中原生呼叫 Tika。
★ 1,667+0近 7 天星數變化 - #8
適用於 Python 與 Rust 的最快 PDF 函式庫。支援文字萃取、圖片萃取、Markdown 轉換、PDF 建立與編輯。平均 0.8ms,比業界領導者快 5 倍,3,830 個 PDF 測試 100% 通過率。採用 MIT/Apache-2.0 授權。
★ 1,017+13近 7 天星數變化 - #9★ 921+1近 7 天星數變化
- #10
使用視覺 LLM 將 PDF 轉為 markdown — 保留表格、版面與結構
★ 902+1近 7 天星數變化 - #11
高效能且符合 CommonMark 規範的 HTML 轉 Markdown 轉換器。由 Kreuzberg 團隊維護。Kreuzberg 是一個以 Rust 為核心的高速多語言文件智慧引擎。它使用串流解析器和內建的 OCR 從 98+ 種文件格式中提取結構化資料。
★ 864+5近 7 天星數變化 - #12★ 824-1近 7 天星數變化
- #13★ 757+2近 7 天星數變化
- #14★ 554+0近 7 天星數變化
- #15★ 536+0近 7 天星數變化