跳到主要內容
buildradar
Sign in
主題 · text-extraction

text-extraction

標記 text-extraction 主題、收錄中的開源專案,依星數排序。

專案數
15
總星數
61,632
平均星數
4,109
佔比
0.00%

常跟 text-extraction 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 text-extraction 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • pdf-inspector@firecrawl

    快速的 Rust PDF 檢測、分類與文字抽取函式庫,能智慧辨識掃描版與文字版 PDF,協助做出智能路由決策。

    18,547+1,664近 7 天星數變化
  • liteparse@run-llama

    快速、實用且開源的文件解析器

    12,235+39近 7 天星數變化
  • xberg@xberg-io

    具 Rust 核心的多語言文件智慧框架。從 101 種格式(115 種檔案副檔名)提取文字、元資料、影像與結構化資料,並支援 371 種程式語言的程式碼智慧。提供 15 種語言綁定 — Rust、Python、Ruby、Java、Go、PHP、Elixir、C#、TypeScript — 以及 CLI、REST API 與 MCP 伺服器

    9,254+21近 7 天星數變化
  • trafilatura@adbar

    Python 與命令列工具,用於在網路上收集文字與中繼資料:爬蟲、擷取、抽取,輸出為 CSV、JSON、HTML、MD、TXT、XML

    6,754+26近 7 天星數變化
  • sumy@miso-belica

    自動摘要文字文件和 HTML 頁面的模組

    3,703+1近 7 天星數變化
  • unipdf@unidoc

    Golang PDF 函式庫,用於創建與處理 PDF 檔案(純 Go)。

    3,109+1近 7 天星數變化
  • tika-python@chrismattmann

    Tika-Python 是 Apache Tika™ REST 服務的 Python 綁定,允許在 Python 社群中原生呼叫 Tika。

    1,667+0近 7 天星數變化
  • pdf_oxide@yfedoseev

    適用於 Python 與 Rust 的最快 PDF 函式庫。支援文字萃取、圖片萃取、Markdown 轉換、PDF 建立與編輯。平均 0.8ms,比業界領導者快 5 倍,3,830 個 PDF 測試 100% 通過率。採用 MIT/Apache-2.0 授權。

    1,017+13近 7 天星數變化
  • zpdf@Lulzx

    使用 Zig 編寫的零複製 PDF 文字擷取函式庫。具備高效能、記憶體對映解析與 SIMD 加速。

    921+1近 7 天星數變化
  • api-llm-ocr@yigitkonur

    使用視覺 LLM 將 PDF 轉為 markdown — 保留表格、版面與結構

    902+1近 7 天星數變化
  • html-to-markdown@xberg-io

    高效能且符合 CommonMark 規範的 HTML 轉 Markdown 轉換器。由 Kreuzberg 團隊維護。Kreuzberg 是一個以 Rust 為核心的高速多語言文件智慧引擎。它使用串流解析器和內建的 OCR 從 98+ 種文件格式中提取結構化資料。

    864+5近 7 天星數變化
  • jusText@miso-belica

    基於啟發式的樣板移除工具

    824-1近 7 天星數變化
  • datashare@ICIJ

    一個文件專用的自架搜尋引擎

    757+2近 7 天星數變化
  • pdftools@ropensci

    PDF 文件的文字提取、渲染與轉換

    554+0近 7 天星數變化
  • srt@cdown

    用於解析、修改與組合 SRT 檔案的簡單函式庫與工具集。

    536+0近 7 天星數變化
← 返回主題列表