text-extraction
text-extraction がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
text-extraction と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、text-extraction がタグ付けされたリポジトリ。
直近 90 日以内に、このトピックがタグ付けされた新しいリポジトリはありません。
- #1
PDFの検査、分類、テキスト抽出のための高速なRustライブラリ。スキャンされたPDFとテキストベースのPDFをインテリジェントに検出し、スマートなルーティング決定を可能にする。
★ 18,547+1,664直近 7 日のスター増減 - #2★ 12,235+39直近 7 日のスター増減
- #3
Rustコアを備えたポリグロットなドキュメントインテリジェンスフレームワーク。101のフォーマット(115のファイル拡張子)からテキスト、メタデータ、画像、構造化データを抽出し、さらに371のコード言語に対応するコードインテリジェンスを提供します。15の言語バインディング(Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript)に加え、CLI、REST API、MCPサーバーも利用可能です。
★ 9,254+21直近 7 日のスター増減 - #4
Pythonおよびコマンドラインツール。Web上のテキストとメタデータを収集:クローリング、スクレイピング、抽出、CSV、JSON、HTML、MD、TXT、XMLとしての出力。
★ 6,754+26直近 7 日のスター増減 - #5★ 3,703+1直近 7 日のスター増減
- #6★ 3,109+1直近 7 日のスター増減
- #7
Tika-Python は Apache Tika™ REST サービスの Python バインディングであり、Python コミュニティからネイティブに Tika を呼び出すことができます。
★ 1,667+0直近 7 日のスター増減 - #8
PythonおよびRust向けの最速PDFライブラリ。テキスト抽出、画像抽出、Markdown変換、PDFの作成と編集。平均0.8ms、業界リーダーの5倍高速、3,830件のPDFで100%の合格率。MIT/Apache-2.0。
★ 1,015+11直近 7 日のスター増減 - #9★ 921+1直近 7 日のスター増減
- #10
ビジョン LLM を使用した PDF から Markdown への変換 — 表、レイアウト、構造を維持
★ 902+1直近 7 日のスター増減 - #11
高パフォーマンスで CommonMark 準拠の HTML から Markdown への変換ツール。Kreuzberg チームによって保守されています。Kreuzberg は、Rust コアを持つ高速な多言語ドキュメントインテリジェンスエンジンです。ストリーミングパーサーと組み込み OCR を使用して、98以上のドキュメントフォーマットから構造化データを抽出します。
★ 863+4直近 7 日のスター増減 - #12★ 823-1直近 7 日のスター増減
- #13★ 757+1直近 7 日のスター増減
- #14★ 554+0直近 7 日のスター増減
- #15★ 536+0直近 7 日のスター増減