text-extraction
Erfasste Open-Source-Repos mit dem Tag text-extraction, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit text-extraction am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit text-extraction getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
Schnelle Rust-Bibliothek für PDF-Inspektion, -Klassifizierung und -Textextraktion. Erkennt intelligent gescannte im Vergleich zu textbasierten PDFs, um intelligente Routing-Entcheidungen zu ermöglichen.
★ 18.547+1.664Sterne-Änderung der letzten 7 Tage - #2★ 12.235+39Sterne-Änderung der letzten 7 Tage
- #3
Ein polyglottes Dokumenten-Intelligenz-Framework mit einem Rust-Kern. Extrahiert Text, Metadaten, Bilder und strukturierte Daten aus 101 Formaten (115 Dateiendungen) sowie Code-Intelligenz für 371 Programmiersprachen. 15 Sprachbindungen – Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript – sowie CLI, REST-API und MCP-Server.
★ 9.254+21Sterne-Änderung der letzten 7 Tage - #4
Python- und Befehlszeilen-Tool zum Sammeln von Text und Metadaten im Web: Crawling, Scraping, Extraktion, Ausgabe als CSV, JSON, HTML, MD, TXT, XML
★ 6.754+26Sterne-Änderung der letzten 7 Tage - #5★ 3.703+1Sterne-Änderung der letzten 7 Tage
- #6★ 3.109+1Sterne-Änderung der letzten 7 Tage
- #7
Tika-Python ist ein Python-Binding für die Apache Tika™ REST-Dienste, das den nativen Aufruf von Tika in der Python-Community ermöglicht.
★ 1.667+0Sterne-Änderung der letzten 7 Tage - #8
Die schnellste PDF-Bibliothek für Python und Rust. Textextraktion, Bildextraktion, Markdown-Konvertierung, PDF-Erstellung und -Bearbeitung. 0,8 ms im Durchschnitt, 5x schneller als Branchenführer, 100 % Erfolgsquote bei 3.830 PDFs. MIT/Apache-2.0.
★ 1.017+11Sterne-Änderung der letzten 7 Tage - #9
Zero-Copy PDF-Textextraktionsbibliothek, geschrieben in Zig. Hochperformantes, speicherabbildbasiertes Parsing mit SIMD-Beschleunigung.
★ 921+1Sterne-Änderung der letzten 7 Tage - #10
PDF zu Markdown mit Vision LLMs — Tabellen, Layouts und Struktur bleiben erhalten
★ 902+1Sterne-Änderung der letzten 7 Tage - #11
Leistungsstarker und CommonMark-konformer HTML-zu-Markdown-Konverter. Gewartet vom Kreuzberg-Team. Kreuzberg ist eine schnelle, mehrsprachige Dokumenten-Intelligence-Engine mit einem Rust-Kern. Sie extrahiert strukturierte Daten aus über 98 Dokumentenformaten mithilfe von Streaming-Parsern und integrierter OCR.
★ 864+4Sterne-Änderung der letzten 7 Tage - #12★ 823-1Sterne-Änderung der letzten 7 Tage
- #13★ 757+1Sterne-Änderung der letzten 7 Tage
- #14★ 554+0Sterne-Änderung der letzten 7 Tage
- #15
Eine einfache Bibliothek und ein Satz von Werkzeugen zum Parsen, Modifizieren und Komponieren von SRT-Dateien.
★ 536+0Sterne-Änderung der letzten 7 Tage