text-extraction
Dépôts open source suivis étiquetés text-extraction, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de text-extraction sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés text-extraction.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Bibliothèque Rust rapide pour l'inspection, la classification et l'extraction de texte PDF. Détecte intelligemment les PDF numérisés par rapport aux PDF textuels pour permettre des décisions de routage intelligentes.
★ 18 547+1 664Évolution des étoiles sur les 7 derniers jours - #2★ 12 235+39Évolution des étoiles sur les 7 derniers jours
- #3
Framework d'intelligence documentaire polyglotte avec un cœur en Rust. Extrait le texte, les métadonnées, les images et les données structurées de 101 formats (115 extensions de fichiers) avec une intelligence de code pour 371 langages. 15 bindings de langages — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — ainsi qu'une CLI, une API REST et un serveur MCP.
★ 9 254+21Évolution des étoiles sur les 7 derniers jours - #4
Outil Python et en ligne de commande pour collecter du texte et des métadonnées sur le Web : crawling, scraping, extraction, avec sortie en CSV, JSON, HTML, MD, TXT, XML.
★ 6 754+26Évolution des étoiles sur les 7 derniers jours - #5★ 3 703+1Évolution des étoiles sur les 7 derniers jours
- #6★ 3 109+1Évolution des étoiles sur les 7 derniers jours
- #7
Tika-Python est une liaison Python pour les services REST Apache Tika™, permettant d'appeler Tika nativement au sein de la communauté Python.
★ 1 667+0Évolution des étoiles sur les 7 derniers jours - #8
La bibliothèque PDF la plus rapide pour Python et Rust. Extraction de texte et d'images, conversion markdown, création et édition de PDF. Moyenne de 0,8 ms, 5 fois plus rapide que les leaders du marché, 100 % de réussite sur 3 830 fichiers PDF. Licence MIT/Apache-2.0.
★ 1 017+11Évolution des étoiles sur les 7 derniers jours - #9
Bibliothèque d'extraction de texte PDF sans copie (zero-copy) écrite en Zig. Analyse haute performance par mappage mémoire avec accélération SIMD.
★ 921+1Évolution des étoiles sur les 7 derniers jours - #10
Conversion de PDF en Markdown via des LLM de vision — préservation des tableaux, de la mise en page et de la structure
★ 902+1Évolution des étoiles sur les 7 derniers jours - #11
Convertisseur HTML vers Markdown haute performance conforme à CommonMark. Maintenu par l'équipe Kreuzberg. Kreuzberg est un moteur d'intelligence documentaire polyglotte et rapide avec un cœur en Rust. Il extrait des données structurées à partir de plus de 98 formats de documents en utilisant des analyseurs de flux et l'OCR intégré.
★ 864+4Évolution des étoiles sur les 7 derniers jours - #12★ 823-1Évolution des étoiles sur les 7 derniers jours
- #13★ 757+1Évolution des étoiles sur les 7 derniers jours
- #14★ 554+0Évolution des étoiles sur les 7 derniers jours
- #15
Une bibliothèque et un ensemble d'outils simples pour analyser, modifier et composer des fichiers SRT.
★ 536+0Évolution des étoiles sur les 7 derniers jours