document-analysis
Dépôts open source suivis étiquetés document-analysis, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de document-analysis sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés document-analysis.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Transforme des documents complexes comme les PDF et les fichiers Office en format markdown/JSON prêt pour les LLM dans vos flux de travail d'agents.
★ 78 747+564Évolution des étoiles sur les 7 derniers jours - #2
Dépôt officiel de « Dolphin : Document Image Parsing via Heterogeneous Anchor Prompting », ACL, 2025.
★ 9 049-1Évolution des étoiles sur les 7 derniers jours - #3★ 4 040+54Évolution des étoiles sur les 7 derniers jours
- #4
Lire et extraire du texte et d'autres contenus de fichiers PDF en C# (portage de PDFBox)
★ 2 552+5Évolution des étoiles sur les 7 derniers jours - #5
Une boîte à outils sur site pour l'extraction de données non structurées sans OCR, la conversion en markdown et l'évaluation comparative.
★ 2 086+4Évolution des étoiles sur les 7 derniers jours - #6
Une collection d'idées et d'algorithmes originaux et innovants pour des machines littéraires avancées. Ce projet est maintenu par l'équipe OCR du Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1 834-1Évolution des étoiles sur les 7 derniers jours - #7
Plateforme open source pour extraire des données structurées de documents à l'aide de l'IA.
★ 1 520-1Évolution des étoiles sur les 7 derniers jours - #8
OpenOCR : une boîte à outils open-source pour la recherche et les applications OCR générales, intégrant un benchmark d'entraînement et d'évaluation unifié, des systèmes d'OCR et d'analyse de documents de qualité commerciale, ainsi que des reproductions fidèles d'implémentations issues de nombreux articles académiques.
★ 1 440+3Évolution des étoiles sur les 7 derniers jours - #9
Dedoc est une bibliothèque (service) permettant d'automatiser l'analyse de documents et de les convertir dans un format uniforme. Elle extrait automatiquement le contenu, la structure logique, les tableaux et les métadonnées des documents électroniques textuels. (Analyse de documents ; extraction de contenu de documents ; extraction de structure logique ; analyseur PDF ; analyseur de documents scannés ; analyseur DOCX ; analyseur HTML)
★ 732+13Évolution des étoiles sur les 7 derniers jours - #10
[ECCV 2026] Un cadre basé sur la diffusion pour l'OCR de documents qui remplace le décodage autorégressif par un décodage de diffusion parallèle au niveau du bloc.
★ 615+1Évolution des étoiles sur les 7 derniers jours - #11
Code pour l'article "PICK: Processing Key Information Extraction from Documents using Improved Graph Learning-Convolutional Networks" (ICPR 2020)
★ 570+0Évolution des étoiles sur les 7 derniers jours - #12
AssemblyLine 4 : Tri de fichiers et analyse de logiciels malveillants
★ 532+3Évolution des étoiles sur les 7 derniers jours