Aller au contenu principal
buildradar
Sign in
Sujet · text-extraction

text-extraction

Dépôts open source suivis étiquetés text-extraction, triés par étoiles.

Dépôts
15
Total d'étoiles
61 632
Étoiles en moyenne
4 109
Part
0,00%

Sujets qui apparaissent souvent aux côtés de text-extraction sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés text-extraction.

Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.

  • pdf-inspector@firecrawl

    Bibliothèque Rust rapide pour l'inspection, la classification et l'extraction de texte PDF. Détecte intelligemment les PDF numérisés par rapport aux PDF textuels pour permettre des décisions de routage intelligentes.

    18 547+1 664Évolution des étoiles sur les 7 derniers jours
  • liteparse@run-llama

    Un analyseur de documents rapide, utile et open-source

    12 235+39Évolution des étoiles sur les 7 derniers jours
  • xberg@xberg-io

    Framework d'intelligence documentaire polyglotte avec un cœur en Rust. Extrait le texte, les métadonnées, les images et les données structurées de 101 formats (115 extensions de fichiers) avec une intelligence de code pour 371 langages. 15 bindings de langages — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — ainsi qu'une CLI, une API REST et un serveur MCP.

    9 254+21Évolution des étoiles sur les 7 derniers jours
  • trafilatura@adbar

    Outil Python et en ligne de commande pour collecter du texte et des métadonnées sur le Web : crawling, scraping, extraction, avec sortie en CSV, JSON, HTML, MD, TXT, XML.

    6 754+26Évolution des étoiles sur les 7 derniers jours
  • sumy@miso-belica

    Module pour le résumé automatique de documents texte et de pages HTML.

    3 703+1Évolution des étoiles sur les 7 derniers jours
  • unipdf@unidoc

    Bibliothèque PDF en Golang pour créer et traiter des fichiers PDF (pur Go).

    3 109+1Évolution des étoiles sur les 7 derniers jours
  • tika-python@chrismattmann

    Tika-Python est une liaison Python pour les services REST Apache Tika™, permettant d'appeler Tika nativement au sein de la communauté Python.

    1 667+0Évolution des étoiles sur les 7 derniers jours
  • pdf_oxide@yfedoseev

    La bibliothèque PDF la plus rapide pour Python et Rust. Extraction de texte et d'images, conversion markdown, création et édition de PDF. Moyenne de 0,8 ms, 5 fois plus rapide que les leaders du marché, 100 % de réussite sur 3 830 fichiers PDF. Licence MIT/Apache-2.0.

    1 017+11Évolution des étoiles sur les 7 derniers jours
  • zpdf@Lulzx

    Bibliothèque d'extraction de texte PDF sans copie (zero-copy) écrite en Zig. Analyse haute performance par mappage mémoire avec accélération SIMD.

    921+1Évolution des étoiles sur les 7 derniers jours
  • api-llm-ocr@yigitkonur

    Conversion de PDF en Markdown via des LLM de vision — préservation des tableaux, de la mise en page et de la structure

    902+1Évolution des étoiles sur les 7 derniers jours
  • html-to-markdown@xberg-io

    Convertisseur HTML vers Markdown haute performance conforme à CommonMark. Maintenu par l'équipe Kreuzberg. Kreuzberg est un moteur d'intelligence documentaire polyglotte et rapide avec un cœur en Rust. Il extrait des données structurées à partir de plus de 98 formats de documents en utilisant des analyseurs de flux et l'OCR intégré.

    864+4Évolution des étoiles sur les 7 derniers jours
  • jusText@miso-belica

    Outil de suppression de code répétitif basé sur des heuristiques

    823-1Évolution des étoiles sur les 7 derniers jours
  • datashare@ICIJ

    Moteur de recherche auto-hébergé pour documents

    757+1Évolution des étoiles sur les 7 derniers jours
  • pdftools@ropensci

    Extraction, rendu et conversion de documents PDF.

    554+0Évolution des étoiles sur les 7 derniers jours
  • srt@cdown

    Une bibliothèque et un ensemble d'outils simples pour analyser, modifier et composer des fichiers SRT.

    536+0Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets