Zum Hauptinhalt springen
buildradar
Sign in
Thema · text-extraction

text-extraction

Erfasste Open-Source-Repos mit dem Tag text-extraction, sortiert nach Sternen.

Repos
15
Sterne gesamt
61.632
Sterne im Schnitt
4.109
Anteil
0,00%

Themen, die häufig gemeinsam mit text-extraction am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit text-extraction getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • pdf-inspector@firecrawl

    Schnelle Rust-Bibliothek für PDF-Inspektion, -Klassifizierung und -Textextraktion. Erkennt intelligent gescannte im Vergleich zu textbasierten PDFs, um intelligente Routing-Entcheidungen zu ermöglichen.

    18.547+1.664Sterne-Änderung der letzten 7 Tage
  • liteparse@run-llama

    Ein schneller, hilfreicher und Open-Source-Dokumentenparser

    12.235+39Sterne-Änderung der letzten 7 Tage
  • xberg@xberg-io

    Ein polyglottes Dokumenten-Intelligenz-Framework mit einem Rust-Kern. Extrahiert Text, Metadaten, Bilder und strukturierte Daten aus 101 Formaten (115 Dateiendungen) sowie Code-Intelligenz für 371 Programmiersprachen. 15 Sprachbindungen – Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript – sowie CLI, REST-API und MCP-Server.

    9.254+21Sterne-Änderung der letzten 7 Tage
  • trafilatura@adbar

    Python- und Befehlszeilen-Tool zum Sammeln von Text und Metadaten im Web: Crawling, Scraping, Extraktion, Ausgabe als CSV, JSON, HTML, MD, TXT, XML

    6.754+26Sterne-Änderung der letzten 7 Tage
  • sumy@miso-belica

    Modul zur automatischen Zusammenfassung von Textdokumenten und HTML-Seiten.

    3.703+1Sterne-Änderung der letzten 7 Tage
  • unipdf@unidoc

    Golang-PDF-Bibliothek zum Erstellen und Verarbeiten von PDF-Dateien (reines Go)

    3.109+1Sterne-Änderung der letzten 7 Tage
  • tika-python@chrismattmann

    Tika-Python ist ein Python-Binding für die Apache Tika™ REST-Dienste, das den nativen Aufruf von Tika in der Python-Community ermöglicht.

    1.667+0Sterne-Änderung der letzten 7 Tage
  • pdf_oxide@yfedoseev

    Die schnellste PDF-Bibliothek für Python und Rust. Textextraktion, Bildextraktion, Markdown-Konvertierung, PDF-Erstellung und -Bearbeitung. 0,8 ms im Durchschnitt, 5x schneller als Branchenführer, 100 % Erfolgsquote bei 3.830 PDFs. MIT/Apache-2.0.

    1.017+11Sterne-Änderung der letzten 7 Tage
  • zpdf@Lulzx

    Zero-Copy PDF-Textextraktionsbibliothek, geschrieben in Zig. Hochperformantes, speicherabbildbasiertes Parsing mit SIMD-Beschleunigung.

    921+1Sterne-Änderung der letzten 7 Tage
  • api-llm-ocr@yigitkonur

    PDF zu Markdown mit Vision LLMs — Tabellen, Layouts und Struktur bleiben erhalten

    902+1Sterne-Änderung der letzten 7 Tage
  • html-to-markdown@xberg-io

    Leistungsstarker und CommonMark-konformer HTML-zu-Markdown-Konverter. Gewartet vom Kreuzberg-Team. Kreuzberg ist eine schnelle, mehrsprachige Dokumenten-Intelligence-Engine mit einem Rust-Kern. Sie extrahiert strukturierte Daten aus über 98 Dokumentenformaten mithilfe von Streaming-Parsern und integrierter OCR.

    864+4Sterne-Änderung der letzten 7 Tage
  • jusText@miso-belica

    Heuristikbasiertes Tool zum Entfernen von Boilerplate-Code

    823-1Sterne-Änderung der letzten 7 Tage
  • datashare@ICIJ

    Eine selbst gehostete Suchmaschine für Dokumente

    757+1Sterne-Änderung der letzten 7 Tage
  • pdftools@ropensci

    Text-Extraktion, -Rendering und -Konvertierung von PDF-Dokumenten

    554+0Sterne-Änderung der letzten 7 Tage
  • srt@cdown

    Eine einfache Bibliothek und ein Satz von Werkzeugen zum Parsen, Modifizieren und Komponieren von SRT-Dateien.

    536+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen