Saltar al contenido principal
buildradar
Sign in
Tema · text-extraction

text-extraction

Repositorios de código abierto monitorizados etiquetados con text-extraction, ordenados por estrellas.

Repositorios
15
Estrellas totales
61.632
Estrellas de media
4109
Proporción
0,00%

Temas que aparecen con frecuencia junto a text-extraction en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con text-extraction.

No hay repositorios nuevos con este tema en los últimos 90 días.

  • pdf-inspector@firecrawl

    Biblioteca rápida en Rust para la inspección, clasificación y extracción de texto de archivos PDF. Detecta de forma inteligente PDF escaneados frente a los basados en texto para permitir decisiones de enrutamiento inteligentes.

    18.547+1664Variación de estrellas de los últimos 7 días
  • liteparse@run-llama

    Un analizador de documentos rápido, útil y de código abierto

    12.235+39Variación de estrellas de los últimos 7 días
  • xberg@xberg-io

    Un framework de inteligencia de documentos políglota con un núcleo en Rust. Extrae texto, metadatos, imágenes y datos estructurados de 101 formatos (115 extensiones de archivo) además de inteligencia de código para 371 lenguajes de programación. 15 enlaces de lenguajes — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — además de CLI, API REST y servidor MCP.

    9254+21Variación de estrellas de los últimos 7 días
  • trafilatura@adbar

    Herramienta de Python y línea de comandos para recopilar texto y metadatos en la web: rastreo, extracción y salida en CSV, JSON, HTML, MD, TXT, XML

    6754+26Variación de estrellas de los últimos 7 días
  • sumy@miso-belica

    Módulo para la resumen automático de documentos de texto y páginas HTML.

    3703+1Variación de estrellas de los últimos 7 días
  • unipdf@unidoc

    Librería PDF en Golang para crear y procesar archivos PDF (Go puro)

    3109+1Variación de estrellas de los últimos 7 días
  • tika-python@chrismattmann

    Tika-Python es un enlace de Python para los servicios REST de Apache Tika™, que permite invocar a Tika de forma nativa en la comunidad de Python.

    1667+0Variación de estrellas de los últimos 7 días
  • pdf_oxide@yfedoseev

    La biblioteca de PDF más rápida para Python y Rust. Extracción de texto, extracción de imágenes, conversión a markdown, creación y edición de PDF. 0.8ms de media, 5 veces más rápida que los líderes del sector, 100% de tasa de éxito en 3,830 archivos PDF. MIT/Apache-2.0.

    1015+11Variación de estrellas de los últimos 7 días
  • zpdf@Lulzx

    Biblioteca de extracción de texto PDF sin copia escrita en Zig. Análisis de alto rendimiento mediante mapeo de memoria con aceleración SIMD.

    921+1Variación de estrellas de los últimos 7 días
  • api-llm-ocr@yigitkonur

    Conversión de PDF a markdown utilizando LLM de visión, preservando tablas, diseños y estructura.

    902+1Variación de estrellas de los últimos 7 días
  • html-to-markdown@xberg-io

    Convertidor de HTML a Markdown de alto rendimiento y compatible con CommonMark. Mantenido por el equipo de Kreuzberg. Kreuzberg es un motor de inteligencia documental rápido y políglota con un núcleo en Rust. Extrae datos estructurados de más de 98 formatos de documentos utilizando analizadores de streaming y OCR integrado.

    863+4Variación de estrellas de los últimos 7 días
  • jusText@miso-belica

    Herramienta de eliminación de boilerplate basada en heurística

    823-1Variación de estrellas de los últimos 7 días
  • datashare@ICIJ

    Un motor de búsqueda autohospedado para documentos

    756+1Variación de estrellas de los últimos 7 días
  • pdftools@ropensci

    Extracción, renderizado y conversión de documentos PDF

    554+0Variación de estrellas de los últimos 7 días
  • srt@cdown

    Una biblioteca sencilla y un conjunto de herramientas para analizar, modificar y componer archivos SRT.

    536+0Variación de estrellas de los últimos 7 días
← Volver a temas