text-extraction
Repositorios de código abierto monitorizados etiquetados con text-extraction, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a text-extraction en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con text-extraction.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Biblioteca rápida en Rust para la inspección, clasificación y extracción de texto de archivos PDF. Detecta de forma inteligente PDF escaneados frente a los basados en texto para permitir decisiones de enrutamiento inteligentes.
★ 18.547+1664Variación de estrellas de los últimos 7 días - #2★ 12.235+39Variación de estrellas de los últimos 7 días
- #3
Un framework de inteligencia de documentos políglota con un núcleo en Rust. Extrae texto, metadatos, imágenes y datos estructurados de 101 formatos (115 extensiones de archivo) además de inteligencia de código para 371 lenguajes de programación. 15 enlaces de lenguajes — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — además de CLI, API REST y servidor MCP.
★ 9254+21Variación de estrellas de los últimos 7 días - #4
Herramienta de Python y línea de comandos para recopilar texto y metadatos en la web: rastreo, extracción y salida en CSV, JSON, HTML, MD, TXT, XML
★ 6754+26Variación de estrellas de los últimos 7 días - #5★ 3703+1Variación de estrellas de los últimos 7 días
- #6★ 3109+1Variación de estrellas de los últimos 7 días
- #7
Tika-Python es un enlace de Python para los servicios REST de Apache Tika™, que permite invocar a Tika de forma nativa en la comunidad de Python.
★ 1667+0Variación de estrellas de los últimos 7 días - #8
La biblioteca de PDF más rápida para Python y Rust. Extracción de texto, extracción de imágenes, conversión a markdown, creación y edición de PDF. 0.8ms de media, 5 veces más rápida que los líderes del sector, 100% de tasa de éxito en 3,830 archivos PDF. MIT/Apache-2.0.
★ 1015+11Variación de estrellas de los últimos 7 días - #9
Biblioteca de extracción de texto PDF sin copia escrita en Zig. Análisis de alto rendimiento mediante mapeo de memoria con aceleración SIMD.
★ 921+1Variación de estrellas de los últimos 7 días - #10
Conversión de PDF a markdown utilizando LLM de visión, preservando tablas, diseños y estructura.
★ 902+1Variación de estrellas de los últimos 7 días - #11
Convertidor de HTML a Markdown de alto rendimiento y compatible con CommonMark. Mantenido por el equipo de Kreuzberg. Kreuzberg es un motor de inteligencia documental rápido y políglota con un núcleo en Rust. Extrae datos estructurados de más de 98 formatos de documentos utilizando analizadores de streaming y OCR integrado.
★ 863+4Variación de estrellas de los últimos 7 días - #12★ 823-1Variación de estrellas de los últimos 7 días
- #13★ 756+1Variación de estrellas de los últimos 7 días
- #14★ 554+0Variación de estrellas de los últimos 7 días
- #15
Una biblioteca sencilla y un conjunto de herramientas para analizar, modificar y componer archivos SRT.
★ 536+0Variación de estrellas de los últimos 7 días