text-extraction
Repositórios de código aberto acompanhados marcados com text-extraction, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de text-extraction no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com text-extraction.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Biblioteca Rust rápida para inspeção, classificação e extração de texto em PDF. Detecta de forma inteligente PDFs digitalizados versus baseados em texto para permitir decisões de roteamento inteligentes.
★ 18.547+1.664Variação de estrelas nos últimos 7 dias - #2★ 12.235+39Variação de estrelas nos últimos 7 dias
- #3
Um framework poliglota de inteligência de documentos com núcleo em Rust. Extraia texto, metadados, imagens e dados estruturados de 101 formatos (115 extensões de arquivo), além de inteligência de código para 371 linguagens. 15 bindings de linguagem — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — além de CLI, REST API e servidor MCP.
★ 9.254+21Variação de estrelas nos últimos 7 dias - #4
Ferramenta de linha de comando e Python para coletar texto e metadados na Web: crawling, scraping, extração e saída em CSV, JSON, HTML, MD, TXT, XML
★ 6.754+26Variação de estrelas nos últimos 7 dias - #5★ 3.703+1Variação de estrelas nos últimos 7 dias
- #6★ 3.109+1Variação de estrelas nos últimos 7 dias
- #7
Tika-Python é um binding Python para os serviços REST do Apache Tika™, permitindo que o Tika seja chamado nativamente na comunidade Python.
★ 1.667+0Variação de estrelas nos últimos 7 dias - #8
A biblioteca de PDF mais rápida para Python e Rust. Extração de texto, extração de imagem, conversão para markdown, criação e edição de PDF. Média de 0,8ms, 5x mais rápida que os líderes do setor, 100% de taxa de sucesso em 3.830 PDFs. MIT/Apache-2.0.
★ 1.017+13Variação de estrelas nos últimos 7 dias - #9
Biblioteca de extração de texto PDF sem cópia (zero-copy) escrita em Zig. Análise de alto desempenho mapeada em memória com aceleração SIMD.
★ 921+1Variação de estrelas nos últimos 7 dias - #10
PDF para markdown usando LLMs de visão — tabelas, layouts e estrutura preservados
★ 902+1Variação de estrelas nos últimos 7 dias - #11
Conversor de HTML para Markdown de alto desempenho e compatível com CommonMark. Mantido pela equipe Kreuzberg. O Kreuzberg é um mecanismo de inteligência de documentos rápido e poliglota com núcleo em Rust. Ele extrai dados estruturados de mais de 98 formatos de documento usando parsers de streaming e OCR embutido.
★ 864+5Variação de estrelas nos últimos 7 dias - #12★ 823-1Variação de estrelas nos últimos 7 dias
- #13★ 757+2Variação de estrelas nos últimos 7 dias
- #14★ 554+0Variação de estrelas nos últimos 7 dias
- #15
Uma biblioteca simples e um conjunto de ferramentas para analisar, modificar e compor arquivos SRT.
★ 536+0Variação de estrelas nos últimos 7 dias