Pular para o conteúdo principal
buildradar
Sign in
Tópico · text-extraction

text-extraction

Repositórios de código aberto acompanhados marcados com text-extraction, ordenados por estrelas.

Repositórios
15
Total de estrelas
61.632
Média de estrelas
4.109
Participação
0,00%

Tópicos que aparecem com frequência ao lado de text-extraction no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com text-extraction.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • pdf-inspector@firecrawl

    Biblioteca Rust rápida para inspeção, classificação e extração de texto em PDF. Detecta de forma inteligente PDFs digitalizados versus baseados em texto para permitir decisões de roteamento inteligentes.

    18.547+1.664Variação de estrelas nos últimos 7 dias
  • liteparse@run-llama

    Um parser de documentos rápido, útil e de código aberto

    12.235+39Variação de estrelas nos últimos 7 dias
  • xberg@xberg-io

    Um framework poliglota de inteligência de documentos com núcleo em Rust. Extraia texto, metadados, imagens e dados estruturados de 101 formatos (115 extensões de arquivo), além de inteligência de código para 371 linguagens. 15 bindings de linguagem — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — além de CLI, REST API e servidor MCP.

    9.254+21Variação de estrelas nos últimos 7 dias
  • trafilatura@adbar

    Ferramenta de linha de comando e Python para coletar texto e metadados na Web: crawling, scraping, extração e saída em CSV, JSON, HTML, MD, TXT, XML

    6.754+26Variação de estrelas nos últimos 7 dias
  • sumy@miso-belica

    Módulo para sumarização automática de documentos de texto e páginas HTML.

    3.703+1Variação de estrelas nos últimos 7 dias
  • unipdf@unidoc

    Biblioteca PDF em Golang para criar e processar arquivos PDF (pure go)

    3.109+1Variação de estrelas nos últimos 7 dias
  • tika-python@chrismattmann

    Tika-Python é um binding Python para os serviços REST do Apache Tika™, permitindo que o Tika seja chamado nativamente na comunidade Python.

    1.667+0Variação de estrelas nos últimos 7 dias
  • pdf_oxide@yfedoseev

    A biblioteca de PDF mais rápida para Python e Rust. Extração de texto, extração de imagem, conversão para markdown, criação e edição de PDF. Média de 0,8ms, 5x mais rápida que os líderes do setor, 100% de taxa de sucesso em 3.830 PDFs. MIT/Apache-2.0.

    1.017+13Variação de estrelas nos últimos 7 dias
  • zpdf@Lulzx

    Biblioteca de extração de texto PDF sem cópia (zero-copy) escrita em Zig. Análise de alto desempenho mapeada em memória com aceleração SIMD.

    921+1Variação de estrelas nos últimos 7 dias
  • api-llm-ocr@yigitkonur

    PDF para markdown usando LLMs de visão — tabelas, layouts e estrutura preservados

    902+1Variação de estrelas nos últimos 7 dias
  • html-to-markdown@xberg-io

    Conversor de HTML para Markdown de alto desempenho e compatível com CommonMark. Mantido pela equipe Kreuzberg. O Kreuzberg é um mecanismo de inteligência de documentos rápido e poliglota com núcleo em Rust. Ele extrai dados estruturados de mais de 98 formatos de documento usando parsers de streaming e OCR embutido.

    864+5Variação de estrelas nos últimos 7 dias
  • jusText@miso-belica

    Ferramenta de remoção de código boilerplate baseada em heurística

    823-1Variação de estrelas nos últimos 7 dias
  • datashare@ICIJ

    Um mecanismo de busca auto-hospedado para documentos

    757+2Variação de estrelas nos últimos 7 dias
  • pdftools@ropensci

    Extração de texto, renderização e conversão de documentos PDF

    554+0Variação de estrelas nos últimos 7 dias
  • srt@cdown

    Uma biblioteca simples e um conjunto de ferramentas para analisar, modificar e compor arquivos SRT.

    536+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos