Lompat ke konten utama
buildradar
Sign in
Topik · text-extraction

text-extraction

Repositori open source terpantau bertanda text-extraction, diurutkan berdasarkan bintang.

Repositori
15
Total bintang
61.632
Rata-rata bintang
4.109
Porsi
0,00%

Topik yang sering muncul berdampingan dengan text-extraction di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda text-extraction.

Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.

  • pdf-inspector@firecrawl

    Pustaka Rust cepat untuk inspeksi, klasifikasi, dan ekstraksi teks PDF. Mendeteksi PDF hasil pindai vs berbasis teks secara cerdas untuk memungkinkan keputusan perutean yang cerdas.

    18.547+1.664Perubahan bintang dalam 7 hari terakhir
  • liteparse@run-llama

    Pengurai dokumen yang cepat, bermanfaat, dan sumber terbuka

    12.235+39Perubahan bintang dalam 7 hari terakhir
  • xberg@xberg-io

    Framework kecerdasan dokumen poliglot dengan inti Rust. Ekstrak teks, metadata, gambar, dan data terstruktur dari 101 format (115 ekstensi file) ditambah kecerdasan kode untuk 371 bahasa pemrograman. 15 binding bahasa — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — ditambah CLI, REST API, dan server MCP.

    9.254+21Perubahan bintang dalam 7 hari terakhir
  • trafilatura@adbar

    Alat Python & baris perintah untuk mengumpulkan teks dan metadata di Web: Crawling, scraping, ekstraksi, output sebagai CSV, JSON, HTML, MD, TXT, XML

    6.754+26Perubahan bintang dalam 7 hari terakhir
  • sumy@miso-belica

    Modul untuk peringkasan otomatis dokumen teks dan halaman HTML.

    3.703+1Perubahan bintang dalam 7 hari terakhir
  • unipdf@unidoc

    Pustaka PDF Golang untuk membuat dan memproses file PDF (pure go).

    3.109+1Perubahan bintang dalam 7 hari terakhir
  • tika-python@chrismattmann

    Tika-Python adalah binding Python ke layanan REST Apache Tika™ yang memungkinkan Tika dipanggil secara native di komunitas Python.

    1.667+0Perubahan bintang dalam 7 hari terakhir
  • pdf_oxide@yfedoseev

    Pustaka PDF tercepat untuk Python dan Rust. Ekstraksi teks, ekstraksi gambar, konversi markdown, pembuatan & pengeditan PDF. Rata-rata 0,8ms, 5x lebih cepat dari pemimpin industri, tingkat keberhasilan 100% pada 3.830 PDF. MIT/Apache-2.0.

    1.015+11Perubahan bintang dalam 7 hari terakhir
  • zpdf@Lulzx

    Pustaka ekstraksi teks PDF zero-copy yang ditulis dalam Zig. Penguraian memori-mapped berkinerja tinggi dengan akselerasi SIMD.

    921+1Perubahan bintang dalam 7 hari terakhir
  • api-llm-ocr@yigitkonur

    PDF ke markdown menggunakan vision LLMs — tabel, tata letak, dan struktur dipertahankan

    902+1Perubahan bintang dalam 7 hari terakhir
  • html-to-markdown@xberg-io

    Pengonversi HTML ke Markdown berkinerja tinggi dan kompatibel dengan CommonMark. Dipelihara oleh tim Kreuzberg. Kreuzberg adalah mesin intelijen dokumen multibahasa yang cepat dengan inti Rust. Alat ini mengekstrak data terstruktur dari 98+ format dokumen menggunakan parser streaming dan OCR bawaan.

    863+4Perubahan bintang dalam 7 hari terakhir
  • jusText@miso-belica

    Alat penghapusan boilerplate berbasis heuristik.

    823-1Perubahan bintang dalam 7 hari terakhir
  • datashare@ICIJ

    Mesin pencari mandiri untuk dokumen

    756+1Perubahan bintang dalam 7 hari terakhir
  • pdftools@ropensci

    Ekstraksi Teks, Render, dan Konversi Dokumen PDF

    554+0Perubahan bintang dalam 7 hari terakhir
  • srt@cdown

    Pustaka sederhana dan sekumpulan alat untuk mengurai, memodifikasi, dan menyusun file SRT.

    536+0Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik