text-extraction
Repositori open source terpantau bertanda text-extraction, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan text-extraction di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda text-extraction.
Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.
- #1
Pustaka Rust cepat untuk inspeksi, klasifikasi, dan ekstraksi teks PDF. Mendeteksi PDF hasil pindai vs berbasis teks secara cerdas untuk memungkinkan keputusan perutean yang cerdas.
★ 18.547+1.664Perubahan bintang dalam 7 hari terakhir - #2★ 12.235+39Perubahan bintang dalam 7 hari terakhir
- #3
Framework kecerdasan dokumen poliglot dengan inti Rust. Ekstrak teks, metadata, gambar, dan data terstruktur dari 101 format (115 ekstensi file) ditambah kecerdasan kode untuk 371 bahasa pemrograman. 15 binding bahasa — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — ditambah CLI, REST API, dan server MCP.
★ 9.254+21Perubahan bintang dalam 7 hari terakhir - #4
Alat Python & baris perintah untuk mengumpulkan teks dan metadata di Web: Crawling, scraping, ekstraksi, output sebagai CSV, JSON, HTML, MD, TXT, XML
★ 6.754+26Perubahan bintang dalam 7 hari terakhir - #5★ 3.703+1Perubahan bintang dalam 7 hari terakhir
- #6★ 3.109+1Perubahan bintang dalam 7 hari terakhir
- #7
Tika-Python adalah binding Python ke layanan REST Apache Tika™ yang memungkinkan Tika dipanggil secara native di komunitas Python.
★ 1.667+0Perubahan bintang dalam 7 hari terakhir - #8
Pustaka PDF tercepat untuk Python dan Rust. Ekstraksi teks, ekstraksi gambar, konversi markdown, pembuatan & pengeditan PDF. Rata-rata 0,8ms, 5x lebih cepat dari pemimpin industri, tingkat keberhasilan 100% pada 3.830 PDF. MIT/Apache-2.0.
★ 1.015+11Perubahan bintang dalam 7 hari terakhir - #9
Pustaka ekstraksi teks PDF zero-copy yang ditulis dalam Zig. Penguraian memori-mapped berkinerja tinggi dengan akselerasi SIMD.
★ 921+1Perubahan bintang dalam 7 hari terakhir - #10
PDF ke markdown menggunakan vision LLMs — tabel, tata letak, dan struktur dipertahankan
★ 902+1Perubahan bintang dalam 7 hari terakhir - #11
Pengonversi HTML ke Markdown berkinerja tinggi dan kompatibel dengan CommonMark. Dipelihara oleh tim Kreuzberg. Kreuzberg adalah mesin intelijen dokumen multibahasa yang cepat dengan inti Rust. Alat ini mengekstrak data terstruktur dari 98+ format dokumen menggunakan parser streaming dan OCR bawaan.
★ 863+4Perubahan bintang dalam 7 hari terakhir - #12★ 823-1Perubahan bintang dalam 7 hari terakhir
- #13★ 756+1Perubahan bintang dalam 7 hari terakhir
- #14★ 554+0Perubahan bintang dalam 7 hari terakhir
- #15
Pustaka sederhana dan sekumpulan alat untuk mengurai, memodifikasi, dan menyusun file SRT.
★ 536+0Perubahan bintang dalam 7 hari terakhir