Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · text-extraction

text-extraction

Các kho mã nguồn mở đang theo dõi được gắn thẻ text-extraction, sắp xếp theo số sao.

Kho mã
15
Tổng số sao
61.632
Số sao trung bình
4.109
Tỷ trọng
0,00%

Những chủ đề thường xuất hiện cùng text-extraction trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ text-extraction.

Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.

  • pdf-inspector@firecrawl

    Thư viện Rust tốc độ cao dùng để kiểm tra, phân loại và trích xuất văn bản từ PDF. Tự động phát hiện thông minh file PDF dạng quét hay dạng văn bản để đưa ra quyết định định tuyến.

    18.547+1.664Thay đổi số sao trong 7 ngày qua
  • liteparse@run-llama

    Trình phân tích cú pháp tài liệu nhanh chóng, hữu ích và mã nguồn mở

    12.235+39Thay đổi số sao trong 7 ngày qua
  • xberg@xberg-io

    Một framework trí tuệ tài liệu đa ngôn ngữ với lõi Rust. Trích xuất văn bản, siêu dữ liệu, hình ảnh và dữ liệu cấu trúc từ 101 định dạng (115 phần mở rộng tệp) cộng với trí tuệ mã cho 371 ngôn ngữ lập trình. 15 liên kết ngôn ngữ — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — cộng với CLI, REST API và MCP server.

    9.254+21Thay đổi số sao trong 7 ngày qua
  • trafilatura@adbar

    Công cụ Python & dòng lệnh thu thập văn bản và siêu dữ liệu trên web: Thu thập, cào dữ liệu, trích xuất, xuất ra định dạng CSV, JSON, HTML, MD, TXT, XML

    6.754+26Thay đổi số sao trong 7 ngày qua
  • sumy@miso-belica

    Mô-đun tự động tóm tắt tài liệu văn bản và trang HTML.

    3.703+1Thay đổi số sao trong 7 ngày qua
  • unipdf@unidoc

    Thư viện PDF bằng Golang dùng để tạo và xử lý tệp PDF (thuần Go)

    3.109+1Thay đổi số sao trong 7 ngày qua
  • tika-python@chrismattmann

    Tika-Python là một thư viện Python liên kết với dịch vụ REST của Apache Tika™, cho phép gọi Tika trực tiếp trong cộng đồng Python.

    1.667+0Thay đổi số sao trong 7 ngày qua
  • pdf_oxide@yfedoseev

    Thư viện PDF nhanh nhất cho Python và Rust. Hỗ trợ trích xuất văn bản, hình ảnh, chuyển đổi sang markdown, tạo và chỉnh sửa PDF. Trung bình 0,8ms, nhanh gấp 5 lần các đối thủ hàng đầu, tỷ lệ thành công 100% trên 3.830 tệp PDF. Giấy phép MIT/Apache-2.0.

    1.017+11Thay đổi số sao trong 7 ngày qua
  • zpdf@Lulzx

    Thư viện trích xuất văn bản PDF zero-copy viết bằng Zig. Phân tích cú pháp ánh xạ bộ nhớ, hiệu năng cao với tăng tốc SIMD.

    921+1Thay đổi số sao trong 7 ngày qua
  • api-llm-ocr@yigitkonur

    Chuyển đổi PDF sang markdown sử dụng vision LLM — bảo toàn bảng, bố cục và cấu trúc

    902+1Thay đổi số sao trong 7 ngày qua
  • html-to-markdown@xberg-io

    Trình chuyển đổi HTML sang Markdown hiệu năng cao và tuân thủ CommonMark. Được duy trì bởi đội ngũ Kreuzberg. Kreuzberg là một công cụ thông minh tài liệu đa ngôn ngữ, tốc độ cao với lõi Rust. Nó trích xuất dữ liệu có cấu trúc từ hơn 98 định dạng tài liệu bằng cách sử dụng trình phân tích luồng và OCR tích hợp.

    864+4Thay đổi số sao trong 7 ngày qua
  • jusText@miso-belica

    Công cụ loại bỏ boilerplate dựa trên phương pháp heuristic.

    823-1Thay đổi số sao trong 7 ngày qua
  • datashare@ICIJ

    Một công cụ tìm kiếm tài liệu tự lưu trữ

    757+1Thay đổi số sao trong 7 ngày qua
  • pdftools@ropensci

    Trích xuất, hiển thị và chuyển đổi văn bản từ tài liệu PDF.

    554+0Thay đổi số sao trong 7 ngày qua
  • srt@cdown

    Một thư viện đơn giản và bộ công cụ để phân tích, sửa đổi và soạn thảo các tệp SRT.

    536+0Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề