table-extraction
Các kho mã nguồn mở đang theo dõi được gắn thẻ table-extraction, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng table-extraction trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ table-extraction.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Đọc kỹ PDF để lấy thông tin chi tiết về từng ký tự, hình chữ nhật, dòng, v.v. — và dễ dàng trích xuất văn bản cũng như bảng.
★ 10.701+15Thay đổi số sao trong 7 ngày qua - #2
PyMuPDF là một thư viện Python hiệu năng cao dùng để trích xuất, phân tích, chuyển đổi và thao tác dữ liệu trên PDF (và các tài liệu khác).
★ 10.602+67Thay đổi số sao trong 7 ngày qua - #3
Một framework trí tuệ tài liệu đa ngôn ngữ với lõi Rust. Trích xuất văn bản, siêu dữ liệu, hình ảnh và dữ liệu cấu trúc từ 101 định dạng (115 phần mở rộng tệp) cộng với trí tuệ mã cho 371 ngôn ngữ lập trình. 15 liên kết ngôn ngữ — Rust, Python, Ruby, Java, Go, PHP, Elixir, C#, TypeScript — cộng với CLI, REST API và MCP server.
★ 9.233+48Thay đổi số sao trong 7 ngày qua - #4
Table Transformer (TATR) là một mô hình học sâu dùng để trích xuất bảng từ các tài liệu phi cấu trúc (PDF và hình ảnh). Đây cũng là kho lưu trữ chính thức cho tập dữ liệu PubTables-1M và chỉMetric đánh giá GriTS.
★ 2.943+2Thay đổi số sao trong 7 ngày qua - #5
Bộ công cụ trích xuất dữ liệu phi cấu trúc tại chỗ không cần OCR, chuyển đổi markdown và đánh giá chuẩn.
★ 2.086+4Thay đổi số sao trong 7 ngày qua - #6
Chuyển đổi PDF sang markdown sử dụng vision LLM — bảo toàn bảng, bố cục và cấu trúc
★ 901-2Thay đổi số sao trong 7 ngày qua - #7
img2table là một thư viện Python nhận diện và trích xuất bảng cho PDF và hình ảnh, dựa trên xử lý ảnh OpenCV
★ 893+2Thay đổi số sao trong 7 ngày qua - #8
ParseBench - Một tiêu chuẩn đánh giá phân tích tài liệu cho các AI Agent
★ 558+2Thay đổi số sao trong 7 ngày qua