ocr
Các kho mã nguồn mở đang theo dõi được gắn thẻ ocr, sắp xếp theo số sao.
- #61
Một kho lưu trữ dành cho Document AI
★ 3.257+9Thay đổi số sao trong 7 ngày qua - #62
Một công cụ Python3 mã nguồn mở với các mô hình NHỎ dùng để nhận diện bố cục, bảng biểu, công thức toán học (LaTeX) và văn bản trong hình ảnh, chuyển đổi chúng sang định dạng Markdown. Một giải pháp thay thế miễn phí cho Mathpix, hỗ trợ chuyển đổi mượt mà nội dung trực quan thành dạng văn bản. Hỗ trợ hơn 80 ngôn ngữ.
★ 3.229+3Thay đổi số sao trong 7 ngày qua - #63
[Nhận dạng mã xác nhận - Đào tạo] Dự án này dựa trên CNN/ResNet/DenseNet+GRU/LSTM+CTC/CrossEntropy để thực hiện nhận dạng mã xác nhận. Dự án này chỉ dành cho việc huấn luyện mô hình.
★ 3.213+0Thay đổi số sao trong 7 ngày qua - #64
API trích xuất và phân tích tài liệu (PDF, Word, PPTX ...) sử dụng OCR hiện đại tiên tiến + các mô hình được hỗ trợ bởi Ollama. Ẩn danh hóa tài liệu. Loại bỏ PII. Chuyển đổi bất kỳ tài liệu hoặc hình ảnh nào thành JSON hoặc Markdown có cấu trúc
★ 3.177+0Thay đổi số sao trong 7 ngày qua - #65★ 3.134+2Thay đổi số sao trong 7 ngày qua
- #66★ 3.065+1Thay đổi số sao trong 7 ngày qua
- #67
Một wrapper để làm việc với Tesseract OCR trong PHP.
★ 3.039-2Thay đổi số sao trong 7 ngày qua - #68
Bộ sưu tập các dự án AI thực tế được tuyển chọn thực hiện hệ thống OCR, RAG, tác nhân AI và các trường hợp sử dụng AI khác.
★ 3.030+58Thay đổi số sao trong 7 ngày qua - #69
Cải thiện đầu ra của Tesseract OCR bằng các LLM (cục bộ hoặc API) để sửa lỗi, chia nhỏ thông minh và định dạng markdown cho các tệp PDF đã quét
★ 2.996+3Thay đổi số sao trong 7 ngày qua - #70
Một máy chủ Model Context Protocol để chuyển đổi hầu hết mọi thứ sang Markdown
★ 2.983-1Thay đổi số sao trong 7 ngày qua - #71
Phát hiện và nhận dạng văn bản tiếng Trung trong cảnh thực tế từ đầu đến cuối với CTPN, CRNN và CTC (dự án cũ).
★ 2.955+0Thay đổi số sao trong 7 ngày qua - #72
OpenRecall là giải pháp thay thế hoàn toàn mã nguồn mở, ưu tiên quyền riêng tư cho các giải pháp độc quyền như Windows Recall của Microsoft. Với OpenRecall, bạn có thể dễ dàng truy cập lịch sử kỹ thuật số của mình, nâng cao trí nhớ và năng suất mà không ảnh hưởng đến quyền riêng tư.
★ 2.937+2Thay đổi số sao trong 7 ngày qua - #73
Hệ thống Quản lý Tài liệu Mã nguồn mở cho Lưu trữ Kỹ thuật số (Tài liệu đã quét)
★ 2.935+1Thay đổi số sao trong 7 ngày qua - #74
Ứng dụng/tiện ích mở rộng trình duyệt dịch truyện tranh và manga AI để tự động dịch truyện tranh, manga, manhwa, BD, fumetti và nhiều định dạng khác sang nhiều ngôn ngữ (Hình ảnh, PDF, EPUB, CBR, CBZ v.v.).
★ 2.928+12Thay đổi số sao trong 7 ngày qua - #75
Nhận dạng ký tự quang học (OCR) cho văn bản tiếng Nhật, tập trung chủ yếu vào manga tiếng Nhật
★ 2.770+7Thay đổi số sao trong 7 ngày qua - #76
Công cụ dịch truyện tranh AI trên máy tính mã nguồn mở được triển khai dựa trên manga-image-translator. Hỗ trợ xử lý tự động truyện tranh Nhật, Hàn, Anh, tích hợp nhiều công cụ dịch như OpenAl, Gemini; thực hiện quy trình hoàn chỉnh bao gồm phát hiện văn bản OCR, xóa văn bản gốc, dịch AI, sửa ảnh, bố cục bản dịch, đi kèm trình chỉnh sửa trực quan, hỗ trợ tùy chỉnh kiểu văn bản, triển khai bằng một cú nhấp chuột và sẵn sàng sử dụng.
★ 2.711+35Thay đổi số sao trong 7 ngày qua - #77★ 2.705+4Thay đổi số sao trong 7 ngày qua
- #78
: Sử dụng LLM và LLM Vision (OCR) để xử lý paperless-ngx - Số hóa tài liệu được hỗ trợ bởi AI
★ 2.662+8Thay đổi số sao trong 7 ngày qua - #79★ 2.561+0Thay đổi số sao trong 7 ngày qua
- #80
Nền tảng điều phối dữ liệu và cơ sở hạ tầng mã nguồn mở cho việc ra quyết định rủi ro
★ 2.427+1Thay đổi số sao trong 7 ngày qua - #81
CLI chính thức cho Agentic Document Extraction (ADE) bởi LandingAI — phân tích tài liệu và trích xuất dữ liệu theo lược đồ trực tiếp từ terminal của bạn
★ 2.410+1Thay đổi số sao trong 7 ngày qua - #82
Framework LLM Agent trong ComfyUI bao gồm máy chủ MCP, Omost, GPT-sovits, ChatTTS, GOT-OCR2.0 và các node nhắc lệnh FLUX, truy cập Feishu, discord, và tương thích với mọi LLM có giao diện tương tự OpenAI / aisuite như o1, ollama, gemini, grok, qwen, GLM, deepseek, kimi, doubao. Tương thích với các LLM, VLM, GGUF chạy cục bộ như llama-3.3 Janus-Pro, Linkage graphRAG
★ 2.348+5Thay đổi số sao trong 7 ngày qua - #83
Hỗ trợ sắp xếp các tài liệu từ máy quét, email và các nguồn khác với nỗ lực tối thiểu.
★ 2.317+2Thay đổi số sao trong 7 ngày qua - #84
Công cụ chuyển đổi bảng màu hình nền, OCR với VLM truyền thống và lai, nén ảnh, trích xuất bảng màu, nâng cấp ảnh bằng mạng đối kháng (Adversarial Networks) và nhiều tính năng xử lý ảnh khác.
★ 2.303+1Thay đổi số sao trong 7 ngày qua - #85
Dịch file PDF trong khi vẫn giữ nguyên bố cục, công thức và cấu trúc, thích hợp cho tài liệu nghiên cứu và kỹ thuật
★ 2.234+8Thay đổi số sao trong 7 ngày qua - #86★ 2.184+0Thay đổi số sao trong 7 ngày qua
- #87
Công cụ OCR/VLM đa backend bằng Rust (DeepSeek‑OCR-1/2, PaddleOCR‑VL, DotsOCR) với lượng tử hóa DSQ cùng máy chủ tương thích OpenAI và CLI – chạy cục bộ không cần Python.
★ 2.184+1Thay đổi số sao trong 7 ngày qua - #88★ 2.171+0Thay đổi số sao trong 7 ngày qua
- #89
Một công cụ tìm kiếm "hoạt động mượt mà" dành cho Obsidian. Hỗ trợ OCR và lập chỉ mục PDF.
★ 2.131+2Thay đổi số sao trong 7 ngày qua - #90
Bộ công cụ trích xuất dữ liệu phi cấu trúc tại chỗ không cần OCR, chuyển đổi markdown và đánh giá chuẩn.
★ 2.086-1Thay đổi số sao trong 7 ngày qua