document-parsing
document-parsing टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर document-parsing के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और document-parsing टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
किसी भी PDF या इमेज दस्तावेज़ को अपने AI के लिए संरचित डेटा में बदलें। एक शक्तिशाली, हल्का OCR टूलकिट जो इमेज/PDF और LLM के बीच की खाई को पाटता है। 100+ भाषाओं का समर्थन करता है।
★ 88,454+374पिछले 7 दिनों में स्टार का बदलाव - #2★ 65,726+352पिछले 7 दिनों में स्टार का बदलाव
- #3
AI-तैयार डेटा के लिए PDF पार्सर। PDF एक्सेसिबिलिटी को स्वचालित करें। ओपन-सोर्स।
★ 28,856+215पिछले 7 दिनों में स्टार का बदलाव - #4
दस्तावेजों को आसानी से संरचित डेटा में बदलें। Unstructured, भाषा मॉडल के लिए जटिल दस्तावेजों को स्वच्छ, संरचित प्रारूपों में बदलने का ओपन-सोर्स ETL समाधान है।
★ 15,362+31पिछले 7 दिनों में स्टार का बदलाव - #5
क्लाउड में नॉलेज एजेंट्स और मैनेजमेंट
★ 4,262+0पिछले 7 दिनों में स्टार का बदलाव - #6
LandingAI द्वारा Agentic Document Extraction (ADE) के लिए आधिकारिक CLI — दस्तावेज़ पार्स करें और अपने टर्मिनल से स्कीमा-आकार का डेटा निकालें
★ 2,409+4पिछले 7 दिनों में स्टार का बदलाव - #7
ExtractThinker LLM के लिए एक डॉक्यूमेंट इंटेलिजेंस लाइब्रेरी है, जो लचीले और शक्तिशाली डॉक्यूमेंट वर्कफ़्लो के लिए ORM-शैली की सहभागिता प्रदान करती है।
★ 1,595+2पिछले 7 दिनों में स्टार का बदलाव - #8
इंटेलिजेंट संरचित डेटा निष्कर्षण और उन्नत OCR के साथ किसी भी दस्तावेज़, छवियों, PDF, वर्ड डॉक्यूमेंट, PPT या URL से डेटा निकालें और उसे कई प्रारूपों (Markdown, JSON, CSV, HTML) में कंवर्ट करें।
★ 1,533+5पिछले 7 दिनों में स्टार का बदलाव - #9
OpenOCR: सामान्य-OCR अनुसंधान और अनुप्रयोगों के लिए एक ओपन-सोर्स टूलकिट, जो एक एकीकृत प्रशिक्षण और मूल्यांकन बेंचमार्क, वाणिज्यिक-ग्रेड OCR और दस्तावेज़ पार्सिंग सिस्टम, और शैक्षणिक पत्रों की एक विस्तृत श्रृंखला से कोर कार्यान्वयन के वफादार पुनरुत्पादन को एकीकृत करता है।
★ 1,440+3पिछले 7 दिनों में स्टार का बदलाव - #10★ 1,041+23पिछले 7 दिनों में स्टार का बदलाव
- #11
स्थानीय और स्वयं-होस्ट किए गए दस्तावेज़ खोज के लिए एजेंटिक RAG: एम्बेडेड LanceDB पर हाइब्रिड रिट्रीवल, रीरैंकिंग और मल्टीमॉडल RAG, Docling पार्सिंग और एक MCP सर्वर के साथ।
★ 584+2पिछले 7 दिनों में स्टार का बदलाव - #12
ParseBench - AI एजेंटों के लिए एक दस्तावेज़ पार्सिंग बेंचमार्क
★ 554+2पिछले 7 दिनों में स्टार का बदलाव - #13
Hybrid RAG system combining vector search, knowledge graph (LightRAG), and cross-encoder reranking — with Docling document parsing, visual intelligence (image/table captioning), agentic streaming chat, and inline citations. Powered by Gemini or local Ollama models.
★ 505—पिछले 7 दिनों में स्टार का बदलाव