pdf-parser
pdf-parser टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर pdf-parser के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और pdf-parser टैग वाली रिपॉजिटरी।
- #1
किसी भी PDF या इमेज दस्तावेज़ को अपने AI के लिए संरचित डेटा में बदलें। एक शक्तिशाली, हल्का OCR टूलकिट जो इमेज/PDF और LLM के बीच की खाई को पाटता है। 100+ भाषाओं का समर्थन करता है।
★ 88,454+374पिछले 7 दिनों में स्टार का बदलाव - #2
PDFs और Office docs जैसे जटिल दस्तावेज़ों को आपके Agentic वर्कफ़्लो के लिए LLM-रेडी markdown/JSON में बदलता है।
★ 78,747+564पिछले 7 दिनों में स्टार का बदलाव - #3
AI-तैयार डेटा के लिए PDF पार्सर। PDF एक्सेसिबिलिटी को स्वचालित करें। ओपन-सोर्स।
★ 28,856+215पिछले 7 दिनों में स्टार का बदलाव - #4
PDF निरीक्षण, वर्गीकरण और टेक्स्ट एक्सट्रैक्शन के लिए तेज़ Rust लाइब्रेरी। स्मार्ट रूटिंग निर्णयों को सक्षम करने के लिए स्कैन किए गए बनाम टेक्स्ट-आधारित PDF का बुद्धिमानी से पता लगाता है।
★ 16,883+436पिछले 7 दिनों में स्टार का बदलाव - #5★ 12,196+46पिछले 7 दिनों में स्टार का बदलाव
- #6
एक शुद्ध-पायथन (pure-python) PDF लाइब्रेरी जो PDF फाइलों के पेजों को विभाजित, मर्ज, क्रॉप और रूपांतरित करने में सक्षम है
★ 10,177+12पिछले 7 दिनों में स्टार का बदलाव - #7
“Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025 के लिए आधिकारिक रेपो।
★ 9,049-1पिछले 7 दिनों में स्टार का बदलाव - #8
तेज़ और कुशल असंरचित डेटा निष्कर्षण। कई भाषाओं के लिए बाइंडिंग के साथ Rust में लिखा गया।
★ 1,772+2पिछले 7 दिनों में स्टार का बदलाव - #9
yft-design एक शक्तिशाली, दिखने में शानदार ऑनलाइन डिज़ाइन टूल है जिसे Vue3, fabric.js और Element Plus के साथ बनाया गया है।
★ 1,627+10पिछले 7 दिनों में स्टार का बदलाव - #10
आसानी से तैनात और स्केलेबल बैकएंड सर्वर जो विभिन्न दस्तावेज़ प्रारूपों (pdf, docx, pptx, html, images, आदि) को कुशलतापूर्वक Markdown में परिवर्तित करता है। CPU और GPU दोनों प्रोसेसिंग के समर्थन के साथ, यह बड़े पैमाने पर वर्कफ़्लो के लिए आदर्श है, यह सिंक/असिंक एंडपॉइंट्स के साथ टेक्स्ट/टेबल एक्सट्रैक्शन, OCR और बैच प्रोसेसिंग प्रदान करता है।
★ 1,584+95पिछले 7 दिनों में स्टार का बदलाव - #11
इंटेलिजेंट संरचित डेटा निष्कर्षण और उन्नत OCR के साथ किसी भी दस्तावेज़, छवियों, PDF, वर्ड डॉक्यूमेंट, PPT या URL से डेटा निकालें और उसे कई प्रारूपों (Markdown, JSON, CSV, HTML) में कंवर्ट करें।
★ 1,533+5पिछले 7 दिनों में स्टार का बदलाव - #12
Python और Rust के लिए सबसे तेज़ PDF लाइब्रेरी। टेक्स्ट एक्सट्रैक्शन, इमेज एक्सट्रैक्शन, मार्कडाउन कन्वर्ज़न, PDF निर्माण और संपादन। 0.8ms औसत, उद्योग के नेताओं से 5 गुना तेज़, 3,830 PDF पर 100% पास दर। MIT/Apache-2.0।
★ 1,006+37पिछले 7 दिनों में स्टार का बदलाव - #13★ 991+108पिछले 7 दिनों में स्टार का बदलाव
- #14
उच्च सटीकता के साथ PDF को मार्कडाउन में बदलने के लिए आसानी से तैनात होने वाला API
★ 984+0पिछले 7 दिनों में स्टार का बदलाव - #15
Dedoc दस्तावेज़ पार्सिंग को स्वचालित करने और उन्हें एक समान प्रारूप में लाने के लिए एक लाइब्रेरी (सर्विस) है। यह टेक्स्टुअल इलेक्ट्रॉनिक दस्तावेज़ों से सामग्री, तार्किक संरचना, टेबल और मेटा जानकारी को स्वचालित रूप से निकालता है।
★ 732+13पिछले 7 दिनों में स्टार का बदलाव - #16
[ECCV 2026] दस्तावेज़ OCR के लिए एक डिफ़्यूज़न-आधारित फ्रेमवर्क जो ऑटोरेग्रेसिव डिकोडिंग को ब्लॉक-स्तरीय समानांतर डिफ़्यूज़न डिकोडिंग से बदलता है।
★ 615+1पिछले 7 दिनों में स्टार का बदलाव