vision-transformer
vision-transformer टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर vision-transformer के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और vision-transformer टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
OpenMMLab डिटेक्शन टूलबॉक्स और बेंचमार्क
★ 32,901+6पिछले 7 दिनों में स्टार का बदलाव - #2
pix2tex: समीकरणों की छवियों को LaTeX कोड में बदलने के लिए ViT का उपयोग करना।
★ 16,549+0पिछले 7 दिनों में स्टार का बदलाव - #3
इस रिपॉजिटरी में HuggingFace की Transformers लाइब्रेरी के साथ बनाए गए मेरे डेमो शामिल हैं।
★ 11,748+0पिछले 7 दिनों में स्टार का बदलाव - #4
[NeurIPS 2024 बेस्ट पेपर अवार्ड][GPT बीट्स डिफ्यूजन🔥] [विजुअल जनरेशन में स्केलिंग कानून📈] "विजुअल ऑटोरेग्रेसिव मॉडलिंग: नेक्स्ट-स्कôi प्रेडिक्शन के माध्यम से स्केलेबल इमेज जनरेशन" का आधिकारिक कार्यान्वयन। ऑटोरेग्रेसिव इमेज जनरेशन के लिए एक *अति-सरल, उपयोगकर्ता के अनुकूल और अत्याधुनिक* कोडिंग बेस!
★ 8,728-1पिछले 7 दिनों में स्टार का बदलाव - #5
GenAI फ्रेमवर्क के साथ बेहतर अनुकूलता के लिए किसी भी डेटा फॉर्मेट को इंजेस्ट, पार्स और ऑप्टिमाइज़ करें ➡️ दस्तावेज़ों से लेकर मल्टीमीडिया तक
★ 7,823+4पिछले 7 दिनों में स्टार का बदलाव - #6★ 5,586+6पिछले 7 दिनों में स्टार का बदलाव
- #7
MLX-VLM MLX का उपयोग करके आपके Mac पर विजन लैंग्वेज मॉडल (VLMs) के अनुमान और फ़ाइन-ट्यूनिंग के लिए एक पैकेज है।
★ 5,462+25पिछले 7 दिनों में स्टार का बदलाव - #8
Vision Transformer/Attention की अत्यधिक व्यापक पेपर सूची, जिसमें पेपर, कोड और संबंधित वेबसाइटें शामिल हैं
★ 5,046-3पिछले 7 दिनों में स्टार का बदलाव - #9
Huawei Noah's Ark Lab द्वारा विकसित GhostNet, TNT और MLP सहित कुशल AI बैकबोन।
★ 4,419+1पिछले 7 दिनों में स्टार का बदलाव - #10
OpenMMLab प्री-ट्रेनिंग टूलबॉक्स और बेंचमार्क
★ 3,850-1पिछले 7 दिनों में स्टार का बदलाव - #11
DeepSeek Harness के लिए पहला विजन प्लग-इन, और हर टेक्स्ट-ओनली कोडिंग एजेंट के लिए विजन ब्रिज। एक छवि पेस्ट करें, संरचित JSON साक्ष्य (OCR, लेआउट, सिमेंटिक्स) प्राप्त करें।
★ 3,839+83पिछले 7 दिनों में स्टार का बदलाव - #12★ 3,821+0पिछले 7 दिनों में स्टार का बदलाव
- #13
Towhee एक ऐसा फ्रेमवर्क है जो न्यूरल डेटा प्रोसेसिंग पाइपलाइन को सरल और तेज़ बनाने के लिए समर्पित है।
★ 3,453-1पिछले 7 दिनों में स्टार का बदलाव - #14
उच्च-रिज़ॉल्यूशन जेनरेशन और परसेप्शन के लिए कुशल विजन फाउंडेशन मॉडल।
★ 3,356+1पिछले 7 दिनों में स्टार का बदलाव - #15
InternLM-XComposer2.5-OmniLive: लॉन्ग-टर्म स्ट्रीमिंग वीडियो और ऑडियो इंटरैक्शन के लिए एक व्यापक मल्टीमॉडल सिस्टम
★ 2,925-1पिछले 7 दिनों में स्टार का बदलाव - #16★ 2,695+2पिछले 7 दिनों में स्टार का बदलाव
- #17
[ECCV2024] मल्टीमॉडल समझ के लिए वीडियो फाउंडेशन मॉडल और डेटा
★ 2,374+5पिछले 7 दिनों में स्टार का बदलाव - #18
[CVPR 2025] MambaVision का आधिकारिक PyTorch कार्यान्वयन: एक हाइब्रिड Mamba-Transformer विजन बैक बोन
★ 2,227+2पिछले 7 दिनों में स्टार का बदलाव - #19
[NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" और [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation" के लिए आधिकारिक रिपॉजिटरी
★ 2,139+0पिछले 7 दिनों में स्टार का बदलाव - #20
[CVPR 2021] Transformer Interpretability Beyond Attention Visualization के लिए आधिकारिक PyTorch कार्यान्वयन, Transformer आधारित नेटवर्क द्वारा वर्गीकरण को विज़ुअलाइज़ करने की एक नई विधि।
★ 2,014+0पिछले 7 दिनों में स्टार का बदलाव - #21★ 1,955+1पिछले 7 दिनों में स्टार का बदलाव
- #22★ 1,841+2पिछले 7 दिनों में स्टार का बदलाव
- #23
विज़न मॉडल (YOLO, ViTs, RT-DETR, DINOv3) के लिए ऑल-इन-वन ट्रेनिंग: प्री-ट्रेनिंग, फाइन-ट्यूनिंग, डिस्टिलेशन।
★ 1,656+4पिछले 7 दिनों में स्टार का बदलाव - #24
[ICLR 2023 स्पॉटलाइट] डेंस प्रेडिक्शन के लिए विजन ट्रांसफॉर्मर अडैप्टर
★ 1,503+1पिछले 7 दिनों में स्टार का बदलाव - #25
विज़न और लैंग्वेज कार्यों के लिए फाउंडेशन मॉडल की एक क्यूरेटेड सूची
★ 1,177+0पिछले 7 दिनों में स्टार का बदलाव - #26
UNetFormer: रिमोट सेंसिंग शहरी दृश्य इमेजरी के कुशल सिमेंटिक सेगमेंटेशन के लिए एक UNet जैसा ट्रांसफार्मर, ISPRS। इसके अलावा, उपग्रह, एरियल इमेज और UAV इमेज सेगमेंटेशन के लिए अन्य विजन ट्रांसफार्मर और CNN शामिल हैं।
★ 1,101+3पिछले 7 दिनों में स्टार का बदलाव - #27
विज़न, ऑडियो और भाषा मोडैलिटीज़ के लिए एक सामान्य प्रतिनिधित्व मॉडल। पेपर: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1,060+0पिछले 7 दिनों में स्टार का बदलाव - #28
[ICML2025] SpargeAttention: एक ट्रेनिंग-मुक्त स्पार्स अटेंशन जो किसी भी मॉडल के इन्फॉरेंस को गति देता है।
★ 1,045+1पिछले 7 दिनों में स्टार का बदलाव - #29
हाल के कुछ कंप्यूटर विज़न (CV) कार्यों की पेपर सूची
★ 973+1पिछले 7 दिनों में स्टार का बदलाव - #30
PyTorch में SOTA सिमेंटिक सेगमेंटेशन मॉडल्स
★ 942-1पिछले 7 दिनों में स्टार का बदलाव