vision-transformer
Erfasste Open-Source-Repos mit dem Tag vision-transformer, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit vision-transformer am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit vision-transformer getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
OpenMMLab Detection Toolbox und Benchmark
★ 32.901+6Sterne-Änderung der letzten 7 Tage - #2
pix2tex: Verwendung eines ViT zur Umwandlung von Gleichungsbildern in LaTeX-Code.
★ 16.549+0Sterne-Änderung der letzten 7 Tage - #3
Dieses Repository enthält Demos, die ich mit der Transformers-Bibliothek von HuggingFace erstellt habe.
★ 11.748+0Sterne-Änderung der letzten 7 Tage - #4
[NeurIPS 2024 Best Paper Award][GPT beats diffusion🔥] [Skalierungsgesetze in der visuellen Erzeugung📈] Offizielle Implementierung von "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Eine *ultraeinfache, benutzerfreundliche und dennoch hochmoderne* Codebasis für die autoregressive Bilderzeugung!
★ 8.728-1Sterne-Änderung der letzten 7 Tage - #5
Erfassen, analysieren und optimieren Sie jedes Datenformat ➡️ von Dokumenten bis hin zu Multimedia ➡️ für verbesserte Kompatibilität mit GenAI-Frameworks.
★ 7.823+4Sterne-Änderung der letzten 7 Tage - #6★ 5.586+6Sterne-Änderung der letzten 7 Tage
- #7
MLX-VLM ist ein Paket für Inferenz und Fine-Tuning von Vision Language Models (VLMs) auf dem Mac mit MLX.
★ 5.462+25Sterne-Änderung der letzten 7 Tage - #8
Eine äußerst umfassende Liste von Arbeiten zu Vision Transformer/Attention, einschließlich Papern, Codes und zugehörigen Websites
★ 5.046-3Sterne-Änderung der letzten 7 Tage - #9
Effiziente KI-Backbones einschließlich GhostNet, TNT und MLP, entwickelt vom Huawei Noah's Ark Lab.
★ 4.419+1Sterne-Änderung der letzten 7 Tage - #10
OpenMMLab Pre-training Toolbox und Benchmark
★ 3.850-1Sterne-Änderung der letzten 7 Tage - #11
Das erste Vision-Plugin für DeepSeek Harness und die Vision-Brücke für jeden reinen Text-Coding-Agenten. Bild einfügen, strukturierte JSON-Beweise erhalten (OCR, Layout, Semantik).
★ 3.839+83Sterne-Änderung der letzten 7 Tage - #12
Scenic: Eine Jax-Bibliothek für die Computer-Vision-Forschung und darüber hinaus
★ 3.821+0Sterne-Änderung der letzten 7 Tage - #13
Towhee ist ein Framework, das darauf ausgerichtet ist, Pipelines zur Verarbeitung neuronaler Daten einfach und schnell zu machen.
★ 3.453-1Sterne-Änderung der letzten 7 Tage - #14
Effiziente Vision-Foundation-Modelle für hochauflösende Generierung und Wahrnehmung.
★ 3.356+1Sterne-Änderung der letzten 7 Tage - #15
InternLM-XComposer2.5-OmniLive: Ein umfassendes multimodales System für langfristige Streaming-Video- und Audio-Interaktionen
★ 2.925-1Sterne-Änderung der letzten 7 Tage - #16★ 2.695+2Sterne-Änderung der letzten 7 Tage
- #17
[ECCV2024] Video Foundation Models & Data für multimodales Verständnis
★ 2.374+5Sterne-Änderung der letzten 7 Tage - #18
[CVPR 2025] Offizielle PyTorch-Implementierung von MambaVision: Ein hybrides Mamba-Transformer-Vision-Backbone.
★ 2.227+2Sterne-Änderung der letzten 7 Tage - #19
Das offizielle Repository für [NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" und [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation"
★ 2.139+0Sterne-Änderung der letzten 7 Tage - #20
[CVPR 2021] Offizielle PyTorch-Implementierung für Transformer Interpretability Beyond Attention Visualization, eine neuartige Methode zur Visualisierung von Klassifikationen durch Transformer-basierte Netzwerke.
★ 2.014+0Sterne-Änderung der letzten 7 Tage - #21★ 1.955+1Sterne-Änderung der letzten 7 Tage
- #22★ 1.841+2Sterne-Änderung der letzten 7 Tage
- #23
All-in-One-Training für Vision-Modelle (YOLO, ViTs, RT-DETR, DINOv3): Vortraining, Fine-Tuning, Distillation.
★ 1.656+4Sterne-Änderung der letzten 7 Tage - #24
[ICLR 2023 Spotlight] Vision Transformer Adapter für dichte Vorhersagen
★ 1.503+1Sterne-Änderung der letzten 7 Tage - #25
Eine kuratierte Liste von Foundation Models für Bild- und Sprachaufgaben
★ 1.177+0Sterne-Änderung der letzten 7 Tage - #26
UNetFormer: Ein UNet-ähnlicher Transformer für die effiziente semantische Segmentierung von Fernerkundungs-Stadtbildern (ISPRS). Enthält zudem weitere Vision Transformer und CNNs für die Segmentierung von Satelliten-, Luft- und Drohnenbildern.
★ 1.101+3Sterne-Änderung der letzten 7 Tage - #27
Ein allgemeines Repräsentationsmodell über Bild-, Audio- und Sprachmodalitäten. Paper: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Sterne-Änderung der letzten 7 Tage - #28
[ICML2025] SpargeAttention: Eine trainingsfreie sparse Attention, die die Inferenz beliebiger Modelle beschleunigt.
★ 1.045+3Sterne-Änderung der letzten 7 Tage - #29
:fire: :fire: :fire: Eine Literaturliste zu einigen aktuellen Arbeiten im Bereich Computer Vision (CV)
★ 973+1Sterne-Änderung der letzten 7 Tage - #30
Repository von Vision Transformer with Deformable Attention (CVPR2022) und DAT++: Spatially Dynamic Vision Transformer with Deformable Attention
★ 942+0Sterne-Änderung der letzten 7 Tage