Zum Hauptinhalt springen
buildradar
Sign in
Thema · vision-transformer

vision-transformer

Erfasste Open-Source-Repos mit dem Tag vision-transformer, sortiert nach Sternen.

Repos
45
Sterne gesamt
154.486
Sterne im Schnitt
3.433
Anteil
0,01%

Themen, die häufig gemeinsam mit vision-transformer am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit vision-transformer getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • mmdetection@open-mmlab

    OpenMMLab Detection Toolbox und Benchmark

    32.901+6Sterne-Änderung der letzten 7 Tage
  • LaTeX-OCR@lukas-blecher

    pix2tex: Verwendung eines ViT zur Umwandlung von Gleichungsbildern in LaTeX-Code.

    16.549+0Sterne-Änderung der letzten 7 Tage
  • Transformers-Tutorials@NielsRogge

    Dieses Repository enthält Demos, die ich mit der Transformers-Bibliothek von HuggingFace erstellt habe.

    11.748+0Sterne-Änderung der letzten 7 Tage
  • VAR@FoundationVision

    [NeurIPS 2024 Best Paper Award][GPT beats diffusion🔥] [Skalierungsgesetze in der visuellen Erzeugung📈] Offizielle Implementierung von "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Eine *ultraeinfache, benutzerfreundliche und dennoch hochmoderne* Codebasis für die autoregressive Bilderzeugung!

    8.728-1Sterne-Änderung der letzten 7 Tage
  • omniparse@adithya-s-k

    Erfassen, analysieren und optimieren Sie jedes Datenformat ➡️ von Dokumenten bis hin zu Multimedia ➡️ für verbesserte Kompatibilität mit GenAI-Frameworks.

    7.823+4Sterne-Änderung der letzten 7 Tage
  • SwinIR@JingyunLiang

    SwinIR: Bildwiederherstellung mit Swin Transformer (offizielles Repository)

    5.586+6Sterne-Änderung der letzten 7 Tage
  • mlx-vlm@Blaizzy

    MLX-VLM ist ein Paket für Inferenz und Fine-Tuning von Vision Language Models (VLMs) auf dem Mac mit MLX.

    5.462+25Sterne-Änderung der letzten 7 Tage
  • Eine äußerst umfassende Liste von Arbeiten zu Vision Transformer/Attention, einschließlich Papern, Codes und zugehörigen Websites

    5.046-3Sterne-Änderung der letzten 7 Tage
  • Efficient-AI-Backbones@huawei-noah

    Effiziente KI-Backbones einschließlich GhostNet, TNT und MLP, entwickelt vom Huawei Noah's Ark Lab.

    4.419+1Sterne-Änderung der letzten 7 Tage
  • mmpretrain@open-mmlab

    OpenMMLab Pre-training Toolbox und Benchmark

    3.850-1Sterne-Änderung der letzten 7 Tage
  • modlens@liustack

    Das erste Vision-Plugin für DeepSeek Harness und die Vision-Brücke für jeden reinen Text-Coding-Agenten. Bild einfügen, strukturierte JSON-Beweise erhalten (OCR, Layout, Semantik).

    3.839+83Sterne-Änderung der letzten 7 Tage
  • scenic@google-research

    Scenic: Eine Jax-Bibliothek für die Computer-Vision-Forschung und darüber hinaus

    3.821+0Sterne-Änderung der letzten 7 Tage
  • towhee@towhee-io

    Towhee ist ein Framework, das darauf ausgerichtet ist, Pipelines zur Verarbeitung neuronaler Daten einfach und schnell zu machen.

    3.453-1Sterne-Änderung der letzten 7 Tage
  • efficientvit@mit-han-lab

    Effiziente Vision-Foundation-Modelle für hochauflösende Generierung und Wahrnehmung.

    3.356+1Sterne-Änderung der letzten 7 Tage
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Ein umfassendes multimodales System für langfristige Streaming-Video- und Audio-Interaktionen

    2.925-1Sterne-Änderung der letzten 7 Tage
  • EVA@baaivision

    EVA Series: Visual Representation Fantasies von BAAI

    2.695+2Sterne-Änderung der letzten 7 Tage
  • InternVideo@OpenGVLab

    [ECCV2024] Video Foundation Models & Data für multimodales Verständnis

    2.374+5Sterne-Änderung der letzten 7 Tage
  • MambaVision@NVlabs

    [CVPR 2025] Offizielle PyTorch-Implementierung von MambaVision: Ein hybrides Mamba-Transformer-Vision-Backbone.

    2.227+2Sterne-Änderung der letzten 7 Tage
  • ViTPose@ViTAE-Transformer

    Das offizielle Repository für [NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" und [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation"

    2.139+0Sterne-Änderung der letzten 7 Tage
  • Transformer-Explainability@hila-chefer

    [CVPR 2021] Offizielle PyTorch-Implementierung für Transformer Interpretability Beyond Attention Visualization, eine neuartige Methode zur Visualisierung von Klassifikationen durch Transformer-basierte Netzwerke.

    2.014+0Sterne-Änderung der letzten 7 Tage
  • EasyCV@alibaba

    Ein All-in-One-Toolkit für Computer Vision

    1.955+1Sterne-Änderung der letzten 7 Tage
  • Cream@microsoft

    Dies ist eine Sammlung unserer Arbeiten zu NAS und Vision Transformer.

    1.841+2Sterne-Änderung der letzten 7 Tage
  • lightly-train@lightly-ai

    All-in-One-Training für Vision-Modelle (YOLO, ViTs, RT-DETR, DINOv3): Vortraining, Fine-Tuning, Distillation.

    1.656+4Sterne-Änderung der letzten 7 Tage
  • ViT-Adapter@czczup

    [ICLR 2023 Spotlight] Vision Transformer Adapter für dichte Vorhersagen

    1.503+1Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste von Foundation Models für Bild- und Sprachaufgaben

    1.177+0Sterne-Änderung der letzten 7 Tage
  • GeoSeg@WangLibo1995

    UNetFormer: Ein UNet-ähnlicher Transformer für die effiziente semantische Segmentierung von Fernerkundungs-Stadtbildern (ISPRS). Enthält zudem weitere Vision Transformer und CNNs für die Segmentierung von Satelliten-, Luft- und Drohnenbildern.

    1.101+3Sterne-Änderung der letzten 7 Tage
  • ONE-PEACE@OFA-Sys

    Ein allgemeines Repräsentationsmodell über Bild-, Audio- und Sprachmodalitäten. Paper: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1.060+0Sterne-Änderung der letzten 7 Tage
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: Eine trainingsfreie sparse Attention, die die Inferenz beliebiger Modelle beschleunigt.

    1.045+3Sterne-Änderung der letzten 7 Tage
  • :fire: :fire: :fire: Eine Literaturliste zu einigen aktuellen Arbeiten im Bereich Computer Vision (CV)

    973+1Sterne-Änderung der letzten 7 Tage
  • DAT@LeapLabTHU

    Repository von Vision Transformer with Deformable Attention (CVPR2022) und DAT++: Spatially Dynamic Vision Transformer with Deformable Attention

    942+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen