Saltar al contenido principal
buildradar
Sign in
Tema · vision-transformer

vision-transformer

Repositorios de código abierto monitorizados etiquetados con vision-transformer, ordenados por estrellas.

Repositorios
45
Estrellas totales
154.486
Estrellas de media
3433
Proporción
0,01%

Temas que aparecen con frecuencia junto a vision-transformer en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con vision-transformer.

No hay repositorios nuevos con este tema en los últimos 90 días.

  • mmdetection@open-mmlab

    Caja de herramientas y banco de pruebas de detección de OpenMMLab

    32.901+6Variación de estrellas de los últimos 7 días
  • LaTeX-OCR@lukas-blecher

    pix2tex: uso de un ViT para convertir imágenes de ecuaciones en código LaTeX

    16.549+0Variación de estrellas de los últimos 7 días
  • Transformers-Tutorials@NielsRogge

    Este repositorio contiene demostraciones que hice con la librería Transformers de HuggingFace.

    11.748+0Variación de estrellas de los últimos 7 días
  • VAR@FoundationVision

    [Premio al Mejor Artículo en NeurIPS 2024][GPT supera a diffusion🔥] [leyes de escala en generación visual📈] Implementación oficial de "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". ¡Una base de código *ultrasimple, fácil de usar y de última generación* para la generación autorregresiva de imágenes!

    8728-1Variación de estrellas de los últimos 7 días
  • omniparse@adithya-s-k

    Ingesta, analiza y optimiza cualquier formato de datos ➡️ desde documentos hasta multimedia ➡️ para una mayor compatibilidad con frameworks de GenAI

    7823+4Variación de estrellas de los últimos 7 días
  • SwinIR@JingyunLiang

    SwinIR: Restauración de imágenes usando Swin Transformer (repositorio oficial)

    5586+6Variación de estrellas de los últimos 7 días
  • mlx-vlm@Blaizzy

    MLX-VLM es un paquete para la inferencia y ajuste fino de modelos de lenguaje visual (VLM) en tu Mac utilizando MLX.

    5462+25Variación de estrellas de los últimos 7 días
  • Una lista de artículos sumamente completa sobre Vision Transformer/Attention, que incluye artículos, códigos y sitios web relacionados

    5046-3Variación de estrellas de los últimos 7 días
  • Efficient-AI-Backbones@huawei-noah

    Backbones de IA eficientes que incluyen GhostNet, TNT y MLP, desarrollados por Huawei Noah's Ark Lab.

    4419+1Variación de estrellas de los últimos 7 días
  • mmpretrain@open-mmlab

    Caja de herramientas de preentrenamiento y Benchmark de OpenMMLab

    3850-1Variación de estrellas de los últimos 7 días
  • modlens@liustack

    El primer plugin de visión para DeepSeek Harness, y el puente de visión para cada agente de codificación de solo texto. Pega una imagen, obtén evidencia JSON estructurada (OCR, diseño, semántica). | El plugin de visión externo más potente de toda la red para DeepSeek Harness, que aporta capacidades de visión a modelos de solo texto como DeepSeek y GLM; pega una imagen para obtener evidencia JSON estructurada (OCR, diseño, semántica).

    3839+83Variación de estrellas de los últimos 7 días
  • scenic@google-research

    Scenic: una biblioteca de Jax para investigación en visión por computador y más allá

    3821+0Variación de estrellas de los últimos 7 días
  • towhee@towhee-io

    Towhee es un framework dedicado a hacer que los pipelines de procesamiento de datos neuronales sean simples y rápidos.

    3453-1Variación de estrellas de los últimos 7 días
  • efficientvit@mit-han-lab

    Modelos fundacionales de visión eficientes para generación y percepción de alta resolución.

    3356+1Variación de estrellas de los últimos 7 días
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Un sistema multimodal completo para interacciones de video y audio en streaming de larga duración

    2925-1Variación de estrellas de los últimos 7 días
  • EVA@baaivision

    Serie EVA: Fantasías de representación visual de BAAI

    2695+2Variación de estrellas de los últimos 7 días
  • InternVideo@OpenGVLab

    [ECCV2024] Modelos base de video y datos para comprensión multimodal

    2374+5Variación de estrellas de los últimos 7 días
  • MambaVision@NVlabs

    [CVPR 2025] Implementación oficial en PyTorch de MambaVision: un troncal de visión híbrido Mamba-Transformer

    2227+2Variación de estrellas de los últimos 7 días
  • ViTPose@ViTAE-Transformer

    Repositorio oficial de [NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" y [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation".

    2139+0Variación de estrellas de los últimos 7 días
  • Transformer-Explainability@hila-chefer

    [CVPR 2021] Implementación oficial en PyTorch para Transformer Interpretability Beyond Attention Visualization, un método novedoso para visualizar clasificaciones en redes basadas en Transformer.

    2014+0Variación de estrellas de los últimos 7 días
  • EasyCV@alibaba

    Un conjunto de herramientas todo en uno para visión por computadora

    1955+1Variación de estrellas de los últimos 7 días
  • Cream@microsoft

    Una colección de nuestros trabajos sobre NAS y Vision Transformer

    1841+2Variación de estrellas de los últimos 7 días
  • lightly-train@lightly-ai

    Entrenamiento integral para modelos de visión (YOLO, ViTs, RT-DETR, DINOv3): preentrenamiento, ajuste fino y destilación.

    1656+4Variación de estrellas de los últimos 7 días
  • ViT-Adapter@czczup

    [ICLR 2023 Spotlight] Vision Transformer Adapter para predicciones densas

    1503+1Variación de estrellas de los últimos 7 días
  • Una lista curada de modelos base para tareas de visión y lenguaje.

    1177+0Variación de estrellas de los últimos 7 días
  • GeoSeg@WangLibo1995

    UNetFormer: Un transformer de tipo UNet para la segmentación semántica eficiente de imágenes de escenas urbanas de teledetección (ISPRS). También incluye otros vision transformers y CNN para la segmentación de imágenes de satélite, aéreas y de drones.

    1101+3Variación de estrellas de los últimos 7 días
  • ONE-PEACE@OFA-Sys

    Un modelo de representación general para modalidades de visión, audio y lenguaje. Artículo: ONE-PEACE: Explorando un modelo de representación general hacia modalidades ilimitadas.

    1060+0Variación de estrellas de los últimos 7 días
  • SpargeAttn@thu-ml

    [ICML2025] SpargeAttention: una atención dispersa sin entrenamiento que acelera la inferencia de cualquier modelo.

    1043+1Variación de estrellas de los últimos 7 días
  • Una lista de artículos sobre trabajos recientes de Visión Artificial (CV)

    973+1Variación de estrellas de los últimos 7 días
  • semantic-segmentation@sithu31296

    Modelos SOTA de segmentación semántica en PyTorch

    942-1Variación de estrellas de los últimos 7 días
← Volver a temas