vision-transformer
Repositorios de código abierto monitorizados etiquetados con vision-transformer, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a vision-transformer en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con vision-transformer.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Caja de herramientas y banco de pruebas de detección de OpenMMLab
★ 32.901+6Variación de estrellas de los últimos 7 días - #2
pix2tex: uso de un ViT para convertir imágenes de ecuaciones en código LaTeX
★ 16.549+0Variación de estrellas de los últimos 7 días - #3
Este repositorio contiene demostraciones que hice con la librería Transformers de HuggingFace.
★ 11.748+0Variación de estrellas de los últimos 7 días - #4
[Premio al Mejor Artículo en NeurIPS 2024][GPT supera a diffusion🔥] [leyes de escala en generación visual📈] Implementación oficial de "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". ¡Una base de código *ultrasimple, fácil de usar y de última generación* para la generación autorregresiva de imágenes!
★ 8728-1Variación de estrellas de los últimos 7 días - #5
Ingesta, analiza y optimiza cualquier formato de datos ➡️ desde documentos hasta multimedia ➡️ para una mayor compatibilidad con frameworks de GenAI
★ 7823+4Variación de estrellas de los últimos 7 días - #6★ 5586+6Variación de estrellas de los últimos 7 días
- #7
MLX-VLM es un paquete para la inferencia y ajuste fino de modelos de lenguaje visual (VLM) en tu Mac utilizando MLX.
★ 5462+25Variación de estrellas de los últimos 7 días - #8
Una lista de artículos sumamente completa sobre Vision Transformer/Attention, que incluye artículos, códigos y sitios web relacionados
★ 5046-3Variación de estrellas de los últimos 7 días - #9
Backbones de IA eficientes que incluyen GhostNet, TNT y MLP, desarrollados por Huawei Noah's Ark Lab.
★ 4419+1Variación de estrellas de los últimos 7 días - #10
Caja de herramientas de preentrenamiento y Benchmark de OpenMMLab
★ 3850-1Variación de estrellas de los últimos 7 días - #11
El primer plugin de visión para DeepSeek Harness, y el puente de visión para cada agente de codificación de solo texto. Pega una imagen, obtén evidencia JSON estructurada (OCR, diseño, semántica). | El plugin de visión externo más potente de toda la red para DeepSeek Harness, que aporta capacidades de visión a modelos de solo texto como DeepSeek y GLM; pega una imagen para obtener evidencia JSON estructurada (OCR, diseño, semántica).
★ 3839+83Variación de estrellas de los últimos 7 días - #12
Scenic: una biblioteca de Jax para investigación en visión por computador y más allá
★ 3821+0Variación de estrellas de los últimos 7 días - #13
Towhee es un framework dedicado a hacer que los pipelines de procesamiento de datos neuronales sean simples y rápidos.
★ 3453-1Variación de estrellas de los últimos 7 días - #14
Modelos fundacionales de visión eficientes para generación y percepción de alta resolución.
★ 3356+1Variación de estrellas de los últimos 7 días - #15
InternLM-XComposer2.5-OmniLive: Un sistema multimodal completo para interacciones de video y audio en streaming de larga duración
★ 2925-1Variación de estrellas de los últimos 7 días - #16★ 2695+2Variación de estrellas de los últimos 7 días
- #17
[ECCV2024] Modelos base de video y datos para comprensión multimodal
★ 2374+5Variación de estrellas de los últimos 7 días - #18
[CVPR 2025] Implementación oficial en PyTorch de MambaVision: un troncal de visión híbrido Mamba-Transformer
★ 2227+2Variación de estrellas de los últimos 7 días - #19
Repositorio oficial de [NeurIPS'22] "ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation" y [TPAMI'23] "ViTPose++: Vision Transformer for Generic Body Pose Estimation".
★ 2139+0Variación de estrellas de los últimos 7 días - #20
[CVPR 2021] Implementación oficial en PyTorch para Transformer Interpretability Beyond Attention Visualization, un método novedoso para visualizar clasificaciones en redes basadas en Transformer.
★ 2014+0Variación de estrellas de los últimos 7 días - #21★ 1955+1Variación de estrellas de los últimos 7 días
- #22★ 1841+2Variación de estrellas de los últimos 7 días
- #23
Entrenamiento integral para modelos de visión (YOLO, ViTs, RT-DETR, DINOv3): preentrenamiento, ajuste fino y destilación.
★ 1656+4Variación de estrellas de los últimos 7 días - #24
[ICLR 2023 Spotlight] Vision Transformer Adapter para predicciones densas
★ 1503+1Variación de estrellas de los últimos 7 días - #25
Una lista curada de modelos base para tareas de visión y lenguaje.
★ 1177+0Variación de estrellas de los últimos 7 días - #26
UNetFormer: Un transformer de tipo UNet para la segmentación semántica eficiente de imágenes de escenas urbanas de teledetección (ISPRS). También incluye otros vision transformers y CNN para la segmentación de imágenes de satélite, aéreas y de drones.
★ 1101+3Variación de estrellas de los últimos 7 días - #27
Un modelo de representación general para modalidades de visión, audio y lenguaje. Artículo: ONE-PEACE: Explorando un modelo de representación general hacia modalidades ilimitadas.
★ 1060+0Variación de estrellas de los últimos 7 días - #28
[ICML2025] SpargeAttention: una atención dispersa sin entrenamiento que acelera la inferencia de cualquier modelo.
★ 1043+1Variación de estrellas de los últimos 7 días - #29
Una lista de artículos sobre trabajos recientes de Visión Artificial (CV)
★ 973+1Variación de estrellas de los últimos 7 días - #30
Modelos SOTA de segmentación semántica en PyTorch
★ 942-1Variación de estrellas de los últimos 7 días