FoundationVision
Repositorios de código abierto monitorizados de FoundationVision, ordenados por estrellas.
- #1
[Premio al Mejor Artículo en NeurIPS 2024][GPT supera a diffusion🔥] [leyes de escala en generación visual📈] Implementación oficial de "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". ¡Una base de código *ultrasimple, fácil de usar y de última generación* para la generación autorregresiva de imágenes!
★ 8728-1Variación de estrellas de los últimos 7 días - #2
[ECCV 2022] ByteTrack: Seguimiento de múltiples objetos asociando cada cuadro de detección
★ 6662+4Variación de estrellas de los últimos 7 días - #3
El modelo autorregresivo supera a la difusión: 🦙 Llama para la generación escalable de imágenes
★ 1966+0Variación de estrellas de los últimos 7 días - #4
[CVPR 2025 Oral] Infinity ∞: Escalado de modelado autorregresivo bit a bit para la síntesis de imágenes de alta resolución.
★ 1587+0Variación de estrellas de los últimos 7 días - #5
[CVPR2024 Highlight] GLEE: modelo base de objetos generales para imágenes y videos a gran escala.
★ 1170+0Variación de estrellas de los últimos 7 días - #6
Modelo fundacional de video de nivel industrial para la generación unificada de texto a video (T2V) e imagen a video (I2V).
★ 952+0Variación de estrellas de los últimos 7 días - #7
[NeurIPS 2025 Oral] Infinity⭐️: Modelado autorregresivo espacio-temporal unificado para generación visual.
★ 783+4Variación de estrellas de los últimos 7 días - #8
(Aceptado por IJCV) Liquid: los modelos de lenguaje son generadores multimodales escalables y unificados.
★ 640+0Variación de estrellas de los últimos 7 días - #9
[ECCV2024] Modelo de lenguaje multimodal fundamentado con tokenización visual localizada
★ 586+0Variación de estrellas de los últimos 7 días - #10
[NeurIPS 2025 Spotlight] Un tokenizador unificado para la generación y comprensión visual.
★ 529+0Variación de estrellas de los últimos 7 días