FoundationVision
Repositórios de código aberto acompanhados de FoundationVision, ordenados por estrelas.
- #1
[Prêmio de Melhor Artigo NeurIPS 2024][GPT supera diffusion🔥] [leis de escala em geração visual📈] Implementação oficial de "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Uma base de código ultra-simples, amigável e de última geração para geração de imagens autorregressivas!
★ 8.728-1Variação de estrelas nos últimos 7 dias - #2
[ECCV 2022] ByteTrack: Rastreamento de múltiplos objetos associando cada caixa de detecção.
★ 6.662+4Variação de estrelas nos últimos 7 dias - #3
Modelo autorregressivo supera difusão: 🦙 Llama para geração de imagens escalável
★ 1.966+0Variação de estrelas nos últimos 7 dias - #4
[CVPR 2025 Oral] Infinity ∞: Escalando modelagem autorregressiva bitwise para síntese de imagens de alta resolução.
★ 1.587+0Variação de estrelas nos últimos 7 dias - #5
[Destaque CVPR2024] GLEE: Modelo de fundação de objetos gerais para imagens e vídeos em escala
★ 1.170+0Variação de estrelas nos últimos 7 dias - #6
Modelo de fundação de vídeo de nível industrial para geração unificada de Text-to-Video (T2V) e Image-to-Video (I2V).
★ 952+0Variação de estrelas nos últimos 7 dias - #7
[NeurIPS 2025 Oral] Infinity⭐️: Modelagem Auto-Regressiva Espaço-Temporal Unificada para Geração Visual
★ 783+4Variação de estrelas nos últimos 7 dias - #8
(Aceito no IJCV) Liquid: Modelos de linguagem são geradores multimodais escaláveis e unificados
★ 640+0Variação de estrelas nos últimos 7 dias - #9
[ECCV2024] Modelo de Linguagem Grande Multimodal Fundamentado com Tokenização Visual Localizada
★ 586+0Variação de estrelas nos últimos 7 dias - #10
[NeurIPS 2025 Spotlight] Um Tokenizador Unificado para Geração e Compreensão Visual
★ 530+0Variação de estrelas nos últimos 7 dias