FoundationVision
Dépôts open source suivis de FoundationVision, triés par étoiles.
- #1
[Prix du meilleur article NeurIPS 2024][GPT surpasse la diffusion🔥] [lois d'échelle en génération visuelle📈] Implémentation officielle de "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Une base de code ultra-simple, intuitive et à la pointe de la technologie pour la génération d'images autorégressive.
★ 8 728-1Évolution des étoiles sur les 7 derniers jours - #2
[ECCV 2022] ByteTrack : Suivi multi-objets par association de chaque boîte de détection.
★ 6 662+4Évolution des étoiles sur les 7 derniers jours - #3
Le modèle autorégressif surpasse la diffusion : Llama pour la génération d'images à grande échelle
★ 1 966+0Évolution des étoiles sur les 7 derniers jours - #4
[CVPR 2025 Oral] Infinity ∞ : Mise à l'échelle de la modélisation autorégressive bitwise pour la synthèse d'images haute résolution.
★ 1 587+0Évolution des étoiles sur les 7 derniers jours - #5
[CVPR2024 Highlight] GLEE : Modèle de fondation d'objets général pour les images et les vidéos à grande échelle.
★ 1 170+0Évolution des étoiles sur les 7 derniers jours - #6
Modèle de fondation vidéo de niveau industriel pour la génération unifiée de texte vers vidéo (T2V) et d'image vers vidéo (I2V).
★ 952+0Évolution des étoiles sur les 7 derniers jours - #7
[NeurIPS 2025 Oral] Infinity⭐️ : Modélisation autorégressive espace-temps unifiée pour la génération visuelle.
★ 784+4Évolution des étoiles sur les 7 derniers jours - #8
(Accepté par IJCV) Liquid : Les modèles de langage sont des générateurs multimodaux évolutifs et unifiés
★ 640+0Évolution des étoiles sur les 7 derniers jours - #9
[ECCV2024] Grand modèle de langage multimodal ancré avec tokenisation visuelle localisée
★ 586+0Évolution des étoiles sur les 7 derniers jours - #10
[NeurIPS 2025 Spotlight] Un tokenizer unifié pour la génération et la compréhension visuelle.
★ 529+0Évolution des étoiles sur les 7 derniers jours