FoundationVision
Erfasste Open-Source-Repos von FoundationVision, sortiert nach Sternen.
- #1
[NeurIPS 2024 Best Paper Award][GPT beats diffusion🔥] [Skalierungsgesetze in der visuellen Erzeugung📈] Offizielle Implementierung von "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Eine *ultraeinfache, benutzerfreundliche und dennoch hochmoderne* Codebasis für die autoregressive Bilderzeugung!
★ 8.728-1Sterne-Änderung der letzten 7 Tage - #2
[ECCV 2022] ByteTrack: Multi-Object Tracking by Associating Every Detection Box
★ 6.662+4Sterne-Änderung der letzten 7 Tage - #3
Autoregressives Modell schlägt Diffusion: 🦙 Llama für skalierbare Bildgenerierung
★ 1.966+0Sterne-Änderung der letzten 7 Tage - #4
[CVPR 2025 Oral]Infinity ∞: Skalierung von bitweisen autoregressiven Modellen für die hochauflösende Bildsynthese
★ 1.587+0Sterne-Änderung der letzten 7 Tage - #5
[CVPR2024 Highlight] GLEE: General Object Foundation Model für Bilder und Videos im großen Maßstab
★ 1.170+0Sterne-Änderung der letzten 7 Tage - #6
Branchenweites Videogrundlagenmodell für die einheitliche Generierung von Text-to-Video (T2V) und Image-to-Video (I2V).
★ 952+0Sterne-Änderung der letzten 7 Tage - #7
[NeurIPS 2025 Oral] Infinity⭐️: Einheitliche raumzeitliche autoregressive Modellierung für visuelle Generierung
★ 784+4Sterne-Änderung der letzten 7 Tage - #8
(Akzeptiert bei IJCV) Liquid: Sprachmodelle sind skalierbare und einheitliche multimodale Generatoren
★ 640+0Sterne-Änderung der letzten 7 Tage - #9
[ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung
★ 586+0Sterne-Änderung der letzten 7 Tage - #10
[NeurIPS 2025 Spotlight] Ein vereinheitlichter Tokenizer für visuelle Generierung und Verständnis
★ 529+0Sterne-Änderung der letzten 7 Tage