FoundationVision
Repositori open source terpantau milik FoundationVision, diurutkan berdasarkan bintang.
- #1
[NeurIPS 2024 Best Paper Award][GPT mengalahkan diffusion🔥] [hukum scaling dalam visual generation📈] Implementasi resmi dari "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Basis kode yang *sangat sederhana, ramah pengguna, namun canggih* untuk pembuatan gambar autoregresif!
★ 8.728-1Perubahan bintang dalam 7 hari terakhir - #2
[ECCV 2022] ByteTrack: Pelacakan Multi-Objek dengan Mengasosiasikan Setiap Kotak Deteksi
★ 6.662+4Perubahan bintang dalam 7 hari terakhir - #3
Model Autoregressive Mengungguli Diffusion: 🦙 Llama untuk Pembuatan Gambar yang Dapat Diskalakan
★ 1.966+0Perubahan bintang dalam 7 hari terakhir - #4
[CVPR 2025 Oral]Infinity ∞ : Penskalaan Pemodelan AutoRegressive Berbasis Bit untuk Sintesis Gambar Resolusi Tinggi
★ 1.587+0Perubahan bintang dalam 7 hari terakhir - #5
[Sorotan CVPR2024] GLEE: Model Fondasi Objek Umum untuk Gambar dan Video Skala Besar
★ 1.170+0Perubahan bintang dalam 7 hari terakhir - #6
Model fondasi video tingkat industri untuk pembuatan Text-to-Video (T2V) dan Image-to-Video (I2V) yang terpadu.
★ 952+0Perubahan bintang dalam 7 hari terakhir - #7
[NeurIPS 2025 Oral] Infinity⭐️: Pemodelan AutoRegressive Ruang-Waktu Terpadu untuk Pembuatan Visual
★ 784+4Perubahan bintang dalam 7 hari terakhir - #8
(Diterima oleh IJCV) Liquid: Model Bahasa adalah Generator Multimodal yang Skalabel dan Terpadu
★ 640+0Perubahan bintang dalam 7 hari terakhir - #9
[ECCV2024] Grounded Multimodal Large Language Model dengan Tokenisasi Visual Terlokalisasi
★ 586+0Perubahan bintang dalam 7 hari terakhir - #10
[NeurIPS 2025 Spotlight] Tokenizer Terpadu untuk Pembuatan dan Pemahaman Visual
★ 529+0Perubahan bintang dalam 7 hari terakhir