FoundationVision
Các kho mã nguồn mở đang theo dõi của FoundationVision, sắp xếp theo số sao.
- #1
[Giải Thưởng Bài Báo Xuất Sắc Nhất NeurIPS 2024][GPT vượt trội hơn diffusion🔥] [Định luật quy mô trong tạo ảnh thị giác📈] Bản cài đặt chính thức của "Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction". Một mã nguồn *cực kỳ đơn giản, thân thiện với người dùng nhưng đạt chuẩn tối tân* để tạo ảnh tự hồi quy!
★ 8.728-1Thay đổi số sao trong 7 ngày qua - #2
[ECCV 2022] ByteTrack: Theo dõi nhiều đối tượng bằng cách liên kết mọi hộp phát hiện
★ 6.662+4Thay đổi số sao trong 7 ngày qua - #3★ 1.966+0Thay đổi số sao trong 7 ngày qua
- #4
[CVPR 2025 Oral] Infinity ∞: Mở rộng mô hình tự hồi quy theo bit cho tổng hợp ảnh độ phân giải cao
★ 1.587+0Thay đổi số sao trong 7 ngày qua - #5
[CVPR2024 Highlight] GLEE: Mô hình nền tảng đối tượng tổng quát cho hình ảnh và video ở quy mô lớn
★ 1.170+0Thay đổi số sao trong 7 ngày qua - #6
Mô hình nền tảng video cấp công nghiệp để tạo Text-to-Video (T2V) và Image-to-Video (I2V) hợp nhất.
★ 952+0Thay đổi số sao trong 7 ngày qua - #7
[NeurIPS 2025 Oral] Infinity⭐️: Mô hình tự hồi quy không gian-thời gian thống nhất cho tạo hình ảnh.
★ 784+4Thay đổi số sao trong 7 ngày qua - #8
(Được chấp nhận bởi IJCV) Liquid: Các mô hình ngôn ngữ là các trình tạo đa phương thức thống nhất và có khả năng mở rộng
★ 640+0Thay đổi số sao trong 7 ngày qua - #9
[ECCV2024] Mô hình ngôn ngữ lớn đa phương thức có căn cứ với mã hóa hình ảnh cục bộ
★ 586+0Thay đổi số sao trong 7 ngày qua - #10
[NeurIPS 2025 Spotlight] Bộ mã hóa token thống nhất cho việc tạo và hiểu hình ảnh
★ 529+0Thay đổi số sao trong 7 ngày qua