multimodal-large-language-models
Các kho mã nguồn mở đang theo dõi được gắn thẻ multimodal-large-language-models, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng multimodal-large-language-models trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ multimodal-large-language-models.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Các tiến bộ mới nhất về Mô hình Ngôn ngữ Lớn Đa phương thức
★ 17.996+2Thay đổi số sao trong 7 ngày qua - #2
Mobile-Agent: Dòng GUI Agent mạnh mẽ
★ 9.157+9Thay đổi số sao trong 7 ngày qua - #3
StarVector là một mô hình nền tảng để tạo SVG, giúp chuyển đổi quá trình vector hóa thành một tác vụ tạo mã. Sử dụng kiến trúc mô hình hóa thị giác-ngôn ngữ, StarVector xử lý cả đầu vào hình ảnh và văn bản để tạo ra mã SVG chất lượng cao với độ chính xác vượt trội.
★ 4.567+6Thay đổi số sao trong 7 ngày qua - #4
LLaMA-Omni là mô hình tương tác giọng nói đầu cuối có độ trễ thấp và chất lượng cao được xây dựng trên nền tảng Llama-3.1-8B-Instruct, nhằm đạt được khả năng giọng nói ở cấp độ GPT-4o.
★ 3.147+1Thay đổi số sao trong 7 ngày qua - #5
Một framework cấu trúc video đa nền tảng (phân tích video) dựa trên các mô hình CV & mLLM.
★ 2.933+0Thay đổi số sao trong 7 ngày qua - #6
✨✨[NeurIPS 2025] VITA-1.5: Hướng tới tương tác Giọng nói và Tầm nhìn thời gian thực cấp độ GPT-4o
★ 2.532-1Thay đổi số sao trong 7 ngày qua - #7
mPLUG-DocOwl: Mô hình ngôn ngữ lớn đa phương thức mô-đun hóa để hiểu tài liệu
★ 2.411+0Thay đổi số sao trong 7 ngày qua - #8★ 2.014+1Thay đổi số sao trong 7 ngày qua
- #9
[ICML 2024] Làm chủ khuếch tán Văn bản sang Ảnh: Chú thích lại, Lập kế hoạch và Tạo với LLM đa phương thức (RPG)
★ 1.844+0Thay đổi số sao trong 7 ngày qua - #10
Seed1.5-VL, một mô hình nền tảng ngôn ngữ-thị giác được thiết kế để thúc đẩy khả năng hiểu và suy luận đa phương thức đa năng, đạt hiệu suất hàng đầu trên 38 trong tổng số 60 benchmark công khai.
★ 1.586+0Thay đổi số sao trong 7 ngày qua - #11
Một kiến trúc Mô hình Ngôn ngữ Lớn Đa phương thức (MLLM) mới, được thiết kế để căn chỉnh cấu trúc giữa các embedding thị giác và văn bản.
★ 1.514+2Thay đổi số sao trong 7 ngày qua - #12
Các mô hình đa phương thức hợp nhất tuyệt vời
★ 1.314+1Thay đổi số sao trong 7 ngày qua - #13
Người ảo tương tác giọng nói thời gian thực, có thể tùy chỉnh ngoại hình và giọng nói, hỗ trợ nhân bản giọng nói, độ trễ phản hồi thấp tới 3 giây.
★ 1.303-1Thay đổi số sao trong 7 ngày qua - #14
Bản cài đặt PyTorch của Audio Flamingo: Chuỗi các Mô hình Ngôn ngữ Hiểu Âm thanh Nâng cao
★ 1.184+2Thay đổi số sao trong 7 ngày qua - #15★ 1.058+2Thay đổi số sao trong 7 ngày qua
- #16★ 1.053+0Thay đổi số sao trong 7 ngày qua
- #17
Lập luận chuỗi suy nghĩ đa phương thức: Một khảo sát toàn diện
★ 1.025+2Thay đổi số sao trong 7 ngày qua - #18
Bộ sưu tập tài nguyên về các ứng dụng của học tập đa phương thức trong chẩn đoán hình ảnh y tế.
★ 975+1Thay đổi số sao trong 7 ngày qua - #19
Dòng NEO: Các mô hình ngôn ngữ-thị giác gốc (Native Vision-Language Models) từ những nguyên lý cơ bản
★ 889+1Thay đổi số sao trong 7 ngày qua - #20
[CVPR 2025] Video-MME: Điểm chuẩn đánh giá toàn diện đầu tiên cho các mô hình ngôn ngữ đa phương thức trong phân tích video.
★ 791+2Thay đổi số sao trong 7 ngày qua - #21
LLaVA-Plus: Trợ lý ngôn ngữ và thị giác lớn có khả năng cắm và học cách sử dụng các kỹ năng
★ 770+0Thay đổi số sao trong 7 ngày qua - #22★ 706+0Thay đổi số sao trong 7 ngày qua
- #23★ 702+0Thay đổi số sao trong 7 ngày qua
- #24
Dự án cá nhân: MPP-Qwen14B & MPP-Qwen-Next (Đường ống song song đa phương thức dựa trên Qwen-LM). Hỗ trợ [video/hình ảnh/đa hình ảnh] {sft/hội thoại}. Đừng để sự nghèo nàn giới hạn trí tưởng tượng của bạn! Huấn luyện MLLM kiểu LLaVA 8B/14B của riêng bạn trên RTX3090/4090 24GB.
★ 687+1Thay đổi số sao trong 7 ngày qua - #25
OmniVinci là một LLM đa phương thức giúp hiểu đồng thời hình ảnh, âm thanh và ngôn ngữ.
★ 678+1Thay đổi số sao trong 7 ngày qua - #26
✨✨Woodpecker: Sửa lỗi ảo tưởng (hallucination) cho các mô hình ngôn ngữ lớn đa phương thức
★ 650+1Thay đổi số sao trong 7 ngày qua - #27
(Được chấp nhận bởi IJCV) Liquid: Các mô hình ngôn ngữ là các trình tạo đa phương thức thống nhất và có khả năng mở rộng
★ 640+0Thay đổi số sao trong 7 ngày qua - #28
LLaVA-Mini là mô hình đa phương thức lớn (LMM) hợp nhất, hỗ trợ hiểu hình ảnh, hình ảnh độ phân giải cao và video một cách hiệu quả.
★ 577+0Thay đổi số sao trong 7 ngày qua - #29
Bài báo NeurIPS 2024: Vision LLM cấp độ pixel thống nhất để hiểu, tạo, phân đoạn và chỉnh sửa
★ 577+1Thay đổi số sao trong 7 ngày qua - #30
Cambrian-S: Hướng tới siêu cảm biến không gian trong video.
★ 567-1Thay đổi số sao trong 7 ngày qua