Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · multimodal-large-language-models

multimodal-large-language-models

Các kho mã nguồn mở đang theo dõi được gắn thẻ multimodal-large-language-models, sắp xếp theo số sao.

Kho mã
32
Tổng số sao
66.902
Số sao trung bình
2.091
Tỷ trọng
0,00%

Những chủ đề thường xuất hiện cùng multimodal-large-language-models trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ multimodal-large-language-models.

Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.

  • Các tiến bộ mới nhất về Mô hình Ngôn ngữ Lớn Đa phương thức

    17.996+2Thay đổi số sao trong 7 ngày qua
  • MobileAgent@X-PLUG

    Mobile-Agent: Dòng GUI Agent mạnh mẽ

    9.157+9Thay đổi số sao trong 7 ngày qua
  • star-vector@joanrod

    StarVector là một mô hình nền tảng để tạo SVG, giúp chuyển đổi quá trình vector hóa thành một tác vụ tạo mã. Sử dụng kiến trúc mô hình hóa thị giác-ngôn ngữ, StarVector xử lý cả đầu vào hình ảnh và văn bản để tạo ra mã SVG chất lượng cao với độ chính xác vượt trội.

    4.567+6Thay đổi số sao trong 7 ngày qua
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni là mô hình tương tác giọng nói đầu cuối có độ trễ thấp và chất lượng cao được xây dựng trên nền tảng Llama-3.1-8B-Instruct, nhằm đạt được khả năng giọng nói ở cấp độ GPT-4o.

    3.147+1Thay đổi số sao trong 7 ngày qua
  • VideoPipe@sherlockchou86

    Một framework cấu trúc video đa nền tảng (phân tích video) dựa trên các mô hình CV & mLLM.

    2.933+0Thay đổi số sao trong 7 ngày qua
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5: Hướng tới tương tác Giọng nói và Tầm nhìn thời gian thực cấp độ GPT-4o

    2.532-1Thay đổi số sao trong 7 ngày qua
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Mô hình ngôn ngữ lớn đa phương thức mô-đun hóa để hiểu tài liệu

    2.411+0Thay đổi số sao trong 7 ngày qua
  • cambrian@cambrian-mllm

    Cambrian-1 là dòng LLM đa phương thức với thiết kế tập trung vào thị giác.

    2.014+1Thay đổi số sao trong 7 ngày qua
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] Làm chủ khuếch tán Văn bản sang Ảnh: Chú thích lại, Lập kế hoạch và Tạo với LLM đa phương thức (RPG)

    1.844+0Thay đổi số sao trong 7 ngày qua
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, một mô hình nền tảng ngôn ngữ-thị giác được thiết kế để thúc đẩy khả năng hiểu và suy luận đa phương thức đa năng, đạt hiệu suất hàng đầu trên 38 trong tổng số 60 benchmark công khai.

    1.586+0Thay đổi số sao trong 7 ngày qua
  • Ovis@ATH-MaaS

    Một kiến trúc Mô hình Ngôn ngữ Lớn Đa phương thức (MLLM) mới, được thiết kế để căn chỉnh cấu trúc giữa các embedding thị giác và văn bản.

    1.514+2Thay đổi số sao trong 7 ngày qua
  • Các mô hình đa phương thức hợp nhất tuyệt vời

    1.314+1Thay đổi số sao trong 7 ngày qua
  • VideoChat@Henry-23

    Người ảo tương tác giọng nói thời gian thực, có thể tùy chỉnh ngoại hình và giọng nói, hỗ trợ nhân bản giọng nói, độ trễ phản hồi thấp tới 3 giây.

    1.303-1Thay đổi số sao trong 7 ngày qua
  • Bản cài đặt PyTorch của Audio Flamingo: Chuỗi các Mô hình Ngôn ngữ Hiểu Âm thanh Nâng cao

    1.184+2Thay đổi số sao trong 7 ngày qua
  • SLAM-LLM@X-LANCE

    Framework xử lý Tiếng nói, Ngôn ngữ, Âm thanh, Âm nhạc với Large Language Model

    1.058+2Thay đổi số sao trong 7 ngày qua
  • Bunny@BAAI-DCAI

    Một họ mô hình đa phương thức nhẹ.

    1.053+0Thay đổi số sao trong 7 ngày qua
  • Awesome-MCoT@yaotingwangofficial

    Lập luận chuỗi suy nghĩ đa phương thức: Một khảo sát toàn diện

    1.025+2Thay đổi số sao trong 7 ngày qua
  • Bộ sưu tập tài nguyên về các ứng dụng của học tập đa phương thức trong chẩn đoán hình ảnh y tế.

    975+1Thay đổi số sao trong 7 ngày qua
  • NEO@EvolvingLMMs-Lab

    Dòng NEO: Các mô hình ngôn ngữ-thị giác gốc (Native Vision-Language Models) từ những nguyên lý cơ bản

    889+1Thay đổi số sao trong 7 ngày qua
  • Video-MME@MME-Benchmarks

    [CVPR 2025] Video-MME: Điểm chuẩn đánh giá toàn diện đầu tiên cho các mô hình ngôn ngữ đa phương thức trong phân tích video.

    791+2Thay đổi số sao trong 7 ngày qua
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus: Trợ lý ngôn ngữ và thị giác lớn có khả năng cắm và học cách sử dụng các kỹ năng

    770+0Thay đổi số sao trong 7 ngày qua
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat: Từ Dense Token đến Sparse Memory để hiểu video dài

    706+0Thay đổi số sao trong 7 ngày qua
  • unicom@deepglint

    Mô hình biểu diễn hình ảnh quy mô lớn

    702+0Thay đổi số sao trong 7 ngày qua
  • MPP-LLaVA@Coobiw

    Dự án cá nhân: MPP-Qwen14B & MPP-Qwen-Next (Đường ống song song đa phương thức dựa trên Qwen-LM). Hỗ trợ [video/hình ảnh/đa hình ảnh] {sft/hội thoại}. Đừng để sự nghèo nàn giới hạn trí tưởng tượng của bạn! Huấn luyện MLLM kiểu LLaVA 8B/14B của riêng bạn trên RTX3090/4090 24GB.

    687+1Thay đổi số sao trong 7 ngày qua
  • OmniVinci@NVlabs

    OmniVinci là một LLM đa phương thức giúp hiểu đồng thời hình ảnh, âm thanh và ngôn ngữ.

    678+1Thay đổi số sao trong 7 ngày qua
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: Sửa lỗi ảo tưởng (hallucination) cho các mô hình ngôn ngữ lớn đa phương thức

    650+1Thay đổi số sao trong 7 ngày qua
  • Liquid@FoundationVision

    (Được chấp nhận bởi IJCV) Liquid: Các mô hình ngôn ngữ là các trình tạo đa phương thức thống nhất và có khả năng mở rộng

    640+0Thay đổi số sao trong 7 ngày qua
  • LLaVA-Mini@ictnlp

    LLaVA-Mini là mô hình đa phương thức lớn (LMM) hợp nhất, hỗ trợ hiểu hình ảnh, hình ảnh độ phân giải cao và video một cách hiệu quả.

    577+0Thay đổi số sao trong 7 ngày qua
  • Vitron@SkyworkAI

    Bài báo NeurIPS 2024: Vision LLM cấp độ pixel thống nhất để hiểu, tạo, phân đoạn và chỉnh sửa

    577+1Thay đổi số sao trong 7 ngày qua
  • cambrian-s@cambrian-mllm

    Cambrian-S: Hướng tới siêu cảm biến không gian trong video.

    567-1Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề