Lompat ke konten utama
buildradar
Sign in
Topik · multimodal-large-language-models

multimodal-large-language-models

Repositori open source terpantau bertanda multimodal-large-language-models, diurutkan berdasarkan bintang.

Repositori
32
Total bintang
66.902
Rata-rata bintang
2.091
Porsi
0,00%

Topik yang sering muncul berdampingan dengan multimodal-large-language-models di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda multimodal-large-language-models.

Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.

  • Kemajuan terbaru dalam Multimodal Large Language Models

    17.996+8Perubahan bintang dalam 7 hari terakhir
  • MobileAgent@X-PLUG

    Mobile-Agent: Keluarga Agen GUI yang Kuat

    9.157+19Perubahan bintang dalam 7 hari terakhir
  • star-vector@joanrod

    StarVector adalah model dasar untuk pembuatan SVG yang mengubah vektorisasi menjadi tugas pembuatan kode. Menggunakan arsitektur pemodelan visi-bahasa, StarVector memproses input visual dan tekstual untuk menghasilkan kode SVG berkualitas tinggi dengan presisi luar biasa.

    4.567+6Perubahan bintang dalam 7 hari terakhir
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni adalah model interaksi ucapan ujung-ke-ujung berlatensi rendah dan berkualitas tinggi yang dibangun di atas Llama-3.1-8B-Instruct, yang bertujuan untuk mencapai kemampuan ucapan setara GPT-4o.

    3.147+1Perubahan bintang dalam 7 hari terakhir
  • VideoPipe@sherlockchou86

    Kerangka kerja penstrukturan video (analisis video) lintas platform berbasis model CV & mLLM.

    2.933+2Perubahan bintang dalam 7 hari terakhir
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5: Menuju Interaksi Visi dan Suara Real-Time setingkat GPT-4o.

    2.532-2Perubahan bintang dalam 7 hari terakhir
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Model Bahasa Besar Multimodal Modular untuk Pemahaman Dokumen

    2.411+0Perubahan bintang dalam 7 hari terakhir
  • cambrian@cambrian-mllm

    Cambrian-1 adalah keluarga LLM multimodal dengan desain yang berpusat pada visi.

    2.014+1Perubahan bintang dalam 7 hari terakhir
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] Menguasai Difusi Teks-ke-Gambar: Pembuatan Keterangan Ulang, Perencanaan, dan Pembuatan dengan LLM Multimodal (RPG)

    1.844+2Perubahan bintang dalam 7 hari terakhir
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, model dasar visi-bahasa yang dirancang untuk memajukan pemahaman dan penalaran multimodal serbaguna, mencapai performa terbaik pada 38 dari 60 tolok ukur publik.

    1.586+0Perubahan bintang dalam 7 hari terakhir
  • Ovis@ATH-MaaS

    Arsitektur Multimodal Large Language Model (MLLM) baru, yang dirancang untuk menyelaraskan embedding visual dan tekstual secara struktural.

    1.514+2Perubahan bintang dalam 7 hari terakhir
  • Kumpulan Model Multimodal Terpadu yang Hebat

    1.314+2Perubahan bintang dalam 7 hari terakhir
  • VideoChat@Henry-23

    Digital human interaktif suara secara real-time, dengan tampilan dan suara yang dapat disesuaikan, mendukung kloning suara, serta latensi dialog serendah 3 detik.

    1.303+0Perubahan bintang dalam 7 hari terakhir
  • Implementasi PyTorch dari Audio Flamingo: Seri Model Bahasa Pemahaman Audio Tingkat Lanjut

    1.184+2Perubahan bintang dalam 7 hari terakhir
  • SLAM-LLM@X-LANCE

    Kerangka kerja untuk Pemrosesan Ucapan, Bahasa, Audio, dan Musik dengan Large Language Model.

    1.058+1Perubahan bintang dalam 7 hari terakhir
  • Bunny@BAAI-DCAI

    Keluarga model multimodal yang ringan.

    1.053+0Perubahan bintang dalam 7 hari terakhir
  • Awesome-MCoT@yaotingwangofficial

    Penalaran Multimodal Chain-of-Thought: Survei Komprehensif

    1.025+1Perubahan bintang dalam 7 hari terakhir
  • Kumpulan sumber daya tentang penerapan pembelajaran multi-modal dalam pencitraan medis.

    975+1Perubahan bintang dalam 7 hari terakhir
  • NEO@EvolvingLMMs-Lab

    NEO Series: Model Visi-Bahasa native yang dibangun dari prinsip dasar.

    888+0Perubahan bintang dalam 7 hari terakhir
  • Video-MME@MME-Benchmarks

    ✨✨[CVPR 2025] Video-MME: Benchmark Evaluasi Komprehensif Pertama untuk LLM Multimodal dalam Analisis Video

    791+3Perubahan bintang dalam 7 hari terakhir
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus: Asisten Bahasa dan Visi Besar yang Dapat Dipasang dan Belajar Menggunakan Keterampilan

    770+0Perubahan bintang dalam 7 hari terakhir
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat: Dari Token Padat ke Memori Jarang untuk Pemahaman Video Panjang

    706+0Perubahan bintang dalam 7 hari terakhir
  • unicom@deepglint

    Model Representasi Visual Skala Besar

    702+0Perubahan bintang dalam 7 hari terakhir
  • MPP-LLaVA@Coobiw

    Proyek Pribadi: MPP-Qwen14B & MPP-Qwen-Next (Multimodal Pipeline Parallel berdasarkan Qwen-LM). Mendukung [video/gambar/multi-gambar] {sft/percakapan}. Jangan biarkan kemiskinan membatasi imajinasi Anda! Latih MLLM mirip pelatihan LLaVA 8B/14B Anda sendiri di RTX3090/4090 24GB.

    686+0Perubahan bintang dalam 7 hari terakhir
  • OmniVinci@NVlabs

    OmniVinci adalah LLM omni-modal untuk pemahaman bersama visi, audio, dan bahasa.

    677+1Perubahan bintang dalam 7 hari terakhir
  • Woodpecker@VITA-MLLM

    Woodpecker: Koreksi halusinasi untuk Multimodal Large Language Models

    650+1Perubahan bintang dalam 7 hari terakhir
  • Liquid@FoundationVision

    (Diterima oleh IJCV) Liquid: Model Bahasa adalah Generator Multimodal yang Skalabel dan Terpadu

    640+0Perubahan bintang dalam 7 hari terakhir
  • Vitron@SkyworkAI

    Makalah NeurIPS 2024: Vision LLM tingkat piksel terpadu untuk pemahaman, pembuatan, segmentasi, dan pengeditan

    577+1Perubahan bintang dalam 7 hari terakhir
  • LLaVA-Mini@ictnlp

    LLaVA-Mini adalah model multimodal besar (LMM) terpadu yang dapat mendukung pemahaman gambar, gambar beresolusi tinggi, dan video secara efisien.

    577+0Perubahan bintang dalam 7 hari terakhir
  • cambrian-s@cambrian-mllm

    Cambrian-S: Menuju Spatial Supersensing dalam Video

    568+1Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik