multimodal-llm
Repositori open source terpantau bertanda multimodal-llm, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan multimodal-llm di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda multimodal-llm.
- #1
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.330 - #2
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
Model ASR kelas industri sumber terbuka yang mendukung bahasa Mandarin, dialek Tiongkok, dan bahasa Inggris, mencapai SOTA baru pada tolok ukur ASR Mandarin publik, sekaligus menawarkan kemampuan pengenalan lirik lagu yang luar biasa.
★ 1.975+2Perubahan bintang dalam 7 hari terakhir - #2
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.330+426Perubahan bintang dalam 7 hari terakhir - #3
Katalog visual pilihan dari 155+ arsitektur vision-language model (VLM/MLLM): makalah, diagram, resep pelatihan, dataset, dan lini masa rilis untuk agen AI multimodal.
★ 1.310+2Perubahan bintang dalam 7 hari terakhir - #4
Implementasi resmi dari makalah "MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens"
★ 869+0Perubahan bintang dalam 7 hari terakhir - #5
Sistem ASR All-in-One Kelas Industri SOTA dengan modul ASR, VAD, LID, dan Punc. FireRedASR2 mendukung bahasa Mandarin (Mandarin, 20+ dialek/aksen), Inggris, pencampuran kode, serta ASR ucapan dan nyanyian. FireRedVAD mendukung ucapan/nyanyian/musik dalam 100+ bahasa. FireRedLID mendukung 100+ bahasa dan 20+ dialek Mandarin. FireRedPunc mendukung Mandarin dan Inggris.
★ 669+12Perubahan bintang dalam 7 hari terakhir