multimodal-llm
multimodal-llm 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 multimodal-llm 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 multimodal-llm 태그가 달린 리포지토리예요.
- #1
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1,350 - #2
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
만다린, 중국 방언 및 영어를 지원하는 오픈 소스 산업용 ASR 모델로, 공인된 만다린 ASR 벤치마크에서 새로운 SOTA를 달성하는 동시에 뛰어난 가사 인식 기능도 제공합니다.
★ 1,975+2최근 7일 스타 변화 - #2
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1,350+426최근 7일 스타 변화 - #3
155개 이상의 시각-언어 모델(VLM/MLLM) 아키텍처를 엄선한 시각적 카탈로그: 멀티모달 AI 에이전트를 위한 논문, 다이어그램, 학습 레시피, 데이터셋 및 출시 타임라인.
★ 1,310+2최근 7일 스타 변화 - #4
논문 "MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens"의 공식 구현
★ 869+0최근 7일 스타 변화 - #5
ASR, VAD, LID, Punc 모듈을 포함한 산업용 올인원 ASR 시스템. FireRedASR2는 중국어(표준어 및 20개 이상의 방언/억양), 영어, 코드 스위칭, 음성 및 노래 ASR을 지원하며, FireRedVAD는 100개 이상의 언어, FireRedLID는 100개 이상의 언어와 20개 이상의 중국어 방언, FireRedPunc는 중국어와 영어를 지원함
★ 670+12최근 7일 스타 변화