multimodal-llm
Repositórios de código aberto acompanhados marcados com multimodal-llm, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de multimodal-llm no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com multimodal-llm.
- #1
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.350 - #2
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
Modelos ASR de nível industrial de código aberto que suportam mandarim, dialetos chineses e inglês, alcançando um novo SOTA em benchmarks públicos de ASR em mandarim, oferecendo também excelente capacidade de reconhecimento de letras de músicas.
★ 1.975+2Variação de estrelas nos últimos 7 dias - #2
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.350+426Variação de estrelas nos últimos 7 dias - #3
Catálogo visual com curadoria de mais de 155 arquiteturas de modelos de linguagem visual (VLM/MLLM): artigos, diagramas, receitas de treinamento, conjuntos de dados e uma linha do tempo de lançamentos para agentes de IA multimodal.
★ 1.310+2Variação de estrelas nos últimos 7 dias - #4
Implementação oficial do artigo "MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens"
★ 869+0Variação de estrelas nos últimos 7 dias - #5
Um sistema ASR All-in-One de nível industrial SOTA com módulos ASR, VAD, LID e Punc. O FireRedASR2 suporta chinês (mandarim, mais de 20 dialetos/sotaques), inglês, alternância de código, e ASR de fala e canto. O FireRedVAD suporta fala/canto/música em mais de 100 idiomas. O FireRedLID suporta mais de 100 idiomas e mais de 20 dialetos chineses. O FireRedPunc suporta chinês e inglês.
★ 670+12Variação de estrelas nos últimos 7 dias