multimodal-llm
Repositorios de código abierto monitorizados etiquetados con multimodal-llm, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a multimodal-llm en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con multimodal-llm.
- #1
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1330 - #2
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
Modelos ASR de grado industrial de código abierto que admiten mandarín, dialectos chinos e inglés, logrando un nuevo SOTA en benchmarks públicos de ASR en mandarín, y ofreciendo además una capacidad excepcional de reconocimiento de letras de canciones.
★ 1975+2Variación de estrellas de los últimos 7 días - #2
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1330+426Variación de estrellas de los últimos 7 días - #3
Catálogo visual curado de más de 155 arquitecturas de modelos de visión-lenguaje (VLM/MLLM): artículos, diagramas, recetas de entrenamiento, conjuntos de datos y una línea de tiempo de lanzamiento para agentes de IA multimodal.
★ 1310+2Variación de estrellas de los últimos 7 días - #4
Implementación oficial del artículo "MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens"
★ 869+0Variación de estrellas de los últimos 7 días - #5
Un sistema ASR integral de grado industrial con módulos ASR, VAD, LID y Punc. FireRedASR2 admite chino (mandarín, más de 20 dialectos/acentos), inglés, cambio de código, y reconocimiento de voz y canto. FireRedVAD admite voz/canto/música en más de 100 idiomas. FireRedLID admite más de 100 idiomas y más de 20 dialectos chinos. FireRedPunc admite chino e inglés.
★ 670+12Variación de estrellas de los últimos 7 días