multimodal-large-language-models
Repositorios de código abierto monitorizados etiquetados con multimodal-large-language-models, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a multimodal-large-language-models en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con multimodal-large-language-models.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
:sparkles::sparkles: Últimos avances en modelos de lenguaje multimodal grandes
★ 17.996+2Variación de estrellas de los últimos 7 días - #2
Mobile-Agent: La potente familia de agentes GUI
★ 9157+9Variación de estrellas de los últimos 7 días - #3
StarVector es un modelo base para la generación de SVG que transforma la vectorización en una tarea de generación de código. Utilizando una arquitectura de modelado de visión y lenguaje, StarVector procesa entradas visuales y textuales para producir código SVG de alta calidad con notable precisión.
★ 4567+6Variación de estrellas de los últimos 7 días - #4
LLaMA-Omni es un modelo de interacción de voz de extremo a extremo de baja latencia y alta calidad construido sobre Llama-3.1-8B-Instruct, con el objetivo de lograr capacidades de voz al nivel de GPT-4o.
★ 3147+1Variación de estrellas de los últimos 7 días - #5
Un marco de estructuración de video (análisis de video) multiplataforma basado en modelos de CV y mLLM.
★ 2933+0Variación de estrellas de los últimos 7 días - #6
✨✨[NeurIPS 2025] VITA-1.5: Hacia la interacción de visión y habla en tiempo real a nivel de GPT-4o
★ 2532-1Variación de estrellas de los últimos 7 días - #7
mPLUG-DocOwl: Modelo de lenguaje grande multimodal modularizado para la comprensión de documentos
★ 2411+0Variación de estrellas de los últimos 7 días - #8
Cambrian-1 es una familia de LLM multimodales con un diseño centrado en la visión.
★ 2014+1Variación de estrellas de los últimos 7 días - #9
[ICML 2024] Dominando la difusión de texto a imagen: Recaptioning, planificación y generación con LLMs multimodales (RPG).
★ 1844+0Variación de estrellas de los últimos 7 días - #10
Seed1.5-VL, un modelo base de visión-lenguaje diseñado para avanzar en la comprensión y el razonamiento multimodal de propósito general, logrando un rendimiento de vanguardia en 38 de 60 puntos de referencia públicos.
★ 1586+0Variación de estrellas de los últimos 7 días - #11
Una novedosa arquitectura de modelo de lenguaje multimodal (MLLM) diseñada para alinear estructuralmente incrustaciones visuales y textuales.
★ 1514+2Variación de estrellas de los últimos 7 días - #12
Modelos multimodales unificados destacados.
★ 1314+1Variación de estrellas de los últimos 7 días - #13
Humano digital interactivo en tiempo real, con apariencia y voz personalizables, soporte para clonación de voz y una latencia de respuesta de hasta 3 segundos.
★ 1303-1Variación de estrellas de los últimos 7 días - #14
Implementación en PyTorch de Audio Flamingo: serie de modelos de lenguaje avanzados para la comprensión de audio
★ 1184+2Variación de estrellas de los últimos 7 días - #15
Un framework para procesamiento de voz, lenguaje, audio y música con modelos de lenguaje grandes
★ 1058+2Variación de estrellas de los últimos 7 días - #16★ 1053+0Variación de estrellas de los últimos 7 días
- #17
Razonamiento multimodal de cadena de pensamiento: un estudio exhaustivo
★ 1025+2Variación de estrellas de los últimos 7 días - #18
Una colección de recursos sobre aplicaciones de aprendizaje multimodal en imágenes médicas.
★ 975+1Variación de estrellas de los últimos 7 días - #19
Serie NEO: modelos de visión-lenguaje nativos desde los principios fundamentales
★ 888+0Variación de estrellas de los últimos 7 días - #20
✨✨[CVPR 2025] Video-MME: El primer benchmark de evaluación integral de LLMs multimodales en análisis de video
★ 791+2Variación de estrellas de los últimos 7 días - #21
LLaVA-Plus: asistentes de lenguaje y visión a gran escala que se conectan y aprenden a usar habilidades
★ 770+0Variación de estrellas de los últimos 7 días - #22
[CVPR 2024] MovieChat: De tokens densos a memoria dispersa para la comprensión de videos largos
★ 706+0Variación de estrellas de los últimos 7 días - #23★ 702+0Variación de estrellas de los últimos 7 días
- #24
Proyecto personal: MPP-Qwen14B y MPP-Qwen-Next (paralelismo de tubería multimodal basado en Qwen-LM). Soporta [video/imagen/multi-imagen] {sft/conversaciones}. ¡No dejes que la pobreza limite tu imaginación! Entrena tu propio MLLM tipo LLaVA de 8B/14B en una RTX3090/4090 de 24GB.
★ 686+0Variación de estrellas de los últimos 7 días - #25
OmniVinci es un LLM omnimodal para la comprensión conjunta de visión, audio y lenguaje.
★ 677+0Variación de estrellas de los últimos 7 días - #26
✨✨Woodpecker: Corrección de alucinaciones para modelos de lenguaje grandes multimodales
★ 650+1Variación de estrellas de los últimos 7 días - #27
(Aceptado por IJCV) Liquid: los modelos de lenguaje son generadores multimodales escalables y unificados.
★ 640+0Variación de estrellas de los últimos 7 días - #28
Artículo de NeurIPS 2024: Un LLM de visión a nivel de píxel unificado para comprender, generar, segmentar y editar
★ 577+1Variación de estrellas de los últimos 7 días - #29
LLaVA-Mini es un modelo multimodal grande (LMM) unificado que admite la comprensión de imágenes, imágenes de alta resolución y videos de manera eficiente.
★ 577+0Variación de estrellas de los últimos 7 días - #30
Cambrian-S: Hacia la superpercepción espacial en video
★ 567-1Variación de estrellas de los últimos 7 días