mllm
Repositorios de código abierto monitorizados etiquetados con mllm, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a mllm en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con mllm.
- #1
Visión como generación multimodal unificada.
★ 682
- #1
Preentrenamiento autosupervisado a gran escala en múltiples tareas, idiomas y modalidades
★ 22.203+7Variación de estrellas de los últimos 7 días - #2★ 12.219+17Variación de estrellas de los últimos 7 días
- #3
Mobile-Agent: La potente familia de agentes GUI
★ 9157+9Variación de estrellas de los últimos 7 días - #4
[NeurIPS 2025] SpatialLM: Entrenamiento de modelos de lenguaje grandes para modelado interior estructurado
★ 4726+3Variación de estrellas de los últimos 7 días - #5
[CVPR'25] Implementaciones oficiales para el artículo MagicQuill: Un sistema inteligente e interactivo de edición de imágenes.
★ 3691+2Variación de estrellas de los últimos 7 días - #6
Desde el prompting de Cadena de Pensamiento (Chain-of-Thought) hasta OpenAI o1 y DeepSeek-R1 🍓
★ 3681+3Variación de estrellas de los últimos 7 días - #7
Código y modelos para el artículo de ICML 2024, NExT-GPT: Modelo de Lenguaje Grande Multimodal de Cualquier-a-Cualquier
★ 3634-2Variación de estrellas de los últimos 7 días - #8★ 3511+32Variación de estrellas de los últimos 7 días
- #9
InternLM-XComposer2.5-OmniLive: Un sistema multimodal completo para interacciones de video y audio en streaming de larga duración
★ 2925-1Variación de estrellas de los últimos 7 días - #10
mPLUG-DocOwl: Modelo de lenguaje grande multimodal modularizado para la comprensión de documentos
★ 2411+0Variación de estrellas de los últimos 7 días - #11
Cambrian-1 es una familia de LLM multimodales con un diseño centrado en la visión.
★ 2014+1Variación de estrellas de los últimos 7 días - #12
🚀🚀🚀 Una colección de increíbles proyectos públicos de la serie de detección de objetos YOLO y conjuntos de datos relacionados.
★ 1783-2Variación de estrellas de los últimos 7 días - #13
Repositorio oficial para el código base de Pixel-LLM: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1.ª solución para LSVOS)
★ 1666+0Variación de estrellas de los últimos 7 días - #14
[CVPR2026] Detectar cualquier cosa mediante la predicción del siguiente punto.
★ 1570+8Variación de estrellas de los últimos 7 días - #15
Catálogo visual curado de más de 155 arquitecturas de modelos de visión-lenguaje (VLM/MLLM): artículos, diagramas, recetas de entrenamiento, conjuntos de datos y una línea de tiempo de lanzamiento para agentes de IA multimodal.
★ 1310+2Variación de estrellas de los últimos 7 días - #16
Framework totalmente abierto para el entrenamiento multimodal democratizado.
★ 1195+1Variación de estrellas de los últimos 7 días - #17★ 1053+0Variación de estrellas de los últimos 7 días
- #18
OpenEMMA, una "reproducción" de código abierto con licencia permisiva del modelo EMMA de Waymo.
★ 951+0Variación de estrellas de los últimos 7 días - #19
Serie NEO: modelos de visión-lenguaje nativos desde los principios fundamentales
★ 888+0Variación de estrellas de los últimos 7 días - #20
[NeurIPS' 2025] JarvisArt: Liberación de la creatividad artística humana mediante un agente inteligente de retoque fotográfico
★ 862+1Variación de estrellas de los últimos 7 días - #21
[CVPR2024] Código para "Osprey: Pixel Understanding with Visual Instruction Tuning".
★ 843+0Variación de estrellas de los últimos 7 días - #22
[NeurIPS 2025 spotlight] Implementación oficial de "FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving".
★ 831+9Variación de estrellas de los últimos 7 días - #23
[NeurIPS 2025] 4KAgent: Agente para superresolución 4K de cualquier imagen. Un agente inteligente de visión artificial capaz de restaurar mágicamente cualquier imagen a una calidad 4K perfecta.
★ 822+2Variación de estrellas de los últimos 7 días - #24
Una colección de proyectos públicos sobre modelos de lenguaje extensos (LLM), modelos de lenguaje visual (VLM), acción de lenguaje visual (VLA), contenido generado por IA (AIGC), y sus conjuntos de datos y aplicaciones relacionados.
★ 815+1Variación de estrellas de los últimos 7 días - #25
Repositorio con una lista de artículos sobre la generación y aplicación de grafos de escena.
★ 724+5Variación de estrellas de los últimos 7 días - #26
Proyecto personal: MPP-Qwen14B y MPP-Qwen-Next (paralelismo de tubería multimodal basado en Qwen-LM). Soporta [video/imagen/multi-imagen] {sft/conversaciones}. ¡No dejes que la pobreza limite tu imaginación! Entrena tu propio MLLM tipo LLaVA de 8B/14B en una RTX3090/4090 de 24GB.
★ 686+0Variación de estrellas de los últimos 7 días - #27
Visión como generación multimodal unificada.
★ 682+25Variación de estrellas de los últimos 7 días - #28
✨✨Woodpecker: Corrección de alucinaciones para modelos de lenguaje grandes multimodales
★ 650+1Variación de estrellas de los últimos 7 días - #29
[ICLR 2025] FakeShield: Detección y localización explicable de falsificación de imágenes mediante modelos de lenguaje grandes multimodales
★ 623+2Variación de estrellas de los últimos 7 días - #30
Emotion-LLaMA: Reconocimiento y razonamiento de emociones multimodal con ajuste de instrucciones
★ 617+0Variación de estrellas de los últimos 7 días