mllm
Repositorios de código abierto monitorizados etiquetados con mllm, ordenados por estrellas.
- #31
Nodos de ComfyUI para modelos de lenguaje visual: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Incluye detección de vocabulario abierto, segmentación SAM2/SAM3, razonamiento temporal de video, GGUF mediante llama.cpp y APIs de LLM/VLM alojadas.
★ 588-1Variación de estrellas de los últimos 7 días - #32
[ICLR2026] Implementación oficial de "JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation"
★ 588+4Variación de estrellas de los últimos 7 días - #33
[ECCV2024] Modelo de lenguaje multimodal fundamentado con tokenización visual localizada
★ 586+0Variación de estrellas de los últimos 7 días - #34
Artículo de NeurIPS 2024: Un LLM de visión a nivel de píxel unificado para comprender, generar, segmentar y editar
★ 577+1Variación de estrellas de los últimos 7 días - #35
🔥🔥🔥 Una lista seleccionada de artículos sobre generación multimodal basada en LLMs (imagen, video, 3D y audio).
★ 552+0Variación de estrellas de los últimos 7 días - #36
Awesome Multimodal Modeling [cubre MLLM, UMM y NMM]
★ 543+2Variación de estrellas de los últimos 7 días