Saltar al contenido principal
buildradar
Sign in
Tema · multimodal-large-language-models

multimodal-large-language-models

Repositorios de código abierto monitorizados etiquetados con multimodal-large-language-models, ordenados por estrellas.

Repositorios
32
Estrellas totales
66.902
Estrellas de media
2091
Proporción
0,00%

Temas que aparecen con frecuencia junto a multimodal-large-language-models en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con multimodal-large-language-models.

No hay repositorios nuevos con este tema en los últimos 90 días.

  • :sparkles::sparkles: Últimos avances en modelos de lenguaje multimodal grandes

    17.996+2Variación de estrellas de los últimos 7 días
  • MobileAgent@X-PLUG

    Mobile-Agent: La potente familia de agentes GUI

    9157+9Variación de estrellas de los últimos 7 días
  • star-vector@joanrod

    StarVector es un modelo base para la generación de SVG que transforma la vectorización en una tarea de generación de código. Utilizando una arquitectura de modelado de visión y lenguaje, StarVector procesa entradas visuales y textuales para producir código SVG de alta calidad con notable precisión.

    4567+6Variación de estrellas de los últimos 7 días
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni es un modelo de interacción de voz de extremo a extremo de baja latencia y alta calidad construido sobre Llama-3.1-8B-Instruct, con el objetivo de lograr capacidades de voz al nivel de GPT-4o.

    3147+1Variación de estrellas de los últimos 7 días
  • VideoPipe@sherlockchou86

    Un marco de estructuración de video (análisis de video) multiplataforma basado en modelos de CV y mLLM.

    2933+0Variación de estrellas de los últimos 7 días
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5: Hacia la interacción de visión y habla en tiempo real a nivel de GPT-4o

    2532-1Variación de estrellas de los últimos 7 días
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Modelo de lenguaje grande multimodal modularizado para la comprensión de documentos

    2411+0Variación de estrellas de los últimos 7 días
  • cambrian@cambrian-mllm

    Cambrian-1 es una familia de LLM multimodales con un diseño centrado en la visión.

    2014+1Variación de estrellas de los últimos 7 días
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] Dominando la difusión de texto a imagen: Recaptioning, planificación y generación con LLMs multimodales (RPG).

    1844+0Variación de estrellas de los últimos 7 días
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, un modelo base de visión-lenguaje diseñado para avanzar en la comprensión y el razonamiento multimodal de propósito general, logrando un rendimiento de vanguardia en 38 de 60 puntos de referencia públicos.

    1586+0Variación de estrellas de los últimos 7 días
  • Ovis@ATH-MaaS

    Una novedosa arquitectura de modelo de lenguaje multimodal (MLLM) diseñada para alinear estructuralmente incrustaciones visuales y textuales.

    1514+2Variación de estrellas de los últimos 7 días
  • Modelos multimodales unificados destacados.

    1314+1Variación de estrellas de los últimos 7 días
  • VideoChat@Henry-23

    Humano digital interactivo en tiempo real, con apariencia y voz personalizables, soporte para clonación de voz y una latencia de respuesta de hasta 3 segundos.

    1303-1Variación de estrellas de los últimos 7 días
  • Implementación en PyTorch de Audio Flamingo: serie de modelos de lenguaje avanzados para la comprensión de audio

    1184+2Variación de estrellas de los últimos 7 días
  • SLAM-LLM@X-LANCE

    Un framework para procesamiento de voz, lenguaje, audio y música con modelos de lenguaje grandes

    1058+2Variación de estrellas de los últimos 7 días
  • Bunny@BAAI-DCAI

    Una familia de modelos multimodales ligeros.

    1053+0Variación de estrellas de los últimos 7 días
  • Awesome-MCoT@yaotingwangofficial

    Razonamiento multimodal de cadena de pensamiento: un estudio exhaustivo

    1025+2Variación de estrellas de los últimos 7 días
  • Una colección de recursos sobre aplicaciones de aprendizaje multimodal en imágenes médicas.

    975+1Variación de estrellas de los últimos 7 días
  • NEO@EvolvingLMMs-Lab

    Serie NEO: modelos de visión-lenguaje nativos desde los principios fundamentales

    888+0Variación de estrellas de los últimos 7 días
  • Video-MME@MME-Benchmarks

    ✨✨[CVPR 2025] Video-MME: El primer benchmark de evaluación integral de LLMs multimodales en análisis de video

    791+2Variación de estrellas de los últimos 7 días
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus: asistentes de lenguaje y visión a gran escala que se conectan y aprenden a usar habilidades

    770+0Variación de estrellas de los últimos 7 días
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat: De tokens densos a memoria dispersa para la comprensión de videos largos

    706+0Variación de estrellas de los últimos 7 días
  • unicom@deepglint

    Modelo de representación visual a gran escala

    702+0Variación de estrellas de los últimos 7 días
  • MPP-LLaVA@Coobiw

    Proyecto personal: MPP-Qwen14B y MPP-Qwen-Next (paralelismo de tubería multimodal basado en Qwen-LM). Soporta [video/imagen/multi-imagen] {sft/conversaciones}. ¡No dejes que la pobreza limite tu imaginación! Entrena tu propio MLLM tipo LLaVA de 8B/14B en una RTX3090/4090 de 24GB.

    686+0Variación de estrellas de los últimos 7 días
  • OmniVinci@NVlabs

    OmniVinci es un LLM omnimodal para la comprensión conjunta de visión, audio y lenguaje.

    677+0Variación de estrellas de los últimos 7 días
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: Corrección de alucinaciones para modelos de lenguaje grandes multimodales

    650+1Variación de estrellas de los últimos 7 días
  • Liquid@FoundationVision

    (Aceptado por IJCV) Liquid: los modelos de lenguaje son generadores multimodales escalables y unificados.

    640+0Variación de estrellas de los últimos 7 días
  • Vitron@SkyworkAI

    Artículo de NeurIPS 2024: Un LLM de visión a nivel de píxel unificado para comprender, generar, segmentar y editar

    577+1Variación de estrellas de los últimos 7 días
  • LLaVA-Mini@ictnlp

    LLaVA-Mini es un modelo multimodal grande (LMM) unificado que admite la comprensión de imágenes, imágenes de alta resolución y videos de manera eficiente.

    577+0Variación de estrellas de los últimos 7 días
  • cambrian-s@cambrian-mllm

    Cambrian-S: Hacia la superpercepción espacial en video

    567-1Variación de estrellas de los últimos 7 días
← Volver a temas