Saltar al contenido principal
buildradar
Sign in
Tema · large-multimodal-models

large-multimodal-models

Repositorios de código abierto monitorizados etiquetados con large-multimodal-models, ordenados por estrellas.

Repositorios
9
Estrellas totales
10.371
Estrellas de media
1152
Proporción
0,00%

Temas que aparecen con frecuencia junto a large-multimodal-models en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con large-multimodal-models.

No hay repositorios nuevos con este tema en los últimos 90 días.

  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5: Hacia la interacción de visión y habla en tiempo real a nivel de GPT-4o

    2532-1Variación de estrellas de los últimos 7 días
  • [ICCV 2025] Implementación de Describe Anything: subtitulado detallado y localizado de imágenes y videos

    1517+3Variación de estrellas de los últimos 7 días
  • Catálogo visual curado de más de 155 arquitecturas de modelos de visión-lenguaje (VLM/MLLM): artículos, diagramas, recetas de entrenamiento, conjuntos de datos y una línea de tiempo de lanzamiento para agentes de IA multimodal.

    1310+2Variación de estrellas de los últimos 7 días
  • ShareGPT4Video@ShareGPT4Omni

    [NeurIPS 2024] Implementación oficial de "ShareGPT4Video: Mejorando la comprensión y generación de video con mejores subtítulos"

    1094+1Variación de estrellas de los últimos 7 días
  • TinyLLaVA_Factory@TinyLLaVA

    Un framework de modelos multimodales grandes a pequeña escala

    1004+1Variación de estrellas de los últimos 7 días
  • Una colección de recursos sobre aplicaciones de aprendizaje multimodal en imágenes médicas.

    975+1Variación de estrellas de los últimos 7 días
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus: asistentes de lenguaje y visión a gran escala que se conectan y aprenden a usar habilidades

    770+0Variación de estrellas de los últimos 7 días
  • MMMU@MMMU-Benchmark

    Este repositorio contiene el código de evaluación para el artículo "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI".

    593+1Variación de estrellas de los últimos 7 días
  • LLaVA-Mini@ictnlp

    LLaVA-Mini es un modelo multimodal grande (LMM) unificado que admite la comprensión de imágenes, imágenes de alta resolución y videos de manera eficiente.

    577+0Variación de estrellas de los últimos 7 días
← Volver a temas