Saltar al contenido principal
buildradar
Sign in
Tema · multimodal-llm

multimodal-llm

Repositorios de código abierto monitorizados etiquetados con multimodal-llm, ordenados por estrellas.

Repositorios
5
Estrellas totales
5901
Estrellas de media
1180
Proporción
0,00%

Temas que aparecen con frecuencia junto a multimodal-llm en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con multimodal-llm.

  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1330
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • FireRedASR@FireRedTeam

    Modelos ASR de grado industrial de código abierto que admiten mandarín, dialectos chinos e inglés, logrando un nuevo SOTA en benchmarks públicos de ASR en mandarín, y ofreciendo además una capacidad excepcional de reconocimiento de letras de canciones.

    1975+2Variación de estrellas de los últimos 7 días
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1330+426Variación de estrellas de los últimos 7 días
  • Catálogo visual curado de más de 155 arquitecturas de modelos de visión-lenguaje (VLM/MLLM): artículos, diagramas, recetas de entrenamiento, conjuntos de datos y una línea de tiempo de lanzamiento para agentes de IA multimodal.

    1310+2Variación de estrellas de los últimos 7 días
  • MiniGPT-5@UCSB-AI

    Implementación oficial del artículo "MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens"

    869+0Variación de estrellas de los últimos 7 días
  • FireRedASR2S@FireRedTeam

    Un sistema ASR integral de grado industrial con módulos ASR, VAD, LID y Punc. FireRedASR2 admite chino (mandarín, más de 20 dialectos/acentos), inglés, cambio de código, y reconocimiento de voz y canto. FireRedVAD admite voz/canto/música en más de 100 idiomas. FireRedLID admite más de 100 idiomas y más de 20 dialectos chinos. FireRedPunc admite chino e inglés.

    670+12Variación de estrellas de los últimos 7 días
← Volver a temas