Saltar al contenido principal
buildradar
Sign in
Tema · mllm

mllm

Repositorios de código abierto monitorizados etiquetados con mllm, ordenados por estrellas.

Repositorios
36
Estrellas totales
92.155
Estrellas de media
2560
Proporción
0,00%

Temas que aparecen con frecuencia junto a mllm en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con mllm.

  • unilm@microsoft

    Preentrenamiento autosupervisado a gran escala en múltiples tareas, idiomas y modalidades

    22.203+7Variación de estrellas de los últimos 7 días
  • Agent-S@simular-ai

    Agent S: un framework agéntico abierto que utiliza computadoras como un humano

    12.219+17Variación de estrellas de los últimos 7 días
  • MobileAgent@X-PLUG

    Mobile-Agent: La potente familia de agentes GUI

    9157+9Variación de estrellas de los últimos 7 días
  • SpatialLM@manycore-research

    [NeurIPS 2025] SpatialLM: Entrenamiento de modelos de lenguaje grandes para modelado interior estructurado

    4726+3Variación de estrellas de los últimos 7 días
  • MagicQuill@robbyant-research

    [CVPR'25] Implementaciones oficiales para el artículo MagicQuill: Un sistema inteligente e interactivo de edición de imágenes.

    3691+2Variación de estrellas de los últimos 7 días
  • Desde el prompting de Cadena de Pensamiento (Chain-of-Thought) hasta OpenAI o1 y DeepSeek-R1 🍓

    3681+3Variación de estrellas de los últimos 7 días
  • NExT-GPT@NExT-GPT

    Código y modelos para el artículo de ICML 2024, NExT-GPT: Modelo de Lenguaje Grande Multimodal de Cualquier-a-Cualquier

    3634-2Variación de estrellas de los últimos 7 días
  • Eagle@NVlabs

    Eagle: Modelos de lenguaje y visión de vanguardia con estrategias centradas en datos

    3511+32Variación de estrellas de los últimos 7 días
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Un sistema multimodal completo para interacciones de video y audio en streaming de larga duración

    2925-1Variación de estrellas de los últimos 7 días
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Modelo de lenguaje grande multimodal modularizado para la comprensión de documentos

    2411+0Variación de estrellas de los últimos 7 días
  • cambrian@cambrian-mllm

    Cambrian-1 es una familia de LLM multimodales con un diseño centrado en la visión.

    2014+1Variación de estrellas de los últimos 7 días
  • 🚀🚀🚀 Una colección de increíbles proyectos públicos de la serie de detección de objetos YOLO y conjuntos de datos relacionados.

    1783-2Variación de estrellas de los últimos 7 días
  • Sa2VA@bytedance

    Repositorio oficial para el código base de Pixel-LLM: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1.ª solución para LSVOS)

    1666+0Variación de estrellas de los últimos 7 días
  • Rex-Omni@IDEA-Research

    [CVPR2026] Detectar cualquier cosa mediante la predicción del siguiente punto.

    1570+8Variación de estrellas de los últimos 7 días
  • Catálogo visual curado de más de 155 arquitecturas de modelos de visión-lenguaje (VLM/MLLM): artículos, diagramas, recetas de entrenamiento, conjuntos de datos y una línea de tiempo de lanzamiento para agentes de IA multimodal.

    1310+2Variación de estrellas de los últimos 7 días
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Framework totalmente abierto para el entrenamiento multimodal democratizado.

    1195+1Variación de estrellas de los últimos 7 días
  • Bunny@BAAI-DCAI

    Una familia de modelos multimodales ligeros.

    1053+0Variación de estrellas de los últimos 7 días
  • OpenEMMA@taco-group

    OpenEMMA, una "reproducción" de código abierto con licencia permisiva del modelo EMMA de Waymo.

    951+0Variación de estrellas de los últimos 7 días
  • NEO@EvolvingLMMs-Lab

    Serie NEO: modelos de visión-lenguaje nativos desde los principios fundamentales

    888+0Variación de estrellas de los últimos 7 días
  • JarvisArt@LYL1015

    [NeurIPS' 2025] JarvisArt: Liberación de la creatividad artística humana mediante un agente inteligente de retoque fotográfico

    862+1Variación de estrellas de los últimos 7 días
  • Osprey@CircleRadon

    [CVPR2024] Código para "Osprey: Pixel Understanding with Visual Instruction Tuning".

    843+0Variación de estrellas de los últimos 7 días
  • FSDrive@MIV-XJTU

    [NeurIPS 2025 spotlight] Implementación oficial de "FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving".

    831+9Variación de estrellas de los últimos 7 días
  • 4KAgent@taco-group

    [NeurIPS 2025] 4KAgent: Agente para superresolución 4K de cualquier imagen. Un agente inteligente de visión artificial capaz de restaurar mágicamente cualquier imagen a una calidad 4K perfecta.

    822+2Variación de estrellas de los últimos 7 días
  • Una colección de proyectos públicos sobre modelos de lenguaje extensos (LLM), modelos de lenguaje visual (VLM), acción de lenguaje visual (VLA), contenido generado por IA (AIGC), y sus conjuntos de datos y aplicaciones relacionados.

    815+1Variación de estrellas de los últimos 7 días
  • Repositorio con una lista de artículos sobre la generación y aplicación de grafos de escena.

    724+5Variación de estrellas de los últimos 7 días
  • MPP-LLaVA@Coobiw

    Proyecto personal: MPP-Qwen14B y MPP-Qwen-Next (paralelismo de tubería multimodal basado en Qwen-LM). Soporta [video/imagen/multi-imagen] {sft/conversaciones}. ¡No dejes que la pobreza limite tu imaginación! Entrena tu propio MLLM tipo LLaVA de 8B/14B en una RTX3090/4090 de 24GB.

    686+0Variación de estrellas de los últimos 7 días
  • SenseNova-Vision@OpenSenseNova

    Visión como generación multimodal unificada.

    682+25Variación de estrellas de los últimos 7 días
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: Corrección de alucinaciones para modelos de lenguaje grandes multimodales

    650+1Variación de estrellas de los últimos 7 días
  • FakeShield@zhipeixu

    [ICLR 2025] FakeShield: Detección y localización explicable de falsificación de imágenes mediante modelos de lenguaje grandes multimodales

    623+2Variación de estrellas de los últimos 7 días
  • Emotion-LLaMA@ZebangCheng

    Emotion-LLaMA: Reconocimiento y razonamiento de emociones multimodal con ajuste de instrucciones

    617+0Variación de estrellas de los últimos 7 días
← Volver a temas