Saltar al contenido principal
buildradar
Sign in
Tema · vision-language-model

vision-language-model

Repositorios de código abierto monitorizados etiquetados con vision-language-model, ordenados por estrellas.

59 repositorios
  • prismer@NVlabs

    Implementación de Prismer: un modelo de lenguaje y visión con expertos multitarea

    1309+0Variación de estrellas de los últimos 7 días
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Framework totalmente abierto para el entrenamiento multimodal democratizado.

    1195+1Variación de estrellas de los últimos 7 días
  • vlms-zero-to-hero@SkalskiP

    Esta serie te guiará desde los fundamentos de la PNL y la visión por computadora hasta la vanguardia de los modelos de visión y lenguaje.

    1179+0Variación de estrellas de los últimos 7 días
  • doc7@magicrew

    Convierte documentos en Markdown listo para IA con comprensión visual.

    1153-25Variación de estrellas de los últimos 7 días
  • Kit de herramientas visuales y habilidades diseñadas para modelos de solo texto para "ver" imágenes, compatible con comprensión de múltiples imágenes, preguntas y respuestas sobre imágenes, restauración de UI frontend, automatización de GUI, con integración opcional y fluida a múltiples agentes principales, reconocimiento directo de imágenes pegadas

    1136+18Variación de estrellas de los últimos 7 días
  • VisRAG@OpenBMB

    RAG sin análisis sintáctico (parsing) compatible con VLM

    979-1Variación de estrellas de los últimos 7 días
  • groundingLMM@mbzuai-oryx

    [CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), el primer modelo de su clase capaz de generar respuestas en lenguaje natural integradas perfectamente con máscaras de segmentación de objetos.

    967+0Variación de estrellas de los últimos 7 días
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: La representación visual unificada potencia a los modelos de lenguaje grandes con comprensión de imágenes y videos

    941+0Variación de estrellas de los últimos 7 días
  • Este repositorio es una colección curada de los artículos más interesantes e influyentes de CVPR 2025. 🔥 [Artículo + Código + Demo]

    895+1Variación de estrellas de los últimos 7 días
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: un modelo CLIP que se enfoca donde tú quieras.

    874+0Variación de estrellas de los últimos 7 días
  • dsh-vision-toolkit@Anionex

    [dsh] Una caja de herramientas visual más potente diseñada para modelos de texto plano: instalación y uso gratuito, reconocimiento directo de imágenes pegadas, preguntas y respuestas sobre múltiples imágenes, captura de pantalla a UI frontend y más | Integración nativa de DeepSeek Harness para el kit de herramientas visuales de agentes: Q&A de imágenes, OCR de capturas de pantalla largas, restauración de UI, grounding, diferencia de píxeles, Artifacts y Web UI.

    856+17Variación de estrellas de los últimos 7 días
  • VoxPoser@huangwl18

    VoxPoser: Mapas de valores 3D componibles para manipulación robótica con modelos de lenguaje.

    834+1Variación de estrellas de los últimos 7 días
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA: Fundamentos abiertos para agentes de uso informático

    833+4Variación de estrellas de los últimos 7 días
  • MINT-1T@mlfoundations

    MINT-1T: Un conjunto de datos multimodal intercalado de un billón de tokens.

    832+0Variación de estrellas de los últimos 7 días
  • Una lista curada de artículos de visión 3D relacionados con el dominio de la robótica en la era de los grandes modelos, es decir, LLMs/VLMs, inspirada en awesome-computer-vision, que incluye artículos, códigos y sitios web relacionados

    821+2Variación de estrellas de los últimos 7 días
  • Una lista curada de métodos de aprendizaje de prompts/adaptadores para modelos de visión-lenguaje como CLIP.

    797+1Variación de estrellas de los últimos 7 días
  • X-VLA@2toinf

    [ICLR 2026] Implementación oficial de "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"

    725+5Variación de estrellas de los últimos 7 días
  • OmniVinci@NVlabs

    OmniVinci es un LLM omnimodal para la comprensión conjunta de visión, audio y lenguaje.

    677+0Variación de estrellas de los últimos 7 días
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    642+0Variación de estrellas de los últimos 7 días
  • LAMDA-PILOT@LAMDA-CL

    🎉 PILOT: Una caja de herramientas de aprendizaje continuo basada en modelos preentrenados

    601+3Variación de estrellas de los últimos 7 días
  • t2v_metrics@linzhiqiu

    Evaluación de modelos de texto a imagen/video/3D con VQAScore

    600+0Variación de estrellas de los últimos 7 días
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID: Un conjunto de datos de video a gran escala con anotaciones espaciales.

    600+1Variación de estrellas de los últimos 7 días
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Variación de estrellas de los últimos 7 días
  • Groma@FoundationVision

    [ECCV2024] Modelo de lenguaje multimodal fundamentado con tokenización visual localizada

    586+0Variación de estrellas de los últimos 7 días
  • LLaVA-Mini@ictnlp

    LLaVA-Mini es un modelo multimodal grande (LMM) unificado que admite la comprensión de imágenes, imágenes de alta resolución y videos de manera eficiente.

    577+0Variación de estrellas de los últimos 7 días
  • cambrian-s@cambrian-mllm

    Cambrian-S: Hacia la superpercepción espacial en video

    567-1Variación de estrellas de los últimos 7 días
  • Multi-Modality-Arena@OpenGVLab

    ¡Chatbot Arena se encuentra con la multimodalidad! Multi-Modality Arena te permite comparar modelos de visión-lenguaje lado a lado mientras proporcionas imágenes como entrada. ¡Soporta MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 y muchos más!

    566+0Variación de estrellas de los últimos 7 días
  • Flame-Code-VLM@Flame-Code-VLM

    Flame es un sistema de IA multimodal de código abierto diseñado para traducir maquetas de diseño de interfaz de usuario a código React de alta calidad. Aprovecha el modelado de lenguaje visual, la síntesis de datos automatizada y flujos de trabajo de entrenamiento estructurados para cerrar la brecha entre el diseño y el desarrollo front-end.

    562+0Variación de estrellas de los últimos 7 días
  • count-anything@Mengqi-Lei

    Código y directrices de implementación para el artículo ✨Counting Anything. Página del proyecto: https://mengqi-lei.github.io/count-anything-projectpage/

    539+2Variación de estrellas de los últimos 7 días
← Volver a temas