vision-language-model
Repositorios de código abierto monitorizados etiquetados con vision-language-model, ordenados por estrellas.
- #31★ 1309+0Variación de estrellas de los últimos 7 días
- #32
Framework totalmente abierto para el entrenamiento multimodal democratizado.
★ 1195+1Variación de estrellas de los últimos 7 días - #33
Esta serie te guiará desde los fundamentos de la PNL y la visión por computadora hasta la vanguardia de los modelos de visión y lenguaje.
★ 1179+0Variación de estrellas de los últimos 7 días - #34★ 1153-25Variación de estrellas de los últimos 7 días
- #35
Kit de herramientas visuales y habilidades diseñadas para modelos de solo texto para "ver" imágenes, compatible con comprensión de múltiples imágenes, preguntas y respuestas sobre imágenes, restauración de UI frontend, automatización de GUI, con integración opcional y fluida a múltiples agentes principales, reconocimiento directo de imágenes pegadas
★ 1136+18Variación de estrellas de los últimos 7 días - #36★ 979-1Variación de estrellas de los últimos 7 días
- #37
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), el primer modelo de su clase capaz de generar respuestas en lenguaje natural integradas perfectamente con máscaras de segmentación de objetos.
★ 967+0Variación de estrellas de los últimos 7 días - #38
[CVPR 2024 Highlight🔥] Chat-UniVi: La representación visual unificada potencia a los modelos de lenguaje grandes con comprensión de imágenes y videos
★ 941+0Variación de estrellas de los últimos 7 días - #39
Este repositorio es una colección curada de los artículos más interesantes e influyentes de CVPR 2025. 🔥 [Artículo + Código + Demo]
★ 895+1Variación de estrellas de los últimos 7 días - #40★ 874+0Variación de estrellas de los últimos 7 días
- #41
[dsh] Una caja de herramientas visual más potente diseñada para modelos de texto plano: instalación y uso gratuito, reconocimiento directo de imágenes pegadas, preguntas y respuestas sobre múltiples imágenes, captura de pantalla a UI frontend y más | Integración nativa de DeepSeek Harness para el kit de herramientas visuales de agentes: Q&A de imágenes, OCR de capturas de pantalla largas, restauración de UI, grounding, diferencia de píxeles, Artifacts y Web UI.
★ 856+17Variación de estrellas de los últimos 7 días - #42
VoxPoser: Mapas de valores 3D componibles para manipulación robótica con modelos de lenguaje.
★ 834+1Variación de estrellas de los últimos 7 días - #43
[NeurIPS 2025 Spotlight] OpenCUA: Fundamentos abiertos para agentes de uso informático
★ 833+4Variación de estrellas de los últimos 7 días - #44★ 832+0Variación de estrellas de los últimos 7 días
- #45
Una lista curada de artículos de visión 3D relacionados con el dominio de la robótica en la era de los grandes modelos, es decir, LLMs/VLMs, inspirada en awesome-computer-vision, que incluye artículos, códigos y sitios web relacionados
★ 821+2Variación de estrellas de los últimos 7 días - #46
Una lista curada de métodos de aprendizaje de prompts/adaptadores para modelos de visión-lenguaje como CLIP.
★ 797+1Variación de estrellas de los últimos 7 días - #47
[ICLR 2026] Implementación oficial de "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"
★ 725+5Variación de estrellas de los últimos 7 días - #48
OmniVinci es un LLM omnimodal para la comprensión conjunta de visión, audio y lenguaje.
★ 677+0Variación de estrellas de los últimos 7 días - #49★ 642+0Variación de estrellas de los últimos 7 días
- #50
🎉 PILOT: Una caja de herramientas de aprendizaje continuo basada en modelos preentrenados
★ 601+3Variación de estrellas de los últimos 7 días - #51
Evaluación de modelos de texto a imagen/video/3D con VQAScore
★ 600+0Variación de estrellas de los últimos 7 días - #52
[CVPR 2026] SpatialVID: Un conjunto de datos de video a gran escala con anotaciones espaciales.
★ 600+1Variación de estrellas de los últimos 7 días - #53★ 596—Variación de estrellas de los últimos 7 días
- #54
[ECCV2024] Modelo de lenguaje multimodal fundamentado con tokenización visual localizada
★ 586+0Variación de estrellas de los últimos 7 días - #55
LLaVA-Mini es un modelo multimodal grande (LMM) unificado que admite la comprensión de imágenes, imágenes de alta resolución y videos de manera eficiente.
★ 577+0Variación de estrellas de los últimos 7 días - #56
Cambrian-S: Hacia la superpercepción espacial en video
★ 567-1Variación de estrellas de los últimos 7 días - #57
¡Chatbot Arena se encuentra con la multimodalidad! Multi-Modality Arena te permite comparar modelos de visión-lenguaje lado a lado mientras proporcionas imágenes como entrada. ¡Soporta MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 y muchos más!
★ 566+0Variación de estrellas de los últimos 7 días - #58
Flame es un sistema de IA multimodal de código abierto diseñado para traducir maquetas de diseño de interfaz de usuario a código React de alta calidad. Aprovecha el modelado de lenguaje visual, la síntesis de datos automatizada y flujos de trabajo de entrenamiento estructurados para cerrar la brecha entre el diseño y el desarrollo front-end.
★ 562+0Variación de estrellas de los últimos 7 días - #59
Código y directrices de implementación para el artículo ✨Counting Anything. Página del proyecto: https://mengqi-lei.github.io/count-anything-projectpage/
★ 539+2Variación de estrellas de los últimos 7 días