vision-language-model
Repositorios de código abierto monitorizados etiquetados con vision-language-model, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a vision-language-model en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con vision-language-model.
- #1★ 1153
- #2
Kit de herramientas visuales y habilidades diseñadas para modelos de solo texto para "ver" imágenes, compatible con comprensión de múltiples imágenes, preguntas y respuestas sobre imágenes, restauración de UI frontend, automatización de GUI, con integración opcional y fluida a múltiples agentes principales, reconocimiento directo de imágenes pegadas
★ 1136 - #3
[dsh] Una caja de herramientas visual más potente diseñada para modelos de texto plano: instalación y uso gratuito, reconocimiento directo de imágenes pegadas, preguntas y respuestas sobre múltiples imágenes, captura de pantalla a UI frontend y más | Integración nativa de DeepSeek Harness para el kit de herramientas visuales de agentes: Q&A de imágenes, OCR de capturas de pantalla largas, restauración de UI, grounding, diferencia de píxeles, Artifacts y Web UI.
★ 854 - #4
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
[NeurIPS'23 Oral] Ajuste de instrucciones visuales (LLaVA) diseñado para alcanzar capacidades del nivel de GPT-4V y superiores.
★ 25.014+9Variación de estrellas de los últimos 7 días - #2
X-AnyLabeling: una aplicación de escritorio multiplataforma ligera, eficiente y unificada para anotar texto, imágenes, video y datos multimodales, que combina herramientas versátiles integradas con modelos de IA de última generación y una exportación flexible en múltiples formatos.
★ 10.313+59Variación de estrellas de los últimos 7 días - #3
[CVPR 2024 Oral] Familia InternVL: una alternativa de código abierto pionera a GPT-4o. Un modelo de diálogo multimodal de código abierto con un rendimiento cercano al de GPT-4o
★ 10.150+3Variación de estrellas de los últimos 7 días - #4
👀 ¡Entrena un VLM de 65M de parámetros desde cero en solo 2 horas!
★ 8535+40Variación de estrellas de los últimos 7 días - #5
El repositorio oficial de Qwen-VL (通义千问-VL), un modelo grande de lenguaje y visión preentrenado y de chat propuesto por Alibaba Cloud.
★ 6727+1Variación de estrellas de los últimos 7 días - #6
MineContext es tu socio de IA proactivo y consciente del contexto (Context-Engineering+ChatGPT Pulse)
★ 5497+1Variación de estrellas de los últimos 7 días - #7
MLX-VLM es un paquete para la inferencia y ajuste fino de modelos de lenguaje visual (VLM) en tu Mac utilizando MLX.
★ 5462+25Variación de estrellas de los últimos 7 días - #8
Align Anything: Entrenamiento de modelos de todas las modalidades con retroalimentación
★ 4671+3Variación de estrellas de los últimos 7 días - #9
Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio
★ 4390+7Variación de estrellas de los últimos 7 días - #10
DeepSeek-VL: Hacia la comprensión del lenguaje y la visión en el mundo real
★ 4177+2Variación de estrellas de los últimos 7 días - #11
El repositorio oficial de MiniMax-Text-01 y MiniMax-VL-01, modelo de lenguaje grande y modelo de visión-lenguaje basado en atención lineal
★ 3467+0Variación de estrellas de los últimos 7 días - #12
Repositorio oficial de "Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models"
★ 3327+0Variación de estrellas de los últimos 7 días - #13
Colección de increíbles modelos de lenguaje y visión para tareas de visión
★ 3126+0Variación de estrellas de los últimos 7 días - #14
La navaja suiza de la IA sin conexión. Chatea, visualiza, habla y genera imágenes en tu teléfono o Mac: LLMs GGUF, visión, conversión de voz a texto con Whisper, Stable Diffusion, llamadas a herramientas y servidores de red local. Se ejecuta en tu CPU, GPU o NPU. Sin cuentas, sin clave de API y cero datos abandonan tu dispositivo.
★ 3038+17Variación de estrellas de los últimos 7 días - #15
InternLM-XComposer2.5-OmniLive: Un sistema multimodal completo para interacciones de video y audio en streaming de larga duración
★ 2925-1Variación de estrellas de los últimos 7 días - #16
El código utilizado para entrenar y ejecutar inferencias con los modelos ColVision, por ejemplo, ColPali, ColQwen2 y ColSmol.
★ 2809+7Variación de estrellas de los últimos 7 días - #17
El framework Cradle es un primer intento de Control General de Computadoras (GCC). Cradle permite a los agentes superar cualquier tarea informática mediante sólidas capacidades de razonamiento, automejora y curación de habilidades, en un entorno general estandarizado con requisitos mínimos.
★ 2578+2Variación de estrellas de los últimos 7 días - #18
Una implementación de código abierto para el ajuste fino de la serie Qwen-VL de Alibaba Cloud.
★ 1961+1Variación de estrellas de los últimos 7 días - #19
[CVPR 2025] Modelo Vision-Language-Action de código abierto y de extremo a extremo para GUI Agent y uso de computadoras.
★ 1896+2Variación de estrellas de los últimos 7 días - #20
Una lista seleccionada de recursos increíbles sobre LLM/VLM/VLA/World Model para conducción autónoma (LLM4AD) (actualizada continuamente)
★ 1890-2Variación de estrellas de los últimos 7 días - #21
NVIDIA AI Blueprint para búsqueda y resumen de video (VSS) es una arquitectura de referencia acelerada por GPU para construir agentes de análisis de video con alertas verificadas en tiempo real, preguntas y respuestas visuales, y generación automatizada de informes. El Blueprint VSS utiliza modelos de lenguaje visual (VLMs) como NVIDIA Cosmos, LLMs como NVIDIA Nemotron, RAG y NVIDIA NIMs.
★ 1840+10Variación de estrellas de los últimos 7 días - #22
Una colección de ideas y algoritmos originales e innovadores hacia Advanced Literate Machinery. Este proyecto lo mantiene el equipo de OCR en el Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1835+1Variación de estrellas de los últimos 7 días - #23
Seed1.5-VL, un modelo base de visión-lenguaje diseñado para avanzar en la comprensión y el razonamiento multimodal de propósito general, logrando un rendimiento de vanguardia en 38 de 60 puntos de referencia públicos.
★ 1586+0Variación de estrellas de los últimos 7 días - #24
Servidor de inferencia LLM de alto rendimiento compatible con OpenAI y Anthropic para Apple Silicon. Incluye MLX nativo, procesamiento por lotes continuo, modelos multimodales, llamadas a herramientas MCP y soporte para Claude Code.
★ 1557+6Variación de estrellas de los últimos 7 días - #25
Obtén datos limpios de documentos complejos, potenciado por modelos de visión y lenguaje ⚡
★ 1524+0Variación de estrellas de los últimos 7 días - #26
[ICCV 2025] Implementación de Describe Anything: subtitulado detallado y localizado de imágenes y videos
★ 1517+3Variación de estrellas de los últimos 7 días - #27
Una novedosa arquitectura de modelo de lenguaje multimodal (MLLM) diseñada para alinear estructuralmente incrustaciones visuales y textuales.
★ 1514+2Variación de estrellas de los últimos 7 días - #28
Resumen de LLM en japonés - Descripción general de los LLM japoneses.
★ 1428+1Variación de estrellas de los últimos 7 días - #29
Ajuste fino de LLM en tu Mac con Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding y ajuste fino de OCR, de forma nativa en MLX. API compatible con Unsloth.
★ 1398+8Variación de estrellas de los últimos 7 días - #30
Modelos multimodales unificados destacados.
★ 1314+1Variación de estrellas de los últimos 7 días