Saltar al contenido principal
buildradar
Sign in
Tema · vision-language-model

vision-language-model

Repositorios de código abierto monitorizados etiquetados con vision-language-model, ordenados por estrellas.

Repositorios
59
Estrellas totales
150.825
Estrellas de media
2556
Proporción
0,01%

Temas que aparecen con frecuencia junto a vision-language-model en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con vision-language-model.

  • doc7@magicrew

    Convierte documentos en Markdown listo para IA con comprensión visual.

    1153
  • Kit de herramientas visuales y habilidades diseñadas para modelos de solo texto para "ver" imágenes, compatible con comprensión de múltiples imágenes, preguntas y respuestas sobre imágenes, restauración de UI frontend, automatización de GUI, con integración opcional y fluida a múltiples agentes principales, reconocimiento directo de imágenes pegadas

    1136
  • dsh-vision-toolkit@Anionex

    [dsh] Una caja de herramientas visual más potente diseñada para modelos de texto plano: instalación y uso gratuito, reconocimiento directo de imágenes pegadas, preguntas y respuestas sobre múltiples imágenes, captura de pantalla a UI frontend y más | Integración nativa de DeepSeek Harness para el kit de herramientas visuales de agentes: Q&A de imágenes, OCR de capturas de pantalla largas, restauración de UI, grounding, diferencia de píxeles, Artifacts y Web UI.

    854
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Ajuste de instrucciones visuales (LLaVA) diseñado para alcanzar capacidades del nivel de GPT-4V y superiores.

    25.014+9Variación de estrellas de los últimos 7 días
  • X-AnyLabeling@CVHub520

    X-AnyLabeling: una aplicación de escritorio multiplataforma ligera, eficiente y unificada para anotar texto, imágenes, video y datos multimodales, que combina herramientas versátiles integradas con modelos de IA de última generación y una exportación flexible en múltiples formatos.

    10.313+59Variación de estrellas de los últimos 7 días
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] Familia InternVL: una alternativa de código abierto pionera a GPT-4o. Un modelo de diálogo multimodal de código abierto con un rendimiento cercano al de GPT-4o

    10.150+3Variación de estrellas de los últimos 7 días
  • minimind-v@jingyaogong

    👀 ¡Entrena un VLM de 65M de parámetros desde cero en solo 2 horas!

    8535+40Variación de estrellas de los últimos 7 días
  • Qwen-VL@QwenLM

    El repositorio oficial de Qwen-VL (通义千问-VL), un modelo grande de lenguaje y visión preentrenado y de chat propuesto por Alibaba Cloud.

    6727+1Variación de estrellas de los últimos 7 días
  • MineContext@volcengine

    MineContext es tu socio de IA proactivo y consciente del contexto (Context-Engineering+ChatGPT Pulse)

    5497+1Variación de estrellas de los últimos 7 días
  • mlx-vlm@Blaizzy

    MLX-VLM es un paquete para la inferencia y ajuste fino de modelos de lenguaje visual (VLM) en tu Mac utilizando MLX.

    5462+25Variación de estrellas de los últimos 7 días
  • align-anything@PKU-Alignment

    Align Anything: Entrenamiento de modelos de todas las modalidades con retroalimentación

    4671+3Variación de estrellas de los últimos 7 días
  • lmms-eval@EvolvingLMMs-Lab

    Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio

    4390+7Variación de estrellas de los últimos 7 días
  • DeepSeek-VL@deepseek-ai

    DeepSeek-VL: Hacia la comprensión del lenguaje y la visión en el mundo real

    4177+2Variación de estrellas de los últimos 7 días
  • MiniMax-01@MiniMax-AI

    El repositorio oficial de MiniMax-Text-01 y MiniMax-VL-01, modelo de lenguaje grande y modelo de visión-lenguaje basado en atención lineal

    3467+0Variación de estrellas de los últimos 7 días
  • MGM@JIA-Lab-research

    Repositorio oficial de "Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models"

    3327+0Variación de estrellas de los últimos 7 días
  • VLM_survey@jingyi0000

    Colección de increíbles modelos de lenguaje y visión para tareas de visión

    3126+0Variación de estrellas de los últimos 7 días
  • OGAM@off-grid-ai

    La navaja suiza de la IA sin conexión. Chatea, visualiza, habla y genera imágenes en tu teléfono o Mac: LLMs GGUF, visión, conversión de voz a texto con Whisper, Stable Diffusion, llamadas a herramientas y servidores de red local. Se ejecuta en tu CPU, GPU o NPU. Sin cuentas, sin clave de API y cero datos abandonan tu dispositivo.

    3038+17Variación de estrellas de los últimos 7 días
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Un sistema multimodal completo para interacciones de video y audio en streaming de larga duración

    2925-1Variación de estrellas de los últimos 7 días
  • colpali@illuin-tech

    El código utilizado para entrenar y ejecutar inferencias con los modelos ColVision, por ejemplo, ColPali, ColQwen2 y ColSmol.

    2809+7Variación de estrellas de los últimos 7 días
  • Cradle@BAAI-Agents

    El framework Cradle es un primer intento de Control General de Computadoras (GCC). Cradle permite a los agentes superar cualquier tarea informática mediante sólidas capacidades de razonamiento, automejora y curación de habilidades, en un entorno general estandarizado con requisitos mínimos.

    2578+2Variación de estrellas de los últimos 7 días
  • Una implementación de código abierto para el ajuste fino de la serie Qwen-VL de Alibaba Cloud.

    1961+1Variación de estrellas de los últimos 7 días
  • ShowUI@showlab

    [CVPR 2025] Modelo Vision-Language-Action de código abierto y de extremo a extremo para GUI Agent y uso de computadoras.

    1896+2Variación de estrellas de los últimos 7 días
  • Awesome-LLM4AD@Thinklab-SJTU

    Una lista seleccionada de recursos increíbles sobre LLM/VLM/VLA/World Model para conducción autónoma (LLM4AD) (actualizada continuamente)

    1890-2Variación de estrellas de los últimos 7 días
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    NVIDIA AI Blueprint para búsqueda y resumen de video (VSS) es una arquitectura de referencia acelerada por GPU para construir agentes de análisis de video con alertas verificadas en tiempo real, preguntas y respuestas visuales, y generación automatizada de informes. El Blueprint VSS utiliza modelos de lenguaje visual (VLMs) como NVIDIA Cosmos, LLMs como NVIDIA Nemotron, RAG y NVIDIA NIMs.

    1840+10Variación de estrellas de los últimos 7 días
  • AdvancedLiterateMachinery@AlibabaResearch

    Una colección de ideas y algoritmos originales e innovadores hacia Advanced Literate Machinery. Este proyecto lo mantiene el equipo de OCR en el Language Technology Lab, Tongyi Lab, Alibaba Group.

    1835+1Variación de estrellas de los últimos 7 días
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, un modelo base de visión-lenguaje diseñado para avanzar en la comprensión y el razonamiento multimodal de propósito general, logrando un rendimiento de vanguardia en 38 de 60 puntos de referencia públicos.

    1586+0Variación de estrellas de los últimos 7 días
  • vllm-mlx@waybarrios

    Servidor de inferencia LLM de alto rendimiento compatible con OpenAI y Anthropic para Apple Silicon. Incluye MLX nativo, procesamiento por lotes continuo, modelos multimodales, llamadas a herramientas MCP y soporte para Claude Code.

    1557+6Variación de estrellas de los últimos 7 días
  • thepipe@emcf

    Obtén datos limpios de documentos complejos, potenciado por modelos de visión y lenguaje ⚡

    1524+0Variación de estrellas de los últimos 7 días
  • [ICCV 2025] Implementación de Describe Anything: subtitulado detallado y localizado de imágenes y videos

    1517+3Variación de estrellas de los últimos 7 días
  • Ovis@ATH-MaaS

    Una novedosa arquitectura de modelo de lenguaje multimodal (MLLM) diseñada para alinear estructuralmente incrustaciones visuales y textuales.

    1514+2Variación de estrellas de los últimos 7 días
  • awesome-japanese-llm@llm-jp

    Resumen de LLM en japonés - Descripción general de los LLM japoneses.

    1428+1Variación de estrellas de los últimos 7 días
  • mlx-tune@ARahim3

    Ajuste fino de LLM en tu Mac con Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding y ajuste fino de OCR, de forma nativa en MLX. API compatible con Unsloth.

    1398+8Variación de estrellas de los últimos 7 días
  • Modelos multimodales unificados destacados.

    1314+1Variación de estrellas de los últimos 7 días
← Volver a temas