multimodal
Repositorios de código abierto monitorizados etiquetados con multimodal, ordenados por estrellas.
- #91
Kit de herramientas visuales y habilidades diseñadas para modelos de solo texto para "ver" imágenes, compatible con comprensión de múltiples imágenes, preguntas y respuestas sobre imágenes, restauración de UI frontend, automatización de GUI, con integración opcional y fluida a múltiples agentes principales, reconocimiento directo de imágenes pegadas
★ 1136+18Variación de estrellas de los últimos 7 días - #92
El sistema de autocodificación para su aplicación: Alan AI SDK para Cordova.
★ 1132+0Variación de estrellas de los últimos 7 días - #93
SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.
★ 1118+130Variación de estrellas de los últimos 7 días - #94★ 1110+3Variación de estrellas de los últimos 7 días
- #95★ 1088+1Variación de estrellas de los últimos 7 días
- #96
🩺 El primer modelo médico multimodal en chino capaz de analizar radiografías de tórax | The first Chinese Medical Multimodal Model that Chest Radiographs Summarization.
★ 1084+2Variación de estrellas de los últimos 7 días - #97
Ojos para agentes de DeepSeek Harness solo de texto: cadena de visión gratuita integrada (sin clave) + herramientas de visión a nivel de píxel (Q&A, grounding, recorte, diferencia de píxeles, colores, OCR, trazado SVG, recortes, capturas de pantalla). Instalación con un comando, sin Python, los turnos de imagen funcionan como turnos ordinarios de llamada a herramientas.
★ 1083+54Variación de estrellas de los últimos 7 días - #98
[ICLR'24 spotlight] Serie de modelos multimodales grandes en chino e inglés (Chat y Paint) | Basado en la serie de modelos multimodales grandes bilingües chino-inglés CPM
★ 1061-1Variación de estrellas de los últimos 7 días - #99
Un modelo de representación general para modalidades de visión, audio y lenguaje. Artículo: ONE-PEACE: Explorando un modelo de representación general hacia modalidades ilimitadas.
★ 1060+0Variación de estrellas de los últimos 7 días - #100
[Candidato a mejor artículo en ECCV 2024 y TPAMI 2025] PointLLM: Potenciando a los modelos de lenguaje extenso para comprender nubes de puntos.
★ 1053+2Variación de estrellas de los últimos 7 días - #101
Una implementación oficial de "CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval"
★ 1032+0Variación de estrellas de los últimos 7 días - #102
Razonamiento multimodal de cadena de pensamiento: un estudio exhaustivo
★ 1025+2Variación de estrellas de los últimos 7 días - #103★ 1017+37Variación de estrellas de los últimos 7 días
- #104
Recursos, ejemplos y tutoriales para IA multimodal, RAG y agentes que utilizan búsqueda vectorial y LLM.
★ 973-1Variación de estrellas de los últimos 7 días - #105
Framework de entrenamiento de aprendizaje por refuerzo multimodal para modelos de difusión y omnimodales
★ 959+60Variación de estrellas de los últimos 7 días - #106★ 903+4Variación de estrellas de los últimos 7 días
- #107
Este repositorio es una colección curada de los artículos más interesantes e influyentes de CVPR 2025. 🔥 [Artículo + Código + Demo]
★ 895+1Variación de estrellas de los últimos 7 días - #108
Serie NEO: modelos de visión-lenguaje nativos desde los principios fundamentales
★ 888+0Variación de estrellas de los últimos 7 días - #109★ 881+0Variación de estrellas de los últimos 7 días
- #110
Solucionador de captchas compatible con YesCaptcha, autohospedable y construido con FastAPI, Playwright y modelos multimodales compatibles con OpenAI.
★ 869+4Variación de estrellas de los últimos 7 días - #111
Un motor de entrenamiento multimodal simple y unificado. Ligero, flexible y diseñado para hackear a gran escala.
★ 824+0Variación de estrellas de los últimos 7 días - #112
[TMLR 2025🔥] Un estudio sobre modelos autorregresivos en visión artificial.
★ 808+1Variación de estrellas de los últimos 7 días - #113★ 803+0Variación de estrellas de los últimos 7 días
- #114
Entrenamiento de modelos de forma contrastiva en Pytorch
★ 802+0Variación de estrellas de los últimos 7 días - #115
Monitoreo local + visión por IA: marco de monitoreo de IA basado en LAN mediante smartphones, con salida de eventos estructurada para la adquisición y análisis de datos.
★ 768+4Variación de estrellas de los últimos 7 días - #116
Lista de artículos sobre modelos multimodales y de lenguaje de gran escala, utilizada para registrar las lecturas diarias de arxiv para uso personal.
★ 761+1Variación de estrellas de los últimos 7 días - #117
[ECCV 2024] InstructIR: Restauración de imágenes de alta calidad siguiendo instrucciones humanas https://huggingface.co/spaces/marcosv/InstructIR
★ 741+0Variación de estrellas de los últimos 7 días - #118
Paddle Multimodal Integration and eXploration, que soporta tareas multimodales convencionales, incluyendo modelos de preentrenamiento multimodal a gran escala de extremo a extremo y un conjunto de herramientas de modelos de difusión. Equipado con alto rendimiento y flexibilidad.
★ 723-1Variación de estrellas de los últimos 7 días - #119★ 689+1Variación de estrellas de los últimos 7 días
- #120
Este repositorio contiene el código para "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] y "MMEB-V3" [COLM 2026].
★ 682+2Variación de estrellas de los últimos 7 días