vision-language
Repositorios de código abierto monitorizados etiquetados con vision-language, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a vision-language en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con vision-language.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
[ECCV 2024] Implementación oficial del artículo "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection"
★ 10.536+14Variación de estrellas de los últimos 7 días - #2
Versión en chino de CLIP que logra la recuperación y generación de representaciones multimodales en chino.
★ 6001+1Variación de estrellas de los últimos 7 días - #3
Repositorio oficial de OFA (ICML 2022). Artículo: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2557+0Variación de estrellas de los últimos 7 días - #4
Una implementación de código abierto para el ajuste fino de la serie Qwen-VL de Alibaba Cloud.
★ 1961+1Variación de estrellas de los últimos 7 días - #5
Una colección de ideas y algoritmos originales e innovadores hacia Advanced Literate Machinery. Este proyecto lo mantiene el equipo de OCR en el Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1835+1Variación de estrellas de los últimos 7 días - #6
[ACL 2024] Video-ChatGPT es un modelo de conversación de video capaz de generar diálogos significativos sobre videos. Combina las capacidades de los LLMs con un codificador visual preentrenado adaptado para la representación espaciotemporal de video. También introducimos un riguroso 'Quantitative Evaluation Benchmarking' para modelos conversacionales basados en video.
★ 1507+1Variación de estrellas de los últimos 7 días - #7
Resumen de LLM en japonés - Descripción general de los LLM japoneses.
★ 1428+1Variación de estrellas de los últimos 7 días - #8
[ECCV 2024 Oral] DriveLM: Conducción con respuesta a preguntas visuales basada en grafos.
★ 1340+1Variación de estrellas de los últimos 7 días - #9
Un modelo de representación general para modalidades de visión, audio y lenguaje. Artículo: ONE-PEACE: Explorando un modelo de representación general hacia modalidades ilimitadas.
★ 1060+0Variación de estrellas de los últimos 7 días - #10
Un framework de modelos multimodales grandes a pequeña escala
★ 1004+1Variación de estrellas de los últimos 7 días - #11
CALVIN: un benchmark para el aprendizaje de políticas condicionadas por lenguaje en tareas de manipulación robótica de largo horizonte
★ 983+8Variación de estrellas de los últimos 7 días - #12★ 874+0Variación de estrellas de los últimos 7 días
- #13
Implementación de terceros del artículo Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.
★ 846+2Variación de estrellas de los últimos 7 días - #14
🔥🔥 LLaVA++: Extensión de LLaVA con Phi-3 y LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3).
★ 842+0Variación de estrellas de los últimos 7 días - #15
[ICLR 2024] Control de modelos de lenguaje visual para la restauración universal de imágenes. Quinto lugar en el desafío NTIRE 2024 Restore Any Image Model in the Wild.
★ 817+1Variación de estrellas de los últimos 7 días - #16★ 641-1Variación de estrellas de los últimos 7 días
- #17★ 596—Variación de estrellas de los últimos 7 días
- #18
Repositorio oficial del artículo "RemoteCLIP: A Vision Language Foundation Model for Remote Sensing" (IEEE TGRS)
★ 591+4Variación de estrellas de los últimos 7 días