vision-and-language
Repositorios de código abierto monitorizados etiquetados con vision-and-language, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a vision-and-language en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con vision-and-language.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Un repositorio integral para actualizaciones de investigación en IA generativa, recursos de entrevistas, notebooks y mucho más.
★ 29.211+213Variación de estrellas de los últimos 7 días - #2★ 11.261-1Variación de estrellas de los últimos 7 días
- #3
Optimiza el proceso de ajuste fino (fine-tuning) para modelos multimodales: PaliGemma 2, Florence-2 y Qwen2.5-VL.
★ 2695+1Variación de estrellas de los últimos 7 días - #4
[EMNLP-2024] Construye agentes de lenguaje multimodales para prototipado rápido y producción
★ 2666+1Variación de estrellas de los últimos 7 días - #5
Código para el artículo de ICML 2021 (charla larga): "ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision"
★ 1538+0Variación de estrellas de los últimos 7 días - #6
Resumen de LLM en japonés - Descripción general de los LLM japoneses.
★ 1428+1Variación de estrellas de los últimos 7 días - #7★ 1393+0Variación de estrellas de los últimos 7 días
- #8★ 1309+0Variación de estrellas de los últimos 7 días
- #9★ 1088+1Variación de estrellas de los últimos 7 días
- #10
Un modelo de representación general para modalidades de visión, audio y lenguaje. Artículo: ONE-PEACE: Explorando un modelo de representación general hacia modalidades ilimitadas.
★ 1060+0Variación de estrellas de los últimos 7 días - #11
[Candidato a mejor artículo en ECCV 2024 y TPAMI 2025] PointLLM: Potenciando a los modelos de lenguaje extenso para comprender nubes de puntos.
★ 1053+2Variación de estrellas de los últimos 7 días - #12
[ICML2024 (Oral)] Implementación oficial en PyTorch de DoRA: Weight-Decomposed Low-Rank Adaptation
★ 994+1Variación de estrellas de los últimos 7 días - #13
CALVIN: un benchmark para el aprendizaje de políticas condicionadas por lenguaje en tareas de manipulación robótica de largo horizonte
★ 985+8Variación de estrellas de los últimos 7 días - #14
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), el primer modelo de su clase capaz de generar respuestas en lenguaje natural integradas perfectamente con máscaras de segmentación de objetos.
★ 967+0Variación de estrellas de los últimos 7 días - #15
Este repositorio es una colección curada de los artículos más interesantes e influyentes de CVPR 2025. 🔥 [Artículo + Código + Demo]
★ 895+1Variación de estrellas de los últimos 7 días - #16★ 874+0Variación de estrellas de los últimos 7 días
- #17
Este repositorio es una colección curada de los artículos más interesantes e influyentes de CVPR 2024. 🔥 [Artículo + Código + Demo]
★ 735+0Variación de estrellas de los últimos 7 días - #18
Plataforma de investigación de IA para aprendizaje por refuerzo a partir de imágenes panorámicas reales.
★ 713+2Variación de estrellas de los últimos 7 días - #19
Este repositorio es una colección curada de los artículos más interesantes e influyentes de CVPR 2023. 🔥 [Artículo + Código]
★ 649+0Variación de estrellas de los últimos 7 días - #20
Creación de software para la supervisión automática en exámenes en línea.
★ 634-1Variación de estrellas de los últimos 7 días - #21
Una lista curada para navegación de visión y lenguaje. Artículo de ACL 2022 "Vision-and-Language Navigation: A Survey of Tasks, Methods, and Future Directions".
★ 607+2Variación de estrellas de los últimos 7 días - #22
Una lista curada de recursos sobre visión y lenguaje (aún en construcción... ¡mantente atento!)
★ 564+0Variación de estrellas de los últimos 7 días - #23
Este repositorio enumera los artículos relevantes resumidos en nuestro estudio: Un estudio sistemático de la ingeniería de prompts en modelos fundacionales de visión-lenguaje.
★ 513+0Variación de estrellas de los últimos 7 días