image-captioning
Repositorios de código abierto monitorizados etiquetados con image-captioning, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a image-captioning en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con image-captioning.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1★ 11.261-1Variación de estrellas de los últimos 7 días
- #2
Modelo de Keras para generar código HTML a partir de maquetas de sitios web dibujadas a mano. Implementa una arquitectura de subtitulación de imágenes para procesar las imágenes fuente.
★ 5143+0Variación de estrellas de los últimos 7 días - #3
InternGPT (iGPT) es una plataforma de demostración de código abierto donde puedes mostrar fácilmente tus modelos de IA. Ahora es compatible con DragGAN, ChatGPT, ImageBind, chat multimodal como GPT-4, SAM, edición interactiva de imágenes, etc. Pruébalo en igpt.opengvlab.com
★ 3205+0Variación de estrellas de los últimos 7 días - #4
Repositorio oficial de OFA (ICML 2022). Artículo: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2557+0Variación de estrellas de los últimos 7 días - #5
Clase simple de Swift para proporcionar todas las configuraciones necesarias para crear una vista de cámara personalizada en su aplicación
★ 1395-1Variación de estrellas de los últimos 7 días - #6★ 1348+2Variación de estrellas de los últimos 7 días
- #7★ 1309+0Variación de estrellas de los últimos 7 días
- #8
Una lista de artículos sobre trabajos recientes de Visión Artificial (CV)
★ 973+1Variación de estrellas de los últimos 7 días - #9
VTuber con IA que utiliza LLM, ASR, TTS, OCR, CV y otras tecnologías para realizar transmisiones en vivo o jugar Minecraft contigo.
★ 802+4Variación de estrellas de los últimos 7 días - #10
👁️ + 💬 + 🎧 = 🤖 Lista curada de los mejores modelos fundamentales y multimodales. [Artículos + Código + Ejemplos + Tutoriales]
★ 637+0Variación de estrellas de los últimos 7 días - #11
Nodos de ComfyUI para modelos de lenguaje visual: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Incluye detección de vocabulario abierto, segmentación SAM2/SAM3, razonamiento temporal de video, GGUF mediante llama.cpp y APIs de LLM/VLM alojadas.
★ 588-1Variación de estrellas de los últimos 7 días - #12
[CVPR 2021] VirTex: Aprendizaje de representaciones visuales a partir de anotaciones textuales.
★ 563+0Variación de estrellas de los últimos 7 días