image-captioning
Repositórios de código aberto acompanhados marcados com image-captioning, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de image-captioning no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com image-captioning.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1★ 11.261-1Variação de estrelas nos últimos 7 dias
- #2
Modelo Keras para gerar código HTML a partir de mockups de sites desenhados à mão. Implementa uma arquitetura de legendagem de imagens para as imagens de origem desenhadas.
★ 5.143+0Variação de estrelas nos últimos 7 dias - #3
InternGPT (iGPT) é uma plataforma de demonstração de código aberto onde você pode exibir facilmente seus modelos de IA. Agora suporta DragGAN, ChatGPT, ImageBind, chat multimodal como GPT-4, SAM, edição interativa de imagens, etc. Experimente em igpt.opengvlab.com.
★ 3.205+0Variação de estrelas nos últimos 7 dias - #4
Repositório oficial do OFA (ICML 2022). Artigo: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2.557+0Variação de estrelas nos últimos 7 dias - #5
Classe Swift simples para fornecer todas as configurações necessárias para criar uma visualização de câmera personalizada em seu aplicativo.
★ 1.395-1Variação de estrelas nos últimos 7 dias - #6★ 1.348+2Variação de estrelas nos últimos 7 dias
- #7★ 1.309+0Variação de estrelas nos últimos 7 dias
- #8
Lista de artigos de trabalhos recentes em Visão Computacional (CV)
★ 973+1Variação de estrelas nos últimos 7 dias - #9
AI VTuber com LLM, ASR, TTS, OCR, CV e mais tecnologias para fazer transmissão ao vivo ou jogar Minecraft com você.
★ 803+4Variação de estrelas nos últimos 7 dias - #10
👁️ + 💬 + 🎧 = 🤖 Lista selecionada dos principais modelos de fundação e multimodais! [Artigo + Código + Exemplos + Tutoriais]
★ 637+0Variação de estrelas nos últimos 7 dias - #11
Nós do ComfyUI para modelos de visão-linguagem: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Inclui detecção de vocabulário aberto, segmentação SAM2/SAM3, raciocínio temporal de vídeo, GGUF via llama.cpp e APIs de LLM/VLM hospedadas.
★ 588-1Variação de estrelas nos últimos 7 dias - #12★ 563+0Variação de estrelas nos últimos 7 dias