vision-language
Repositórios de código aberto acompanhados marcados com vision-language, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de vision-language no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com vision-language.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
[ECCV 2024] Implementação oficial do artigo "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection"
★ 10.536+14Variação de estrelas nos últimos 7 dias - #2
Versão chinesa do CLIP que alcança recuperação transmodal e geração de representação em chinês.
★ 6.001+1Variação de estrelas nos últimos 7 dias - #3
Repositório oficial do OFA (ICML 2022). Artigo: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2.557+0Variação de estrelas nos últimos 7 dias - #4
Uma implementação de código aberto para o fine-tuning da série Qwen-VL da Alibaba Cloud.
★ 1.961+1Variação de estrelas nos últimos 7 dias - #5
Uma coleção de ideias e algoritmos originais e inovadores voltados para o Advanced Literate Machinery. Este projeto é mantido pela equipe de OCR do Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1.835+1Variação de estrelas nos últimos 7 dias - #6
[ACL 2024 🔥] Video-ChatGPT é um modelo de conversação de vídeo capaz de gerar conversas significativas sobre vídeos. Ele combina as capacidades de LLMs com um codificador visual pré-treinado adaptado para representação de vídeo espaço-temporal. Também apresentamos um 'Benchmarking de Avaliação Quantitativa' rigoroso para modelos de conversação baseados em vídeo.
★ 1.507+1Variação de estrelas nos últimos 7 dias - #7
Resumo de LLMs em japonês - Visão geral de LLMs japoneses
★ 1.428+1Variação de estrelas nos últimos 7 dias - #8
[ECCV 2024 Oral] DriveLM: Dirigindo com perguntas e respostas visuais baseadas em grafos.
★ 1.340+1Variação de estrelas nos últimos 7 dias - #9
Um modelo de representação geral para modalidades de visão, áudio e linguagem. Artigo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Variação de estrelas nos últimos 7 dias - #10
Um framework para modelos multimodais grandes de pequena escala.
★ 1.004+1Variação de estrelas nos últimos 7 dias - #11
CALVIN - Um benchmark para aprendizado de políticas condicionadas por linguagem para tarefas de manipulação robótica de longo prazo
★ 983+8Variação de estrelas nos últimos 7 dias - #12★ 874+0Variação de estrelas nos últimos 7 dias
- #13
Esta é a implementação de terceiros do artigo Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.
★ 846+2Variação de estrelas nos últimos 7 dias - #14
🔥🔥 LLaVA++: Estendendo o LLaVA com Phi-3 e LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3).
★ 842+0Variação de estrelas nos últimos 7 dias - #15
[ICLR 2024] Controlling Vision-Language Models for Universal Image Restoration. 5th place in the NTIRE 2024 Restore Any Image Model in the Wild Challenge.
★ 817+1Variação de estrelas nos últimos 7 dias - #16★ 641-1Variação de estrelas nos últimos 7 dias
- #17★ 596—Variação de estrelas nos últimos 7 dias
- #18
🛰️ Repositório oficial do artigo "RemoteCLIP: A Vision Language Foundation Model for Remote Sensing" (IEEE TGRS)
★ 591+4Variação de estrelas nos últimos 7 dias