Pular para o conteúdo principal
buildradar
Sign in
Tópico · vision-language

vision-language

Repositórios de código aberto acompanhados marcados com vision-language, ordenados por estrelas.

Repositórios
18
Total de estrelas
35.353
Média de estrelas
1.964
Participação
0,00%

Tópicos que aparecem com frequência ao lado de vision-language no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com vision-language.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • GroundingDINO@IDEA-Research

    [ECCV 2024] Implementação oficial do artigo "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection"

    10.536+14Variação de estrelas nos últimos 7 dias
  • Chinese-CLIP@OFA-Sys

    Versão chinesa do CLIP que alcança recuperação transmodal e geração de representação em chinês.

    6.001+1Variação de estrelas nos últimos 7 dias
  • OFA@OFA-Sys

    Repositório oficial do OFA (ICML 2022). Artigo: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2.557+0Variação de estrelas nos últimos 7 dias
  • Uma implementação de código aberto para o fine-tuning da série Qwen-VL da Alibaba Cloud.

    1.961+1Variação de estrelas nos últimos 7 dias
  • AdvancedLiterateMachinery@AlibabaResearch

    Uma coleção de ideias e algoritmos originais e inovadores voltados para o Advanced Literate Machinery. Este projeto é mantido pela equipe de OCR do Language Technology Lab, Tongyi Lab, Alibaba Group.

    1.835+1Variação de estrelas nos últimos 7 dias
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT é um modelo de conversação de vídeo capaz de gerar conversas significativas sobre vídeos. Ele combina as capacidades de LLMs com um codificador visual pré-treinado adaptado para representação de vídeo espaço-temporal. Também apresentamos um 'Benchmarking de Avaliação Quantitativa' rigoroso para modelos de conversação baseados em vídeo.

    1.507+1Variação de estrelas nos últimos 7 dias
  • awesome-japanese-llm@llm-jp

    Resumo de LLMs em japonês - Visão geral de LLMs japoneses

    1.428+1Variação de estrelas nos últimos 7 dias
  • DriveLM@OpenDriveLab

    [ECCV 2024 Oral] DriveLM: Dirigindo com perguntas e respostas visuais baseadas em grafos.

    1.340+1Variação de estrelas nos últimos 7 dias
  • ONE-PEACE@OFA-Sys

    Um modelo de representação geral para modalidades de visão, áudio e linguagem. Artigo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1.060+0Variação de estrelas nos últimos 7 dias
  • TinyLLaVA_Factory@TinyLLaVA

    Um framework para modelos multimodais grandes de pequena escala.

    1.004+1Variação de estrelas nos últimos 7 dias
  • calvin@mees

    CALVIN - Um benchmark para aprendizado de políticas condicionadas por linguagem para tarefas de manipulação robótica de longo prazo

    983+8Variação de estrelas nos últimos 7 dias
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: Um modelo CLIP que foca onde você quiser

    874+0Variação de estrelas nos últimos 7 dias
  • Open-GroundingDino@longzw1997

    Esta é a implementação de terceiros do artigo Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.

    846+2Variação de estrelas nos últimos 7 dias
  • LLaVA-pp@mbzuai-oryx

    🔥🔥 LLaVA++: Estendendo o LLaVA com Phi-3 e LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3).

    842+0Variação de estrelas nos últimos 7 dias
  • daclip-uir@Algolzw

    [ICLR 2024] Controlling Vision-Language Models for Universal Image Restoration. 5th place in the NTIRE 2024 Restore Any Image Model in the Wild Challenge.

    817+1Variação de estrelas nos últimos 7 dias
  • SEED@AILab-CVC

    Implementação oficial do SEED-LLaMA (ICLR 2024).

    641-1Variação de estrelas nos últimos 7 dias
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Variação de estrelas nos últimos 7 dias
  • RemoteCLIP@ChenDelong1999

    🛰️ Repositório oficial do artigo "RemoteCLIP: A Vision Language Foundation Model for Remote Sensing" (IEEE TGRS)

    591+4Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos