vision-and-language
Repositórios de código aberto acompanhados marcados com vision-and-language, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de vision-and-language no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com vision-and-language.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Um repositório completo para atualizações de pesquisa em IA generativa, recursos de entrevistas, notebooks e muito mais!
★ 29.211+213Variação de estrelas nos últimos 7 dias - #2★ 11.261-1Variação de estrelas nos últimos 7 dias
- #3
Simplifique o processo de fine-tuning para modelos multimodais: PaliGemma 2, Florence-2 e Qwen2.5-VL.
★ 2.695+1Variação de estrelas nos últimos 7 dias - #4
[EMNLP-2024] Crie agentes de linguagem multimodal para prototipagem rápida e produção
★ 2.666+1Variação de estrelas nos últimos 7 dias - #5
Código para o artigo do ICML 2021 (apresentação longa): "ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision"
★ 1.538+0Variação de estrelas nos últimos 7 dias - #6
Resumo de LLMs em japonês - Visão geral de LLMs japoneses
★ 1.428+1Variação de estrelas nos últimos 7 dias - #7★ 1.393+0Variação de estrelas nos últimos 7 dias
- #8★ 1.309+0Variação de estrelas nos últimos 7 dias
- #9★ 1.088+1Variação de estrelas nos últimos 7 dias
- #10
Um modelo de representação geral para modalidades de visão, áudio e linguagem. Artigo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Variação de estrelas nos últimos 7 dias - #11
[Candidato a melhor artigo ECCV 2024 & TPAMI 2025] PointLLM: Capacitando grandes modelos de linguagem para entender nuvens de pontos.
★ 1.053+2Variação de estrelas nos últimos 7 dias - #12
[ICML2024 (Oral)] Implementação oficial em PyTorch do DoRA: Weight-Decomposed Low-Rank Adaptation
★ 994+4Variação de estrelas nos últimos 7 dias - #13
CALVIN - Um benchmark para aprendizado de políticas condicionadas por linguagem para tarefas de manipulação robótica de longo prazo
★ 985+10Variação de estrelas nos últimos 7 dias - #14
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), o primeiro modelo do gênero capaz de gerar respostas em linguagem natural perfeitamente integradas com máscaras de segmentação de objetos.
★ 967+0Variação de estrelas nos últimos 7 dias - #15
Sobre este repositório: uma coleção selecionada dos artigos mais empolgantes e influentes da CVPR 2025. 🔥 [Artigo + Código + Demonstração]
★ 895+1Variação de estrelas nos últimos 7 dias - #16★ 874+0Variação de estrelas nos últimos 7 dias
- #17
Este repositório é uma coleção selecionada dos artigos mais empolgantes e influentes da CVPR 2024. 🔥 [Artigo + Código + Demo]
★ 735+0Variação de estrelas nos últimos 7 dias - #18
Plataforma de pesquisa de IA para aprendizado por reforço a partir de imagens panorâmicas reais.
★ 713+1Variação de estrelas nos últimos 7 dias - #19
Este repositório é uma coleção selecionada dos artigos mais empolgantes e influentes da CVPR 2023. 🔥 [Paper + Code]
★ 649+0Variação de estrelas nos últimos 7 dias - #20
Criando um software para monitoramento automático em proctoring online
★ 634-1Variação de estrelas nos últimos 7 dias - #21
Uma lista com curadoria para navegação entre visão e linguagem. Artigo da ACL 2022 "Vision-and-Language Navigation: A Survey of Tasks, Methods, and Future Directions"
★ 607+3Variação de estrelas nos últimos 7 dias - #22
Uma lista selecionada de recursos incríveis de visão e linguagem (ainda em construção... fiquem ligados!)
★ 564+0Variação de estrelas nos últimos 7 dias - #23
Este repositório lista artigos relevantes resumidos em nosso artigo de revisão: A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models.
★ 513+0Variação de estrelas nos últimos 7 dias