multi-modality
Repositórios de código aberto acompanhados marcados com multi-modality, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de multi-modality no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com multi-modality.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) desenvolvido para alcançar recursos do nível do GPT-4V e além.
★ 25.005+9Variação de estrelas nos últimos 7 dias - #2
Últimos avanços em modelos de linguagem grandes multimodais.
★ 17.994+8Variação de estrelas nos últimos 7 dias - #3
🏄 Incorporação, raciocínio e classificação escaláveis para imagens e frases com CLIP
★ 12.835+0Variação de estrelas nos últimos 7 dias - #4
MOSS-TTS-Nano é um modelo de geração de fala multilíngue minúsculo e open source da MOSI.AI e da equipe OpenMOSS. Com apenas 0,1 bilhão de parâmetros, foi projetado para geração de fala em tempo real, pode rodar diretamente na CPU sem GPU e mantém a stack de implantação simples o suficiente para demonstrações locais, serviços web e integração leve em produtos.
★ 4.279+51Variação de estrelas nos últimos 7 dias - #5
Otter, um modelo multimodal baseado no OpenFlamingo (versão de código aberto do Flamingo da DeepMind), treinado no MIMIC-IT, demonstrando melhor capacidade de seguir instruções e aprendizado em contexto.
★ 3.437+2Variação de estrelas nos últimos 7 dias - #6
InternLM-XComposer2.5-OmniLive: Um sistema multimodal abrangente para interações de vídeo e áudio em streaming de longa duração
★ 2.925+1Variação de estrelas nos últimos 7 dias - #7
Algoritmos e publicações sobre rastreamento de objetos 3D
★ 1.028+2Variação de estrelas nos últimos 7 dias - #8★ 979+1Variação de estrelas nos últimos 7 dias
- #9★ 729+2Variação de estrelas nos últimos 7 dias
- #10★ 671+2Variação de estrelas nos últimos 7 dias
- #11
O Chatbot Arena encontra a multimodalidade! O Multi-Modality Arena permite comparar modelos de visão-linguagem lado a lado fornecendo imagens como entrada. Suporta MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 e muito mais!
★ 566+0Variação de estrelas nos últimos 7 dias