multi-modal
Repositórios de código aberto acompanhados marcados com multi-modal, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de multi-modal no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com multi-modal.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Construa e execute agentes que você pode ver, entender e confiar.
★ 30.463+420Variação de estrelas nos últimos 7 dias - #2
Um MLLM de bolso para compreensão ultraeficiente de imagens e vídeos no seu celular
★ 26.283+27Variação de estrelas nos últimos 7 dias - #3
Framework de código aberto para agentes de IA de voz conversacional
★ 11.102+10Variação de estrelas nos últimos 7 dias - #4
[CVPR 2024 Oral] Família InternVL: Uma alternativa pioneira de código aberto ao GPT-4o.
★ 10.150+3Variação de estrelas nos últimos 7 dias - #5
ModelScope: dando vida ao conceito de Model-as-a-Service.
★ 9.121+4Variação de estrelas nos últimos 7 dias - #6
Suíte de IA alimentada por modelos de última geração, oferecendo funções avançadas de IA/AGI. Inclui personas de IA, funções de AGI, chats multimodelo Beam de classe mundial, conversão de texto em imagem, voz, streaming de resposta, destaque e execução de código, importação de PDF, predefinições para desenvolvedores e muito mais. Implante localmente ou na nuvem.
★ 7.108+1Variação de estrelas nos últimos 7 dias - #7
Processamento de dados para e com modelos de fundação! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
★ 6.975+26Variação de estrelas nos últimos 7 dias - #8★ 6.744+0Variação de estrelas nos últimos 7 dias
- #9★ 6.154+24Variação de estrelas nos últimos 7 dias
- #10
Versão chinesa do CLIP que alcança recuperação transmodal e geração de representação em chinês.
★ 6.001+1Variação de estrelas nos últimos 7 dias - #11
Implementação/replicação do DALL-E, o Transformer de texto para imagem da OpenAI, em PyTorch
★ 5.626-2Variação de estrelas nos últimos 7 dias - #12★ 5.031-1Variação de estrelas nos últimos 7 dias
- #13
[EMNLP 2022] Um kit de ferramentas aberto para extração e construção de grafos de conhecimento
★ 4.476+1Variação de estrelas nos últimos 7 dias - #14
Kit de ferramentas de avaliação de código aberto para grandes modelos multimodais (LMMs), com suporte a mais de 220 LMMs e mais de 80 benchmarks.
★ 4.375+13Variação de estrelas nos últimos 7 dias - #15★ 4.342+1Variação de estrelas nos últimos 7 dias
- #16
Modelo de linguagem conversacional multimodal em chinês e inglês.
★ 4.155+0Variação de estrelas nos últimos 7 dias - #17
Uma biblioteca C#/.NET para executar LLM (🦙LLaMA/LLaVA) no seu dispositivo local com eficiência.
★ 3.790+2Variação de estrelas nos últimos 7 dias - #18
【EMNLP 2024🔥】Video-LLaVA: Aprendendo Representação Visual Unificada por Alinhamento Antes da Projeção
★ 3.500+1Variação de estrelas nos últimos 7 dias - #19
Ecossistema de assistente de IA de código aberto com integrações MCP, fluxos de trabalho multimodais, suporte a IoT e interação por voz multiplataforma.
★ 3.463+9Variação de estrelas nos últimos 7 dias - #20★ 3.123-1Variação de estrelas nos últimos 7 dias
- #21
Página do projeto para "LISA: Reasoning Segmentation via Large Language Model".
★ 2.674+0Variação de estrelas nos últimos 7 dias - #22★ 2.433+0Variação de estrelas nos últimos 7 dias
- #23★ 2.322+0Variação de estrelas nos últimos 7 dias
- #24
Uma coleção de artigos clássicos e de ponta da indústria nas áreas de recomendação, publicidade e busca.
★ 2.188-1Variação de estrelas nos últimos 7 dias - #25
[NeurIPS 2023] MotionGPT: Movimento humano como uma língua estrangeira, um modelo unificado de geração de movimento e linguagem usando LLMs
★ 1.963+1Variação de estrelas nos últimos 7 dias - #26
Uma interface GPT robusta e completa para Discord. Conversas estilo ChatGPT, geração de imagens, moderação por IA, índices/base de conhecimento personalizados, resumidor de YouTube e muito mais!
★ 1.853-2Variação de estrelas nos últimos 7 dias - #27★ 1.521+3Variação de estrelas nos últimos 7 dias
- #28
[pip install medmnist] 18 conjuntos de dados padronizados para classificação de imagens biomédicas 2D e 3D.
★ 1.399+0Variação de estrelas nos últimos 7 dias - #29
Implementação em Pytorch de Transfusion, "Predict the Next Token and Diffuse Images with One Multi-Modal Model", da MetaAI
★ 1.398+3Variação de estrelas nos últimos 7 dias - #30
Este repositório reúne artigos para um levantamento sobre destilação de conhecimento em Large Language Models. Dividimos a destilação de conhecimento em algoritmos de elicitação e destilação, e exploramos a destilação de habilidades e vertical de LLMs.
★ 1.306+1Variação de estrelas nos últimos 7 dias