llava
Repositórios de código aberto acompanhados marcados com llava, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de llava no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com llava.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) desenvolvido para alcançar recursos do nível do GPT-4V e além.
★ 25.014+12Variação de estrelas nos últimos 7 dias - #2
O SUPIR visa desenvolver algoritmos práticos para restauração de imagens fotorrealistas em cenários reais. Nossa nova demonstração online também está disponível em suppixel.ai.
★ 5.649+0Variação de estrelas nos últimos 7 dias - #3
MLX-VLM é um pacote para inferência e ajuste fino de Vision Language Models (VLMs) no seu Mac usando MLX.
★ 5.462+41Variação de estrelas nos últimos 7 dias - #4
Kit de ferramentas de avaliação de código aberto para grandes modelos multimodais (LMMs), com suporte a mais de 220 LMMs e mais de 80 benchmarks.
★ 4.375+15Variação de estrelas nos últimos 7 dias - #5★ 3.836+2Variação de estrelas nos últimos 7 dias
- #6
Uma biblioteca C#/.NET para executar LLM (🦙LLaMA/LLaVA) no seu dispositivo local com eficiência.
★ 3.790+3Variação de estrelas nos últimos 7 dias - #7★ 3.511+46Variação de estrelas nos últimos 7 dias
- #8
[EMNLP-2024] Crie agentes de linguagem multimodal para prototipagem rápida e produção
★ 2.666+1Variação de estrelas nos últimos 7 dias - #9
[ACL 2024 🔥] Video-ChatGPT é um modelo de conversação de vídeo capaz de gerar conversas significativas sobre vídeos. Ele combina as capacidades de LLMs com um codificador visual pré-treinado adaptado para representação de vídeo espaço-temporal. Também apresentamos um 'Benchmarking de Avaliação Quantitativa' rigoroso para modelos de conversação baseados em vídeo.
★ 1.507+1Variação de estrelas nos últimos 7 dias - #10★ 1.348+2Variação de estrelas nos últimos 7 dias
- #11
IA multimodal de bolso para compreensão e geração de conteúdo em textos multilíngues, imagens e 🔜 vídeo, até 5x mais rápida que o OpenAI CLIP e LLaVA 🖼️ & 🖋️
★ 1.247+2Variação de estrelas nos últimos 7 dias - #12
Framework totalmente aberto para treinamento multimodal democratizado
★ 1.195+3Variação de estrelas nos últimos 7 dias - #13
Um framework para modelos multimodais grandes de pequena escala.
★ 1.004+1Variação de estrelas nos últimos 7 dias - #14
🔥🔥 LLaVA++: Estendendo o LLaVA com Phi-3 e LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3).
★ 842+0Variação de estrelas nos últimos 7 dias - #15★ 794+1Variação de estrelas nos últimos 7 dias
- #16
Integração e Exploração Multimodal do Paddle, dando suporte a tarefas multimodais principais, incluindo modelos de pré-treinamento multimodal em larga escala de ponta a ponta e caixa de ferramentas de modelos de difusão. Equipado com alto desempenho e flexibilidade.
★ 724+1Variação de estrelas nos últimos 7 dias - #17
Uma coleção abrangente de frontend e levantamento de artigos e modelos de repositórios GitHub sobre modelos de visão e linguagem. Atualizações contínuas.
★ 705+5Variação de estrelas nos últimos 7 dias - #18
👁️ + 💬 + 🎧 = 🤖 Lista selecionada dos principais modelos de fundação e multimodais! [Artigo + Código + Exemplos + Tutoriais]
★ 637+0Variação de estrelas nos últimos 7 dias - #19
Nós do ComfyUI para modelos de visão-linguagem: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Inclui detecção de vocabulário aberto, segmentação SAM2/SAM3, raciocínio temporal de vídeo, GGUF via llama.cpp e APIs de LLM/VLM hospedadas.
★ 589+1Variação de estrelas nos últimos 7 dias - #20
LLaVA-Mini é um modelo multimodal grande (LMM) unificado que suporta a compreensão de imagens, imagens de alta resolução e vídeos de forma eficiente.
★ 577+0Variação de estrelas nos últimos 7 dias - #21
Assistente baseado em IA para ajudar nas suas tarefas diárias, alimentado por Llama 3, DeepSeek R1 e muitos outros modelos no HuggingFace.
★ 530+0Variação de estrelas nos últimos 7 dias