Pular para o conteúdo principal
buildradar
Sign in
Tópico · llava

llava

Repositórios de código aberto acompanhados marcados com llava, ordenados por estrelas.

Repositórios
21
Total de estrelas
66.002
Média de estrelas
3.143
Participação
0,00%

Tópicos que aparecem com frequência ao lado de llava no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com llava.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) desenvolvido para alcançar recursos do nível do GPT-4V e além.

    25.014+12Variação de estrelas nos últimos 7 dias
  • SUPIR@Fanghua-Yu

    O SUPIR visa desenvolver algoritmos práticos para restauração de imagens fotorrealistas em cenários reais. Nossa nova demonstração online também está disponível em suppixel.ai.

    5.649+0Variação de estrelas nos últimos 7 dias
  • mlx-vlm@Blaizzy

    MLX-VLM é um pacote para inferência e ajuste fino de Vision Language Models (VLMs) no seu Mac usando MLX.

    5.462+41Variação de estrelas nos últimos 7 dias
  • VLMEvalKit@open-compass

    Kit de ferramentas de avaliação de código aberto para grandes modelos multimodais (LMMs), com suporte a mais de 220 LMMs e mais de 80 benchmarks.

    4.375+15Variação de estrelas nos últimos 7 dias
  • zero_nlp@yuanzhoulvpi2017

    Soluções de NLP em chinês (LLMs, dados, modelos, treinamento, inferência)

    3.836+2Variação de estrelas nos últimos 7 dias
  • LLamaSharp@SciSharp

    Uma biblioteca C#/.NET para executar LLM (🦙LLaMA/LLaVA) no seu dispositivo local com eficiência.

    3.790+3Variação de estrelas nos últimos 7 dias
  • Eagle@NVlabs

    Eagle: Modelos de visão-linguagem de fronteira com estratégias centradas em dados

    3.511+46Variação de estrelas nos últimos 7 dias
  • OmAgent@om-ai-lab

    [EMNLP-2024] Crie agentes de linguagem multimodal para prototipagem rápida e produção

    2.666+1Variação de estrelas nos últimos 7 dias
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT é um modelo de conversação de vídeo capaz de gerar conversas significativas sobre vídeos. Ele combina as capacidades de LLMs com um codificador visual pré-treinado adaptado para representação de vídeo espaço-temporal. Também apresentamos um 'Benchmarking de Avaliação Quantitativa' rigoroso para modelos de conversação baseados em vídeo.

    1.507+1Variação de estrelas nos últimos 7 dias
  • taggui@jhc13

    Gerenciador de tags e legendas para conjuntos de dados de imagens

    1.348+2Variação de estrelas nos últimos 7 dias
  • UForm@unum-cloud

    IA multimodal de bolso para compreensão e geração de conteúdo em textos multilíngues, imagens e 🔜 vídeo, até 5x mais rápida que o OpenAI CLIP e LLaVA 🖼️ & 🖋️

    1.247+2Variação de estrelas nos últimos 7 dias
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Framework totalmente aberto para treinamento multimodal democratizado

    1.195+3Variação de estrelas nos últimos 7 dias
  • TinyLLaVA_Factory@TinyLLaVA

    Um framework para modelos multimodais grandes de pequena escala.

    1.004+1Variação de estrelas nos últimos 7 dias
  • LLaVA-pp@mbzuai-oryx

    🔥🔥 LLaVA++: Estendendo o LLaVA com Phi-3 e LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3).

    842+0Variação de estrelas nos últimos 7 dias
  • machina@PsyChip

    Sistema de vigilância por vídeo alimentado por OpenCV, YOLO e LLAVA

    794+1Variação de estrelas nos últimos 7 dias
  • PaddleMIX@PaddlePaddle

    Integração e Exploração Multimodal do Paddle, dando suporte a tarefas multimodais principais, incluindo modelos de pré-treinamento multimodal em larga escala de ponta a ponta e caixa de ferramentas de modelos de difusão. Equipado com alto desempenho e flexibilidade.

    724+1Variação de estrelas nos últimos 7 dias
  • Uma coleção abrangente de frontend e levantamento de artigos e modelos de repositórios GitHub sobre modelos de visão e linguagem. Atualizações contínuas.

    705+5Variação de estrelas nos últimos 7 dias
  • 👁️ + 💬 + 🎧 = 🤖 Lista selecionada dos principais modelos de fundação e multimodais! [Artigo + Código + Exemplos + Tutoriais]

    637+0Variação de estrelas nos últimos 7 dias
  • ComfyUI_VLM_nodes@gokayfem

    Nós do ComfyUI para modelos de visão-linguagem: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Inclui detecção de vocabulário aberto, segmentação SAM2/SAM3, raciocínio temporal de vídeo, GGUF via llama.cpp e APIs de LLM/VLM hospedadas.

    589+1Variação de estrelas nos últimos 7 dias
  • LLaVA-Mini@ictnlp

    LLaVA-Mini é um modelo multimodal grande (LMM) unificado que suporta a compreensão de imagens, imagens de alta resolução e vídeos de forma eficiente.

    577+0Variação de estrelas nos últimos 7 dias
  • llama-assistant@nrl-ai

    Assistente baseado em IA para ajudar nas suas tarefas diárias, alimentado por Llama 3, DeepSeek R1 e muitos outros modelos no HuggingFace.

    530+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos