Pular para o conteúdo principal
buildradar
Sign in
Tópico · multimodal

multimodal

Repositórios de código aberto acompanhados marcados com multimodal, ordenados por estrelas.

148 repositórios
  • Toolkit visual e conjunto de habilidades projetado para modelos de texto puro "verem" imagens. Suporta compreensão de múltiplas imagens, perguntas e respostas, restauração de UI front-end, automação de GUI, com integração opcional a múltiplos agentes principais e reconhecimento direto de imagens coladas.

    1.136+18Variação de estrelas nos últimos 7 dias
  • O sistema de auto-codificação para seu aplicativo — SDK Alan AI para Cordova.

    1.132+0Variação de estrelas nos últimos 7 dias
  • sglang-omni@sgl-project

    O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.

    1.118+143Variação de estrelas nos últimos 7 dias
  • MOVA@OpenMOSS

    MOVA: rumo à geração de vídeo e áudio escalável e sincronizada.

    1.110+5Variação de estrelas nos últimos 7 dias
  • Aria@rhymes-ai

    Base de código para o Aria - um MoE nativo multimodal aberto

    1.088+1Variação de estrelas nos últimos 7 dias
  • dsh-vision-router@ysr666

    Olhos para agentes do DeepSeek Harness baseados apenas em texto: cadeia de visão gratuita integrada (sem chave) + ferramentas de visão em nível de pixel (P&D, grounding, recorte, diferença de pixels, cores, OCR, rastreamento SVG, recorte, capturas de tela). Instalação com um único comando, sem Python, os turnos de imagem funcionam como turnos normais de chamada de ferramentas.

    1.085+64Variação de estrelas nos últimos 7 dias
  • XrayGLM@WangRongsheng

    🩺 O primeiro modelo médico multimodal em chinês capaz de analisar radiografias de tórax | O primeiro modelo médico multimodal em chinês para sumarização de radiografias de tórax.

    1.084+2Variação de estrelas nos últimos 7 dias
  • VisCPM@OpenBMB

    [Destaque ICLR'24] Séries de Modelos Grandes Multimodais em Chinês e Inglês (Chat e Paint) | Baseado no modelo base CPM, série de grandes modelos multimodais bilíngues em chinês e inglês

    1.061-1Variação de estrelas nos últimos 7 dias
  • ONE-PEACE@OFA-Sys

    Um modelo de representação geral para modalidades de visão, áudio e linguagem. Artigo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1.060+0Variação de estrelas nos últimos 7 dias
  • PointLLM@InternRobotics

    [Candidato a melhor artigo ECCV 2024 & TPAMI 2025] PointLLM: Capacitando grandes modelos de linguagem para entender nuvens de pontos.

    1.053+2Variação de estrelas nos últimos 7 dias
  • CLIP4Clip@ArrowLuo

    Uma implementação oficial para "CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval"

    1.032+1Variação de estrelas nos últimos 7 dias
  • Awesome-MCoT@yaotingwangofficial

    Raciocínio multimodal de cadeia de pensamento: um levantamento abrangente

    1.025+2Variação de estrelas nos últimos 7 dias
  • tongflow@tong-io

    TongFlow — Estúdio de GenAI Multimodal

    1.017+38Variação de estrelas nos últimos 7 dias
  • vectordb-recipes@lancedb

    Recursos, exemplos e tutoriais para IA multimodal, RAG e agentes usando busca vetorial e LLMs

    973-1Variação de estrelas nos últimos 7 dias
  • verl-omni@verl-project

    Framework de treinamento de RL multimodal para modelos de difusão e omni

    959+64Variação de estrelas nos últimos 7 dias
  • rag-time@microsoft

    RAG Time: Uma jornada de aprendizado de 5 semanas para dominar RAG

    903+4Variação de estrelas nos últimos 7 dias
  • Sobre este repositório: uma coleção selecionada dos artigos mais empolgantes e influentes da CVPR 2025. 🔥 [Artigo + Código + Demonstração]

    895+1Variação de estrelas nos últimos 7 dias
  • NEO@EvolvingLMMs-Lab

    Série NEO: Modelos nativos de visão e linguagem a partir de princípios fundamentais

    888+0Variação de estrelas nos últimos 7 dias
  • AnyGPT@OpenMOSS

    Código para "AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling"

    881-1Variação de estrelas nos últimos 7 dias
  • ohmycaptcha@shenhao-stu

    ⚡ Solucionador de captcha auto-hospedável compatível com YesCaptcha, construído com FastAPI, Playwright e modelos multimodais compatíveis com OpenAI.

    869+4Variação de estrelas nos últimos 7 dias
  • lmms-engine@EvolvingLMMs-Lab

    Um mecanismo de treinamento de modelos multimodais simples e unificado. Enxuto, flexível e criado para hacking em escala.

    824+0Variação de estrelas nos últimos 7 dias
  • [TMLR 2025🔥] Uma pesquisa sobre modelos autorregressivos em visão.

    808+1Variação de estrelas nos últimos 7 dias
  • papermage@allenai

    Biblioteca que suporta pesquisa em NLP e CV em artigos científicos

    803+0Variação de estrelas nos últimos 7 dias
  • contrastors@nomic-ai

    Treine modelos por contraste no PyTorch.

    802+0Variação de estrelas nos últimos 7 dias
  • Monitoramento local + visão de IA — Framework de monitoramento de IA baseado em LAN alimentado por smartphone com saída de eventos estruturada para aquisição e análise de dados.

    768+10Variação de estrelas nos últimos 7 dias
  • Lista de artigos sobre modelos multimodais e de linguagem grande, usada apenas para registrar artigos lidos no arxiv diariamente para necessidades pessoais.

    761+1Variação de estrelas nos últimos 7 dias
  • InstructIR@mv-lab

    [ECCV 2024] InstructIR: Restauração de imagem de alta qualidade seguindo instruções humanas https://huggingface.co/spaces/marcosv/InstructIR

    741+0Variação de estrelas nos últimos 7 dias
  • PaddleMIX@PaddlePaddle

    Integração e Exploração Multimodal do Paddle, dando suporte a tarefas multimodais principais, incluindo modelos de pré-treinamento multimodal em larga escala de ponta a ponta e caixa de ferramentas de modelos de difusão. Equipado com alto desempenho e flexibilidade.

    723-1Variação de estrelas nos últimos 7 dias
  • MMRec@enoche

    Uma caixa de ferramentas para recomendação multimodal. Integrando mais de 10 modelos...

    689+1Variação de estrelas nos últimos 7 dias
  • VLM2Vec@TIGER-AI-Lab

    Este repositório contém o código para "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] e "MMEB-V3" [COLM 2026].

    682+2Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos