multimodal
Repositórios de código aberto acompanhados marcados com multimodal, ordenados por estrelas.
- #91
Toolkit visual e conjunto de habilidades projetado para modelos de texto puro "verem" imagens. Suporta compreensão de múltiplas imagens, perguntas e respostas, restauração de UI front-end, automação de GUI, com integração opcional a múltiplos agentes principais e reconhecimento direto de imagens coladas.
★ 1.136+18Variação de estrelas nos últimos 7 dias - #92
O sistema de auto-codificação para seu aplicativo — SDK Alan AI para Cordova.
★ 1.132+0Variação de estrelas nos últimos 7 dias - #93
O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.
★ 1.118+143Variação de estrelas nos últimos 7 dias - #94★ 1.110+5Variação de estrelas nos últimos 7 dias
- #95★ 1.088+1Variação de estrelas nos últimos 7 dias
- #96
Olhos para agentes do DeepSeek Harness baseados apenas em texto: cadeia de visão gratuita integrada (sem chave) + ferramentas de visão em nível de pixel (P&D, grounding, recorte, diferença de pixels, cores, OCR, rastreamento SVG, recorte, capturas de tela). Instalação com um único comando, sem Python, os turnos de imagem funcionam como turnos normais de chamada de ferramentas.
★ 1.085+64Variação de estrelas nos últimos 7 dias - #97
🩺 O primeiro modelo médico multimodal em chinês capaz de analisar radiografias de tórax | O primeiro modelo médico multimodal em chinês para sumarização de radiografias de tórax.
★ 1.084+2Variação de estrelas nos últimos 7 dias - #98
[Destaque ICLR'24] Séries de Modelos Grandes Multimodais em Chinês e Inglês (Chat e Paint) | Baseado no modelo base CPM, série de grandes modelos multimodais bilíngues em chinês e inglês
★ 1.061-1Variação de estrelas nos últimos 7 dias - #99
Um modelo de representação geral para modalidades de visão, áudio e linguagem. Artigo: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Variação de estrelas nos últimos 7 dias - #100
[Candidato a melhor artigo ECCV 2024 & TPAMI 2025] PointLLM: Capacitando grandes modelos de linguagem para entender nuvens de pontos.
★ 1.053+2Variação de estrelas nos últimos 7 dias - #101
Uma implementação oficial para "CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval"
★ 1.032+1Variação de estrelas nos últimos 7 dias - #102
Raciocínio multimodal de cadeia de pensamento: um levantamento abrangente
★ 1.025+2Variação de estrelas nos últimos 7 dias - #103★ 1.017+38Variação de estrelas nos últimos 7 dias
- #104
Recursos, exemplos e tutoriais para IA multimodal, RAG e agentes usando busca vetorial e LLMs
★ 973-1Variação de estrelas nos últimos 7 dias - #105★ 959+64Variação de estrelas nos últimos 7 dias
- #106★ 903+4Variação de estrelas nos últimos 7 dias
- #107
Sobre este repositório: uma coleção selecionada dos artigos mais empolgantes e influentes da CVPR 2025. 🔥 [Artigo + Código + Demonstração]
★ 895+1Variação de estrelas nos últimos 7 dias - #108
Série NEO: Modelos nativos de visão e linguagem a partir de princípios fundamentais
★ 888+0Variação de estrelas nos últimos 7 dias - #109★ 881-1Variação de estrelas nos últimos 7 dias
- #110
⚡ Solucionador de captcha auto-hospedável compatível com YesCaptcha, construído com FastAPI, Playwright e modelos multimodais compatíveis com OpenAI.
★ 869+4Variação de estrelas nos últimos 7 dias - #111
Um mecanismo de treinamento de modelos multimodais simples e unificado. Enxuto, flexível e criado para hacking em escala.
★ 824+0Variação de estrelas nos últimos 7 dias - #112
[TMLR 2025🔥] Uma pesquisa sobre modelos autorregressivos em visão.
★ 808+1Variação de estrelas nos últimos 7 dias - #113★ 803+0Variação de estrelas nos últimos 7 dias
- #114
Treine modelos por contraste no PyTorch.
★ 802+0Variação de estrelas nos últimos 7 dias - #115
Monitoramento local + visão de IA — Framework de monitoramento de IA baseado em LAN alimentado por smartphone com saída de eventos estruturada para aquisição e análise de dados.
★ 768+10Variação de estrelas nos últimos 7 dias - #116
Lista de artigos sobre modelos multimodais e de linguagem grande, usada apenas para registrar artigos lidos no arxiv diariamente para necessidades pessoais.
★ 761+1Variação de estrelas nos últimos 7 dias - #117
[ECCV 2024] InstructIR: Restauração de imagem de alta qualidade seguindo instruções humanas https://huggingface.co/spaces/marcosv/InstructIR
★ 741+0Variação de estrelas nos últimos 7 dias - #118
Integração e Exploração Multimodal do Paddle, dando suporte a tarefas multimodais principais, incluindo modelos de pré-treinamento multimodal em larga escala de ponta a ponta e caixa de ferramentas de modelos de difusão. Equipado com alto desempenho e flexibilidade.
★ 723-1Variação de estrelas nos últimos 7 dias - #119
Uma caixa de ferramentas para recomendação multimodal. Integrando mais de 10 modelos...
★ 689+1Variação de estrelas nos últimos 7 dias - #120
Este repositório contém o código para "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] e "MMEB-V3" [COLM 2026].
★ 682+2Variação de estrelas nos últimos 7 dias