multimodal
Repositórios de código aberto acompanhados marcados com multimodal, ordenados por estrelas.
- #61
SDK para interagir com as APIs da stability.ai (por exemplo, inferência de stable diffusion)
★ 2.435-1Variação de estrelas nos últimos 7 dias - #62
mPLUG-DocOwl: Modelo de linguagem multimodal modularizado para compreensão de documentos
★ 2.411+0Variação de estrelas nos últimos 7 dias - #63
[ECCV2024] Modelos de fundação de vídeo e dados para compreensão multimodal
★ 2.374+5Variação de estrelas nos últimos 7 dias - #64
🎨 NeMo Data Designer: Gere dados sintéticos de alta qualidade do zero ou a partir de dados semente.
★ 2.197+7Variação de estrelas nos últimos 7 dias - #65
GenAI Processors é uma biblioteca Python leve que permite o processamento de conteúdo eficiente e paralelo.
★ 2.120+0Variação de estrelas nos últimos 7 dias - #66
Permita que o Claude (ou qualquer LLM) assista a um vídeo — com reconhecimento de cena, quadros deduplicados e transcrição, a partir de uma URL ou arquivo local. Executado localmente, sob licença MIT.
★ 2.109+20Variação de estrelas nos últimos 7 dias - #67
IA multimodal em tempo real executada no dispositivo, com recursos semelhantes ao GPT-Live.
★ 2.048+7Variação de estrelas nos últimos 7 dias - #68
[ICLR & NeurIPS 2025] Repositório para a série Show-o, um único Transformer para unificar a compreensão e geração multimodal.
★ 1.975+1Variação de estrelas nos últimos 7 dias - #69
Uma implementação de código aberto para o fine-tuning da série Qwen-VL da Alibaba Cloud.
★ 1.961+1Variação de estrelas nos últimos 7 dias - #70
Implementação de "BitNet: Scaling 1-bit Transformers for Large Language Models" em pytorch
★ 1.946+0Variação de estrelas nos últimos 7 dias - #71
Uma coleção de ideias e algoritmos originais e inovadores voltados para o Advanced Literate Machinery. Este projeto é mantido pela equipe de OCR do Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1.835+1Variação de estrelas nos últimos 7 dias - #72★ 1.818+1Variação de estrelas nos últimos 7 dias
- #73
O sistema de autocodificação para seu aplicativo — Alan AI SDK para Android
★ 1.807-1Variação de estrelas nos últimos 7 dias - #74
O sistema de autocodificação para seu aplicativo — Alan AI SDK para Flutter.
★ 1.756-1Variação de estrelas nos últimos 7 dias - #75
O sistema de auto-codificação para seu aplicativo — Alan AI SDK para Ionic
★ 1.649-1Variação de estrelas nos últimos 7 dias - #76
Backend multimodal unificado para aplicações de dados de IA
★ 1.619+5Variação de estrelas nos últimos 7 dias - #77★ 1.602+3Variação de estrelas nos últimos 7 dias
- #78
Obtenha dados limpos de documentos complexos, com tecnologia de modelos de visão e linguagem ⚡.
★ 1.524+0Variação de estrelas nos últimos 7 dias - #79
Uma nova arquitetura de Modelo de Linguagem Grande Multimodal (MLLM), projetada para alinhar estruturalmente embeddings visuais e textuais.
★ 1.514+2Variação de estrelas nos últimos 7 dias - #80
Inteligência visual para sua casa.
★ 1.454+10Variação de estrelas nos últimos 7 dias - #81
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.432+521Variação de estrelas nos últimos 7 dias - #82
Resumo de LLMs em japonês - Visão geral de LLMs japoneses
★ 1.428+1Variação de estrelas nos últimos 7 dias - #83
Este repositório é a implementação oficial de Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023)
★ 1.406-1Variação de estrelas nos últimos 7 dias - #84
Motor de inferência offline para arte, conversas de voz em tempo real, chatbots baseados em LLM e fluxos de trabalho automatizados
★ 1.314+0Variação de estrelas nos últimos 7 dias - #85
Catálogo visual com curadoria de mais de 155 arquiteturas de modelos de linguagem visual (VLM/MLLM): artigos, diagramas, receitas de treinamento, conjuntos de dados e uma linha do tempo de lançamentos para agentes de IA multimodal.
★ 1.310+2Variação de estrelas nos últimos 7 dias - #86
Dê ao Claude a capacidade de assistir e entender vídeos — plugin para Claude Code com extração de quadros e análise de áudio multimodal
★ 1.281+6Variação de estrelas nos últimos 7 dias - #87
IA multimodal de bolso para compreensão e geração de conteúdo em textos multilíngues, imagens e 🔜 vídeo, até 5x mais rápida que o OpenAI CLIP e LLaVA 🖼️ & 🖋️
★ 1.247+1Variação de estrelas nos últimos 7 dias - #88
Xtreme1 é uma plataforma de rotulagem e anotação de dados tudo-em-um para treinamento de dados multimodais, com suporte para nuvens de pontos LiDAR 3D, imagens e LLMs.
★ 1.239+2Variação de estrelas nos últimos 7 dias - #89
Unificando a geração de malhas 3D com modelos de linguagem
★ 1.167+0Variação de estrelas nos últimos 7 dias - #90★ 1.153-25Variação de estrelas nos últimos 7 dias