multimodal
Repositórios de código aberto acompanhados marcados com multimodal, ordenados por estrelas.
- #121
✨✨ Últimos artigos e benchmarks em raciocínio com Modelos Fundacionais
★ 657+1Variação de estrelas nos últimos 7 dias - #122
MOSS-Audio é um modelo de base de código aberto para compreensão unificada de áudio, permitindo fala, som, música, legendagem, QA e raciocínio em cenários do mundo real.
★ 656+5Variação de estrelas nos últimos 7 dias - #123★ 641-1Variação de estrelas nos últimos 7 dias
- #124
Página do projeto para "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement"
★ 639+0Variação de estrelas nos últimos 7 dias - #125
👁️ + 💬 + 🎧 = 🤖 Lista selecionada dos principais modelos de fundação e multimodais! [Artigo + Código + Exemplos + Tutoriais]
★ 637+0Variação de estrelas nos últimos 7 dias - #126
Implementação oficial para "Blended Latent Diffusion" [SIGGRAPH 2023]
★ 632+0Variação de estrelas nos últimos 7 dias - #127
Second Brain é um framework agêntico que atua como um sistema operacional, usando inteligência de arquivos locais, automação de fluxos de trabalho e LLMs para concluir tarefas e se comunicar em múltiplos meios e plataformas de mensagens.
★ 631+12Variação de estrelas nos últimos 7 dias - #128
Este repositório fornece programas para construir código de RAG (Retrieval-Augmented Generation) para Generative AI com LlamaIndex, Deep Lake e Pinecone, aproveitando o poder dos modelos da OpenAI e Hugging Face para geração e avaliação.
★ 624+2Variação de estrelas nos últimos 7 dias - #129
Explore o "Momento Aha" Multimodal em um modelo de 2B
★ 623+0Variação de estrelas nos últimos 7 dias - #130
Hunyuan3D-Omni: Um Framework Unificado para Geração Controlável de Ativos 3D.
★ 618+3Variação de estrelas nos últimos 7 dias - #131★ 606—Variação de estrelas nos últimos 7 dias
- #132
[ECCV 2024] Tokenize Anything via Prompting
★ 600+0Variação de estrelas nos últimos 7 dias - #133
Este repositório contém código de avaliação para o artigo "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 594+1Variação de estrelas nos últimos 7 dias - #134
Um Motor de Aprendizado por Reforço Assíncrono para Pós-Treinamento Omni-Modal em Escala
★ 592+11Variação de estrelas nos últimos 7 dias - #135
Implementação oficial de "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022]
★ 589+0Variação de estrelas nos últimos 7 dias - #136
[ECCV2024] Modelo de Linguagem Grande Multimodal Fundamentado com Tokenização Visual Localizada
★ 586+0Variação de estrelas nos últimos 7 dias - #137
Crie automação de navegador como se estivesse ensinando um humano usando GPT-4 Vision.
★ 586+0Variação de estrelas nos últimos 7 dias - #138
RAI é um framework agnóstico de fornecedor para robótica de IA Física, utilizando ferramentas ROS 2 para executar ações complexas, cenários definidos, execução de interface livre, resumos de logs, interação de voz e muito mais.
★ 582+6Variação de estrelas nos últimos 7 dias - #139★ 579+13Variação de estrelas nos últimos 7 dias
- #140
LLaVA-Mini é um modelo multimodal grande (LMM) unificado que suporta a compreensão de imagens, imagens de alta resolução e vídeos de forma eficiente.
★ 577+0Variação de estrelas nos últimos 7 dias - #141
Um Agent de IA Multimodal MCP com olhos e ouvidos!
★ 575-1Variação de estrelas nos últimos 7 dias - #142
O sistema de autoprogramação para seu aplicativo — Alan AI SDK para React Native
★ 575+0Variação de estrelas nos últimos 7 dias - #143★ 572+1Variação de estrelas nos últimos 7 dias
- #144★ 568+0Variação de estrelas nos últimos 7 dias
- #145
O Flame é um sistema de IA multimodal de código aberto projetado para traduzir protótipos de design de interface em código React de alta qualidade. Ele aproveita modelagem de visão-linguagem, síntese automatizada de dados e fluxos de trabalho de treinamento estruturados para preencher a lacuna entre o design e o desenvolvimento front-end.
★ 562+0Variação de estrelas nos últimos 7 dias - #146
Um hub para vários esquemas específicos da indústria para uso com VLMs.
★ 555+0Variação de estrelas nos últimos 7 dias - #147
Modelagem Multimodal Incrível [Abrange MLLM, UMM e NMM]
★ 543+2Variação de estrelas nos últimos 7 dias - #148
Código oficial de "EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"
★ 508+1Variação de estrelas nos últimos 7 dias