Pular para o conteúdo principal
buildradar
Sign in
Tópico · multimodal

multimodal

Repositórios de código aberto acompanhados marcados com multimodal, ordenados por estrelas.

148 repositórios
  • ✨✨ Últimos artigos e benchmarks em raciocínio com Modelos Fundacionais

    657+1Variação de estrelas nos últimos 7 dias
  • MOSS-Audio@OpenMOSS

    MOSS-Audio é um modelo de base de código aberto para compreensão unificada de áudio, permitindo fala, som, música, legendagem, QA e raciocínio em cenários do mundo real.

    656+5Variação de estrelas nos últimos 7 dias
  • SEED@AILab-CVC

    Implementação oficial do SEED-LLaMA (ICLR 2024).

    641-1Variação de estrelas nos últimos 7 dias
  • Seg-Zero@JIA-Lab-research

    Página do projeto para "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement"

    639+0Variação de estrelas nos últimos 7 dias
  • 👁️ + 💬 + 🎧 = 🤖 Lista selecionada dos principais modelos de fundação e multimodais! [Artigo + Código + Exemplos + Tutoriais]

    637+0Variação de estrelas nos últimos 7 dias
  • blended-latent-diffusion@omriav

    Implementação oficial para "Blended Latent Diffusion" [SIGGRAPH 2023]

    632+0Variação de estrelas nos últimos 7 dias
  • second-brain@henrydaum

    Second Brain é um framework agêntico que atua como um sistema operacional, usando inteligência de arquivos locais, automação de fluxos de trabalho e LLMs para concluir tarefas e se comunicar em múltiplos meios e plataformas de mensagens.

    631+12Variação de estrelas nos últimos 7 dias
  • RAG-Driven-Generative-AI@Denis2054

    Este repositório fornece programas para construir código de RAG (Retrieval-Augmented Generation) para Generative AI com LlamaIndex, Deep Lake e Pinecone, aproveitando o poder dos modelos da OpenAI e Hugging Face para geração e avaliação.

    624+2Variação de estrelas nos últimos 7 dias
  • VisualThinker-R1-Zero@turningpoint-ai

    Explore o "Momento Aha" Multimodal em um modelo de 2B

    623+0Variação de estrelas nos últimos 7 dias
  • Hunyuan3D-Omni@Tencent-Hunyuan

    Hunyuan3D-Omni: Um Framework Unificado para Geração Controlável de Ativos 3D.

    618+3Variação de estrelas nos últimos 7 dias
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606Variação de estrelas nos últimos 7 dias
  • tokenize-anything@baaivision

    [ECCV 2024] Tokenize Anything via Prompting

    600+0Variação de estrelas nos últimos 7 dias
  • MMMU@MMMU-Benchmark

    Este repositório contém código de avaliação para o artigo "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

    594+1Variação de estrelas nos últimos 7 dias
  • Relax@redai-studio

    Um Motor de Aprendizado por Reforço Assíncrono para Pós-Treinamento Omni-Modal em Escala

    592+11Variação de estrelas nos últimos 7 dias
  • blended-diffusion@omriav

    Implementação oficial de "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022]

    589+0Variação de estrelas nos últimos 7 dias
  • Groma@FoundationVision

    [ECCV2024] Modelo de Linguagem Grande Multimodal Fundamentado com Tokenização Visual Localizada

    586+0Variação de estrelas nos últimos 7 dias
  • AI-Employe@vignshwarar

    Crie automação de navegador como se estivesse ensinando um humano usando GPT-4 Vision.

    586+0Variação de estrelas nos últimos 7 dias
  • rai@RobotecAI

    RAI é um framework agnóstico de fornecedor para robótica de IA Física, utilizando ferramentas ROS 2 para executar ações complexas, cenários definidos, execução de interface livre, resumos de logs, interação de voz e muito mais.

    582+6Variação de estrelas nos últimos 7 dias
  • motis@motis-project

    Roteamento multimodal, geocodificação e blocos de mapa

    579+13Variação de estrelas nos últimos 7 dias
  • LLaVA-Mini@ictnlp

    LLaVA-Mini é um modelo multimodal grande (LMM) unificado que suporta a compreensão de imagens, imagens de alta resolução e vídeos de forma eficiente.

    577+0Variação de estrelas nos últimos 7 dias
  • multimodal-agents-course@the-ai-merge

    Um Agent de IA Multimodal MCP com olhos e ouvidos!

    575-1Variação de estrelas nos últimos 7 dias
  • O sistema de autoprogramação para seu aplicativo — Alan AI SDK para React Native

    575+0Variação de estrelas nos últimos 7 dias
  • psi@microsoft

    Plataforma para Inteligência Situada

    572+1Variação de estrelas nos últimos 7 dias
  • clip.cpp@monatis

    Inferência CLIP em C/C++ puro, sem dependências adicionais

    568+0Variação de estrelas nos últimos 7 dias
  • Flame-Code-VLM@Flame-Code-VLM

    O Flame é um sistema de IA multimodal de código aberto projetado para traduzir protótipos de design de interface em código React de alta qualidade. Ele aproveita modelagem de visão-linguagem, síntese automatizada de dados e fluxos de trabalho de treinamento estruturados para preencher a lacuna entre o design e o desenvolvimento front-end.

    562+0Variação de estrelas nos últimos 7 dias
  • vlmrun-hub@vlm-run

    Um hub para vários esquemas específicos da indústria para uso com VLMs.

    555+0Variação de estrelas nos últimos 7 dias
  • Modelagem Multimodal Incrível [Abrange MLLM, UMM e NMM]

    543+2Variação de estrelas nos últimos 7 dias
  • EVF-SAM@hustvl

    Código oficial de "EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"

    508+1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos