Pular para o conteúdo principal
buildradar
Sign in
Tópico · multimodal-ai

multimodal-ai

Repositórios de código aberto acompanhados marcados com multimodal-ai, ordenados por estrelas.

Repositórios
13
Total de estrelas
38.644
Média de estrelas
2.973
Participação
0,00%

Tópicos que aparecem com frequência ao lado de multimodal-ai no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com multimodal-ai.

Nenhum repositório novo marcado com este tópico nos últimos 90 dias.

  • 🚀 Kit de ferramentas de avatar de IA (humano digital) verdadeiramente de código aberto para geração de vídeo offline e clonagem de humanos digitais.

    14.992+65Variação de estrelas nos últimos 7 dias
  • AgnesAI-Models@AgnesAI-Labs

    Gateway oficial Agnes AI e catálogo de modelos para fluxos de trabalho de texto, imagem, vídeo e agentes compatíveis com OpenAI.

    5.044+28Variação de estrelas nos últimos 7 dias
  • Habilidades de mídia generativa multimodal para agentes de IA (Claude Code, Cursor, Gemini CLI). Geração de imagem, vídeo e áudio de alta qualidade com tecnologia muapi.ai.

    4.205+19Variação de estrelas nos últimos 7 dias
  • Mano-P@Mininglamp-AI

    Mano-P: Agente GUI-VLA de código aberto para dispositivos de borda. #1 no OSWorld (especializado, 58,2%). Executa localmente em Apple M4 Mac mini/MacBook — nenhum dado sai do seu dispositivo.

    2.615+15Variação de estrelas nos últimos 7 dias
  • EVA-OS@AutoArk

    EVA OS — Um sistema operacional de IA multimodal em tempo real para hardware de próxima geração, permitindo que seus dispositivos fiquem vivos e tão inteligentes quanto um cérebro real.

    1.869+87Variação de estrelas nos últimos 7 dias
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    O NVIDIA AI Blueprint para pesquisa e resumo de vídeo (VSS) é uma arquitetura de referência acelerada por GPU para criar agentes de análise de vídeo com alertas verificados em tempo real, perguntas e respostas visuais e relatórios automatizados. O Blueprint VSS utiliza modelos de linguagem visual (VLMs) como o NVIDIA Cosmos, LLMs como o NVIDIA Nemotron, RAG e NVIDIA NIMs.

    1.840+10Variação de estrelas nos últimos 7 dias
  • OpenGUI@Core-Mate

    OpenGUI é um framework de agente GUI para Android voltado para IA, capaz de visualizar, planejar e operar aplicativos móveis reais através da interface gráfica.

    1.624+38Variação de estrelas nos últimos 7 dias
  • vllm-mlx@waybarrios

    Servidor de inferência LLM de alto desempenho compatível com OpenAI e Anthropic para Apple Silicon. MLX nativo, processamento contínuo, modelos multimodais, chamada de ferramentas MCP e suporte ao Claude Code.

    1.557+6Variação de estrelas nos últimos 7 dias
  • Catálogo visual com curadoria de mais de 155 arquiteturas de modelos de linguagem visual (VLM/MLLM): artigos, diagramas, receitas de treinamento, conjuntos de dados e uma linha do tempo de lançamentos para agentes de IA multimodal.

    1.310+2Variação de estrelas nos últimos 7 dias
  • xiaoyaosearch@dtsola

    XiaoyaoSearch: entende suas palavras, lê suas imagens e encontra qualquer arquivo local com IA. Tornando a busca tão simples quanto conversar.

    1.084+1Variação de estrelas nos últimos 7 dias
  • opendroid@yashab-cyber

    Seu Open Autonomous Android Agent — Um assistente de IA pronto para produção e auto-planejamento, alimentado por LLMs locais/remotos e automação de tela orientada por acessibilidade.

    1.022+44Variação de estrelas nos últimos 7 dias
  • vectordb-recipes@lancedb

    Recursos, exemplos e tutoriais para IA multimodal, RAG e agentes usando busca vetorial e LLMs

    973-1Variação de estrelas nos últimos 7 dias
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos