Pular para o conteúdo principal
buildradar
Sign in
Tópico · multimodal

multimodal

Repositórios de código aberto acompanhados marcados com multimodal, ordenados por estrelas.

148 repositórios
  • stability-sdk@Stability-AI

    SDK para interagir com as APIs da stability.ai (por exemplo, inferência de stable diffusion)

    2.435-1Variação de estrelas nos últimos 7 dias
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Modelo de linguagem multimodal modularizado para compreensão de documentos

    2.411+0Variação de estrelas nos últimos 7 dias
  • InternVideo@OpenGVLab

    [ECCV2024] Modelos de fundação de vídeo e dados para compreensão multimodal

    2.374+5Variação de estrelas nos últimos 7 dias
  • DataDesigner@NVIDIA-NeMo

    🎨 NeMo Data Designer: Gere dados sintéticos de alta qualidade do zero ou a partir de dados semente.

    2.197+7Variação de estrelas nos últimos 7 dias
  • genai-processors@google-gemini

    GenAI Processors é uma biblioteca Python leve que permite o processamento de conteúdo eficiente e paralelo.

    2.120+0Variação de estrelas nos últimos 7 dias
  • claude-real-video@HUANGCHIHHUNGLeo

    Permita que o Claude (ou qualquer LLM) assista a um vídeo — com reconhecimento de cena, quadros deduplicados e transcrição, a partir de uma URL ou arquivo local. Executado localmente, sob licença MIT.

    2.109+20Variação de estrelas nos últimos 7 dias
  • parlor@fikrikarim

    IA multimodal em tempo real executada no dispositivo, com recursos semelhantes ao GPT-Live.

    2.048+7Variação de estrelas nos últimos 7 dias
  • Show-o@showlab

    [ICLR & NeurIPS 2025] Repositório para a série Show-o, um único Transformer para unificar a compreensão e geração multimodal.

    1.975+1Variação de estrelas nos últimos 7 dias
  • Uma implementação de código aberto para o fine-tuning da série Qwen-VL da Alibaba Cloud.

    1.961+1Variação de estrelas nos últimos 7 dias
  • BitNet@kyegomez

    Implementação de "BitNet: Scaling 1-bit Transformers for Large Language Models" em pytorch

    1.946+0Variação de estrelas nos últimos 7 dias
  • AdvancedLiterateMachinery@AlibabaResearch

    Uma coleção de ideias e algoritmos originais e inovadores voltados para o Advanced Literate Machinery. Este projeto é mantido pela equipe de OCR do Language Technology Lab, Tongyi Lab, Alibaba Group.

    1.835+1Variação de estrelas nos últimos 7 dias
  • DeTikZify@potamides

    Síntese de programas gráficos para figuras científicas e esboços com TikZ.

    1.818+1Variação de estrelas nos últimos 7 dias
  • O sistema de autocodificação para seu aplicativo — Alan AI SDK para Android

    1.807-1Variação de estrelas nos últimos 7 dias
  • O sistema de autocodificação para seu aplicativo — Alan AI SDK para Flutter.

    1.756-1Variação de estrelas nos últimos 7 dias
  • alan-sdk-ionic@alan-ai

    O sistema de auto-codificação para seu aplicativo — Alan AI SDK para Ionic

    1.649-1Variação de estrelas nos últimos 7 dias
  • pixeltable@pixeltable

    Backend multimodal unificado para aplicações de dados de IA

    1.619+5Variação de estrelas nos últimos 7 dias
  • mllm@UbiquitousLearning

    LLM multimodal rápido para dispositivos móveis

    1.602+3Variação de estrelas nos últimos 7 dias
  • thepipe@emcf

    Obtenha dados limpos de documentos complexos, com tecnologia de modelos de visão e linguagem ⚡.

    1.524+0Variação de estrelas nos últimos 7 dias
  • Ovis@ATH-MaaS

    Uma nova arquitetura de Modelo de Linguagem Grande Multimodal (MLLM), projetada para alinhar estruturalmente embeddings visuais e textuais.

    1.514+2Variação de estrelas nos últimos 7 dias
  • ha-llmvision@valentinfrlch

    Inteligência visual para sua casa.

    1.454+10Variação de estrelas nos últimos 7 dias
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1.432+521Variação de estrelas nos últimos 7 dias
  • awesome-japanese-llm@llm-jp

    Resumo de LLMs em japonês - Visão geral de LLMs japoneses

    1.428+1Variação de estrelas nos últimos 7 dias
  • SDT@dailenson

    Este repositório é a implementação oficial de Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023)

    1.406-1Variação de estrelas nos últimos 7 dias
  • airunner@Capsize-Games

    Motor de inferência offline para arte, conversas de voz em tempo real, chatbots baseados em LLM e fluxos de trabalho automatizados

    1.314+0Variação de estrelas nos últimos 7 dias
  • Catálogo visual com curadoria de mais de 155 arquiteturas de modelos de linguagem visual (VLM/MLLM): artigos, diagramas, receitas de treinamento, conjuntos de dados e uma linha do tempo de lançamentos para agentes de IA multimodal.

    1.310+2Variação de estrelas nos últimos 7 dias
  • claude-video-vision@jordanrendric

    Dê ao Claude a capacidade de assistir e entender vídeos — plugin para Claude Code com extração de quadros e análise de áudio multimodal

    1.281+6Variação de estrelas nos últimos 7 dias
  • UForm@unum-cloud

    IA multimodal de bolso para compreensão e geração de conteúdo em textos multilíngues, imagens e 🔜 vídeo, até 5x mais rápida que o OpenAI CLIP e LLaVA 🖼️ & 🖋️

    1.247+1Variação de estrelas nos últimos 7 dias
  • xtreme1@xtreme1-io

    Xtreme1 é uma plataforma de rotulagem e anotação de dados tudo-em-um para treinamento de dados multimodais, com suporte para nuvens de pontos LiDAR 3D, imagens e LLMs.

    1.239+2Variação de estrelas nos últimos 7 dias
  • LLaMA-Mesh@nv-tlabs

    Unificando a geração de malhas 3D com modelos de linguagem

    1.167+0Variação de estrelas nos últimos 7 dias
  • doc7@magicrew

    Transforme documentos em Markdown pronto para IA com compreensão visual

    1.153-25Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos