Pular para o conteúdo principal
buildradar
Sign in
Tópico · multimodal

multimodal

Repositórios de código aberto acompanhados marcados com multimodal, ordenados por estrelas.

Repositórios
145
Total de estrelas
624.577
Média de estrelas
4.307
Participação
0,03%

Tópicos que aparecem com frequência ao lado de multimodal no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com multimodal.

  • claude-real-video@HUANGCHIHHUNGLeo

    Permita que o Claude (ou qualquer LLM) assista a um vídeo — com reconhecimento de cena, quadros deduplicados e transcrição, a partir de uma URL ou arquivo local. Executado localmente, sob licença MIT.

    2.092
  • doc7@magicrew

    Transforme documentos em Markdown pronto para IA com compreensão visual

    1.180
  • Toolkit visual e conjunto de habilidades projetado para modelos de texto puro "verem" imagens. Suporta compreensão de múltiplas imagens, perguntas e respostas, restauração de UI front-end, automação de GUI, com integração opcional a múltiplos agentes principais e reconhecimento direto de imagens coladas.

    1.128
  • dsh-vision-router@ysr666

    Olhos para agentes do DeepSeek Harness baseados apenas em texto: cadeia de visão gratuita integrada (sem chave) + ferramentas de visão em nível de pixel (P&D, grounding, recorte, diferença de pixels, cores, OCR, rastreamento SVG, recorte, capturas de tela). Instalação com um único comando, sem Python, os turnos de imagem funcionam como turnos normais de chamada de ferramentas.

    1.034
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    954
  • anything-llm@Mintplex-Labs

    Pare de alugar sua inteligência. Seja dono dela com o AnythingLLM. Tudo o que você precisa para uma poderosa experiência de agente local-first

    65.371+339Variação de estrelas nos últimos 7 dias
  • ai-agent-book@bojieli

    Repositório oficial do livro "Deep Dive into AI Agents: Design Principles and Engineering Practices" (por Bojie Li): texto completo do livro, PDF compilado e código complementar por capítulo

    43.359+2.617Variação de estrelas nos últimos 7 dias
  • UI-TARS-desktop@bytedance

    A pilha de agentes de IA multimodal de código aberto: Conectando modelos de IA de ponta e infraestrutura de agentes

    38.742+62Variação de estrelas nos últimos 7 dias
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) desenvolvido para alcançar recursos do nível do GPT-4V e além.

    25.005+9Variação de estrelas nos últimos 7 dias
  • unilm@microsoft

    Pré-treinamento autossupervisionado em larga escala entre tarefas, idiomas e modalidades

    22.196+3Variação de estrelas nos últimos 7 dias
  • serve@jina-ai

    ☁️ Construa aplicações de IA multimodal com uma pilha nativa da nuvem

    21.861+1Variação de estrelas nos últimos 7 dias
  • screenpipe@screenpipe

    YC (S26) | Open Computer History | Grave sua tela continuamente de forma local e forneça contexto aos seus agentes (Claude, Codex, Openclaw, Hermes, Runner...)

    21.296+133Variação de estrelas nos últimos 7 dias
  • Janus@deepseek-ai

    Série Janus: Modelos unificados de compreensão e geração multimodal.

    17.762+13Variação de estrelas nos últimos 7 dias
  • ms-swift@modelscope

    Use PEFT ou Full-parameter para CPT/SFT/DPO/GRPO em mais de 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) e mais de 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).

    15.400+76Variação de estrelas nos últimos 7 dias
  • rerun@rerun-io

    Visualize, consulte e transmita dados para treinar robótica multimodal.

    11.372+36Variação de estrelas nos últimos 7 dias
  • all-in-rag@datawhalechina

    Prática de desenvolvimento de aplicações com LLMs: Guia completo de tecnologia RAG, leitura online: https://datawhalechina.github.io/all-in-rag/

    10.676+163Variação de estrelas nos últimos 7 dias
  • runanywhere-sdks@RunanywhereAI

    Kit de ferramentas pronto para produção para executar IA localmente.

    10.280-12Variação de estrelas nos últimos 7 dias
  • pyod@yzhao062

    Uma biblioteca Python para detecção de anomalias em dados tabulares, séries temporais, grafos, texto, imagem e áudio. Mais de 60 detectores, orquestração ADEngine baseada em benchmarks e um fluxo de trabalho agente para agentes de IA.

    9.977+5Variação de estrelas nos últimos 7 dias
  • PixelRAG@StarTrail-org

    O fim do parsing web. O início da busca nativa de pixels escalável. link: https://pixelrag.ai/

    9.788+134Variação de estrelas nos últimos 7 dias
  • seatunnel@apache

    SeaTunnel é uma ferramenta de integração de dados massivos, distribuída, de alto desempenho e multimodal.

    9.600+30Variação de estrelas nos últimos 7 dias
  • deeplake@activeloopai

    Deeplake é um runtime de dados de IA para agentes. Oferece postgres serverless com um datalake multimodal, permitindo recuperação e treinamento escaláveis

    9.230+3Variação de estrelas nos últimos 7 dias
  • MobileAgent@X-PLUG

    Mobile-Agent: A poderosa família de agentes de GUI

    9.148+32Variação de estrelas nos últimos 7 dias
  • BentoML@bentoml

    A maneira mais fácil de servir aplicativos e modelos de IA - Crie APIs de inferência de modelos, filas de tarefas, aplicativos de LLM, pipelines multimodelo e muito mais!

    8.813+18Variação de estrelas nos últimos 7 dias
  • mlx-audio@Blaizzy

    Uma biblioteca de text-to-speech (TTS), speech-to-text (STT) e speech-to-speech (STS) construída sobre o framework MLX da Apple, oferecendo análise de fala eficiente em Apple Silicon.

    7.803+31Variação de estrelas nos últimos 7 dias
  • courses@SkalskiP

    Este repositório é uma coleção curada de links para vários cursos e recursos sobre Inteligência Artificial (IA).

    6.479-1Variação de estrelas nos últimos 7 dias
  • vllm-omni@vllm-project

    Um framework para inferência eficiente de modelos com modelos de omnimodalidade

    6.457+229Variação de estrelas nos últimos 7 dias
  • genkit@genkit-ai

    Framework de código aberto para criar aplicativos baseados em agentes em JavaScript, Go, Dart e Python, construído e utilizado em produção pelo Google

    6.384+34Variação de estrelas nos últimos 7 dias
  • ai-notes@swyxio

    Notas para engenheiros de software se atualizarem sobre novos desenvolvimentos em IA. Serve como armazenamento de dados para os textos de https://latent.space e brainstorming de produtos, com referências canônicas organizadas na pasta /Resources.

    6.247+1Variação de estrelas nos últimos 7 dias
  • VLM-R1@om-ai-lab

    Resolver compreensão visual com VLMs reforçados.

    6.014+0Variação de estrelas nos últimos 7 dias
  • pyspur@PySpur-Dev

    Um ambiente visual para fluxos de trabalho baseados em agentes: Itere sobre seus agentes 10x mais rápido

    5.780+5Variação de estrelas nos últimos 7 dias
  • Daft@Eventual-Inc

    Motor de dados de alto desempenho para IA e cargas de trabalho multimodais. Processe imagens, áudio, vídeo e dados estruturados em qualquer escala.

    5.732+7Variação de estrelas nos últimos 7 dias
  • UltraRAG@OpenBMB

    Um framework MCP low-code para construir pipelines de RAG complexos e inovadores.

    5.674+6Variação de estrelas nos últimos 7 dias
  • mmf@facebookresearch

    Um framework modular para pesquisa multimodal de visão e linguagem do Facebook AI Research (FAIR)

    5.634+1Variação de estrelas nos últimos 7 dias
  • xtuner@InternLM

    Um motor de treinamento de próxima geração construído para modelos MoE ultra-grandes

    5.185+5Variação de estrelas nos últimos 7 dias
  • align-anything@PKU-Alignment

    Align Anything: Treinamento de modelos multimodais com feedback

    4.668+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos