multimodal
Repositórios de código aberto acompanhados marcados com multimodal, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de multimodal no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com multimodal.
- #1
Permita que o Claude (ou qualquer LLM) assista a um vídeo — com reconhecimento de cena, quadros deduplicados e transcrição, a partir de uma URL ou arquivo local. Executado localmente, sob licença MIT.
★ 2.092 - #2★ 1.180
- #3
Toolkit visual e conjunto de habilidades projetado para modelos de texto puro "verem" imagens. Suporta compreensão de múltiplas imagens, perguntas e respostas, restauração de UI front-end, automação de GUI, com integração opcional a múltiplos agentes principais e reconhecimento direto de imagens coladas.
★ 1.128 - #4
Olhos para agentes do DeepSeek Harness baseados apenas em texto: cadeia de visão gratuita integrada (sem chave) + ferramentas de visão em nível de pixel (P&D, grounding, recorte, diferença de pixels, cores, OCR, rastreamento SVG, recorte, capturas de tela). Instalação com um único comando, sem Python, os turnos de imagem funcionam como turnos normais de chamada de ferramentas.
★ 1.034 - #5
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 954
- #1
Pare de alugar sua inteligência. Seja dono dela com o AnythingLLM. Tudo o que você precisa para uma poderosa experiência de agente local-first
★ 65.371+339Variação de estrelas nos últimos 7 dias - #2
Repositório oficial do livro "Deep Dive into AI Agents: Design Principles and Engineering Practices" (por Bojie Li): texto completo do livro, PDF compilado e código complementar por capítulo
★ 43.359+2.617Variação de estrelas nos últimos 7 dias - #3
A pilha de agentes de IA multimodal de código aberto: Conectando modelos de IA de ponta e infraestrutura de agentes
★ 38.742+62Variação de estrelas nos últimos 7 dias - #4
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) desenvolvido para alcançar recursos do nível do GPT-4V e além.
★ 25.005+9Variação de estrelas nos últimos 7 dias - #5
Pré-treinamento autossupervisionado em larga escala entre tarefas, idiomas e modalidades
★ 22.196+3Variação de estrelas nos últimos 7 dias - #6★ 21.861+1Variação de estrelas nos últimos 7 dias
- #7
YC (S26) | Open Computer History | Grave sua tela continuamente de forma local e forneça contexto aos seus agentes (Claude, Codex, Openclaw, Hermes, Runner...)
★ 21.296+133Variação de estrelas nos últimos 7 dias - #8★ 17.762+13Variação de estrelas nos últimos 7 dias
- #9
Use PEFT ou Full-parameter para CPT/SFT/DPO/GRPO em mais de 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) e mais de 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).
★ 15.400+76Variação de estrelas nos últimos 7 dias - #10★ 11.372+36Variação de estrelas nos últimos 7 dias
- #11
Prática de desenvolvimento de aplicações com LLMs: Guia completo de tecnologia RAG, leitura online: https://datawhalechina.github.io/all-in-rag/
★ 10.676+163Variação de estrelas nos últimos 7 dias - #12
Kit de ferramentas pronto para produção para executar IA localmente.
★ 10.280-12Variação de estrelas nos últimos 7 dias - #13
Uma biblioteca Python para detecção de anomalias em dados tabulares, séries temporais, grafos, texto, imagem e áudio. Mais de 60 detectores, orquestração ADEngine baseada em benchmarks e um fluxo de trabalho agente para agentes de IA.
★ 9.977+5Variação de estrelas nos últimos 7 dias - #14
O fim do parsing web. O início da busca nativa de pixels escalável. link: https://pixelrag.ai/
★ 9.788+134Variação de estrelas nos últimos 7 dias - #15
SeaTunnel é uma ferramenta de integração de dados massivos, distribuída, de alto desempenho e multimodal.
★ 9.600+30Variação de estrelas nos últimos 7 dias - #16
Deeplake é um runtime de dados de IA para agentes. Oferece postgres serverless com um datalake multimodal, permitindo recuperação e treinamento escaláveis
★ 9.230+3Variação de estrelas nos últimos 7 dias - #17
Mobile-Agent: A poderosa família de agentes de GUI
★ 9.148+32Variação de estrelas nos últimos 7 dias - #18
A maneira mais fácil de servir aplicativos e modelos de IA - Crie APIs de inferência de modelos, filas de tarefas, aplicativos de LLM, pipelines multimodelo e muito mais!
★ 8.813+18Variação de estrelas nos últimos 7 dias - #19
Uma biblioteca de text-to-speech (TTS), speech-to-text (STT) e speech-to-speech (STS) construída sobre o framework MLX da Apple, oferecendo análise de fala eficiente em Apple Silicon.
★ 7.803+31Variação de estrelas nos últimos 7 dias - #20
Este repositório é uma coleção curada de links para vários cursos e recursos sobre Inteligência Artificial (IA).
★ 6.479-1Variação de estrelas nos últimos 7 dias - #21
Um framework para inferência eficiente de modelos com modelos de omnimodalidade
★ 6.457+229Variação de estrelas nos últimos 7 dias - #22
Framework de código aberto para criar aplicativos baseados em agentes em JavaScript, Go, Dart e Python, construído e utilizado em produção pelo Google
★ 6.384+34Variação de estrelas nos últimos 7 dias - #23
Notas para engenheiros de software se atualizarem sobre novos desenvolvimentos em IA. Serve como armazenamento de dados para os textos de https://latent.space e brainstorming de produtos, com referências canônicas organizadas na pasta /Resources.
★ 6.247+1Variação de estrelas nos últimos 7 dias - #24★ 6.014+0Variação de estrelas nos últimos 7 dias
- #25
Um ambiente visual para fluxos de trabalho baseados em agentes: Itere sobre seus agentes 10x mais rápido
★ 5.780+5Variação de estrelas nos últimos 7 dias - #26
Motor de dados de alto desempenho para IA e cargas de trabalho multimodais. Processe imagens, áudio, vídeo e dados estruturados em qualquer escala.
★ 5.732+7Variação de estrelas nos últimos 7 dias - #27★ 5.674+6Variação de estrelas nos últimos 7 dias
- #28
Um framework modular para pesquisa multimodal de visão e linguagem do Facebook AI Research (FAIR)
★ 5.634+1Variação de estrelas nos últimos 7 dias - #29
Um motor de treinamento de próxima geração construído para modelos MoE ultra-grandes
★ 5.185+5Variação de estrelas nos últimos 7 dias - #30
Align Anything: Treinamento de modelos multimodais com feedback
★ 4.668+0Variação de estrelas nos últimos 7 dias