Pular para o conteúdo principal
buildradar
Sign in
Tópico · multimodal

multimodal

Repositórios de código aberto acompanhados marcados com multimodal, ordenados por estrelas.

147 repositórios
  • tree-of-thoughts@kyegomez

    Implementação plug-and-play de Tree of Thoughts: Resolução deliberada de problemas com Large Language Models que eleva o raciocínio do modelo em pelo menos 70%

    4.592+1Variação de estrelas nos últimos 7 dias
  • Tutoriais e recursos selecionados para Large Language Models, pintura por IA e mais.

    4.537+2Variação de estrelas nos últimos 7 dias
  • img2dataset@rom1504

    Converta facilmente grandes conjuntos de URLs de imagens em um dataset de imagens. Pode baixar, redimensionar e empacotar 100 milhões de URLs em 20 horas em uma única máquina.

    4.445+2Variação de estrelas nos últimos 7 dias
  • lmms-eval@EvolvingLMMs-Lab

    Toolkit de avaliação multimodal tudo-em-um para tarefas de texto, imagem, vídeo e áudio.

    4.390+12Variação de estrelas nos últimos 7 dias
  • Fengshenbang-LM@IDEA-CCNL

    Fengshenbang-LM é um sistema de modelos de linguagem de grande escala de código aberto liderado pelo Centro de Pesquisa em Computação Cognitiva e Processamento de Linguagem Natural do IDEA, servindo como infraestrutura para AIGC e inteligência cognitiva em chinês.

    4.122-1Variação de estrelas nos últimos 7 dias
  • MOSS-TTS@OpenMOSS

    A família MOSS‑TTS é uma família de modelos de geração de fala e som open source da MOSI.AI e da equipe OpenMOSS. Projetada para alta fidelidade, alta expressividade e cenários complexos do mundo real, cobrindo fala longa estável, diálogo multi-falante, design de voz/personagem, efeitos sonoros ambientais e TTS de streaming em tempo real.

    4.058+26Variação de estrelas nos últimos 7 dias
  • mmpretrain@open-mmlab

    Caixa de ferramentas e benchmark de pré-treinamento da OpenMMLab

    3.850+0Variação de estrelas nos últimos 7 dias
  • modlens@liustack

    O primeiro plugin de visão para o DeepSeek Harness e a ponte visual para qualquer agente de codificação baseado em texto. Cole uma imagem e obtenha evidências JSON estruturadas (OCR, layout, semântica).

    3.839+134Variação de estrelas nos últimos 7 dias
  • SimpleMem@aiming-lab

    SimpleMem: Memória vitalícia eficiente para agentes LLM — Texto e Multimodal.

    3.735+15Variação de estrelas nos últimos 7 dias
  • morphik-core@morphik-org

    Mecanismo de recuperação multimodal de código aberto (Morphik Core). Por Morphik — back office de IA para enfermagem especializada e residências para idosos (morphik.ai).

    3.710+2Variação de estrelas nos últimos 7 dias
  • De Chain-of-Thought prompting para OpenAI o1 e DeepSeek-R1 🍓

    3.681+6Variação de estrelas nos últimos 7 dias
  • NExT-GPT@NExT-GPT

    Código e modelos para o artigo do ICML 2024, NExT-GPT: Any-to-Any Multimodal Large Language Model

    3.634-3Variação de estrelas nos últimos 7 dias
  • mteb@embeddings-benchmark

    MTEB: Avaliação de ponta para embeddings em diversos idiomas e modalidades.

    3.414+8Variação de estrelas nos últimos 7 dias
  • InternGPT@OpenGVLab

    InternGPT (iGPT) é uma plataforma de demonstração de código aberto onde você pode exibir facilmente seus modelos de IA. Agora suporta DragGAN, ChatGPT, ImageBind, chat multimodal como GPT-4, SAM, edição interativa de imagens, etc. Experimente em igpt.opengvlab.com.

    3.205+0Variação de estrelas nos últimos 7 dias
  • vortex@vortex-data

    Uma estrutura extensível e de última geração para compressão colunar, e o formato de arquivo colunar FOSS mais rápido. Anteriormente na @spiraldb, agora um projeto em estágio de incubação na LFAI&Data, parte da Linux Foundation.

    3.171+13Variação de estrelas nos últimos 7 dias
  • torchscale@microsoft

    Arquitetura de base para (M)LLMs

    3.139+1Variação de estrelas nos últimos 7 dias
  • docarray@docarray

    Representar, enviar, armazenar e pesquisar dados multimodais.

    3.123-1Variação de estrelas nos últimos 7 dias
  • OSWorld@xlang-ai

    [NeurIPS 2024] OSWorld: Benchmarking de agentes multimodais para tarefas abertas em ambientes computacionais reais.

    3.118+11Variação de estrelas nos últimos 7 dias
  • ai@TanStack

    🤖 SDK de IA TypeScript com segurança de tipos e agnóstico de provedor para chat em streaming, chamadas de ferramentas, agentes e aplicativos multimodais em OpenAI, Anthropic, Gemini, React, Vue, Svelte e Solid.

    3.057+29Variação de estrelas nos últimos 7 dias
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Um sistema multimodal abrangente para interações de vídeo e áudio em streaming de longa duração

    2.925+0Variação de estrelas nos últimos 7 dias
  • datachain@datachain-ai

    A Camada de Contexto para dados não estruturados: datasets tipados e versionados sobre S3, GCS, Azure

    2.816+4Variação de estrelas nos últimos 7 dias
  • clip-retrieval@rom1504

    Calcule facilmente embeddings CLIP e construa um sistema de recuperação CLIP com eles

    2.796+1Variação de estrelas nos últimos 7 dias
  • autodistill@autodistill

    Imagens para inferência sem rotulagem (use modelos de fundação para treinar modelos supervisionados).

    2.770+6Variação de estrelas nos últimos 7 dias
  • maestro@roboflow

    Simplifique o processo de fine-tuning para modelos multimodais: PaliGemma 2, Florence-2 e Qwen2.5-VL.

    2.695+1Variação de estrelas nos últimos 7 dias
  • OmAgent@om-ai-lab

    [EMNLP-2024] Crie agentes de linguagem multimodal para prototipagem rápida e produção

    2.666+1Variação de estrelas nos últimos 7 dias
  • generative-ai@genieincodebottle

    Recursos abrangentes sobre IA Generativa, incluindo um roteiro detalhado, projetos, casos de uso, preparação para entrevistas e preparação para codificação.

    2.610+2Variação de estrelas nos últimos 7 dias
  • OFA@OFA-Sys

    Repositório oficial do OFA (ICML 2022). Artigo: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2.557+0Variação de estrelas nos últimos 7 dias
  • mPLUG-Owl@X-PLUG

    mPLUG-Owl: A poderosa família de modelos de linguagem multimodal de grande escala.

    2.539+0Variação de estrelas nos últimos 7 dias
  • HuixiangDou@InternLM

    HuixiangDou: Superando cenários de chat em grupo com assistência técnica baseada em LLM

    2.502+2Variação de estrelas nos últimos 7 dias
  • (ෆ`꒳´ෆ) Um levantamento sobre geração/síntese de texto para imagem.

    2.444+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos