multimodal
Repositórios de código aberto acompanhados marcados com multimodal, ordenados por estrelas.
- #31
Implementação plug-and-play de Tree of Thoughts: Resolução deliberada de problemas com Large Language Models que eleva o raciocínio do modelo em pelo menos 70%
★ 4.592+1Variação de estrelas nos últimos 7 dias - #32
Tutoriais e recursos selecionados para Large Language Models, pintura por IA e mais.
★ 4.537+2Variação de estrelas nos últimos 7 dias - #33
Converta facilmente grandes conjuntos de URLs de imagens em um dataset de imagens. Pode baixar, redimensionar e empacotar 100 milhões de URLs em 20 horas em uma única máquina.
★ 4.445+2Variação de estrelas nos últimos 7 dias - #34
Toolkit de avaliação multimodal tudo-em-um para tarefas de texto, imagem, vídeo e áudio.
★ 4.390+12Variação de estrelas nos últimos 7 dias - #35
Fengshenbang-LM é um sistema de modelos de linguagem de grande escala de código aberto liderado pelo Centro de Pesquisa em Computação Cognitiva e Processamento de Linguagem Natural do IDEA, servindo como infraestrutura para AIGC e inteligência cognitiva em chinês.
★ 4.122-1Variação de estrelas nos últimos 7 dias - #36
A família MOSS‑TTS é uma família de modelos de geração de fala e som open source da MOSI.AI e da equipe OpenMOSS. Projetada para alta fidelidade, alta expressividade e cenários complexos do mundo real, cobrindo fala longa estável, diálogo multi-falante, design de voz/personagem, efeitos sonoros ambientais e TTS de streaming em tempo real.
★ 4.058+26Variação de estrelas nos últimos 7 dias - #37
Caixa de ferramentas e benchmark de pré-treinamento da OpenMMLab
★ 3.850+0Variação de estrelas nos últimos 7 dias - #38
O primeiro plugin de visão para o DeepSeek Harness e a ponte visual para qualquer agente de codificação baseado em texto. Cole uma imagem e obtenha evidências JSON estruturadas (OCR, layout, semântica).
★ 3.839+134Variação de estrelas nos últimos 7 dias - #39★ 3.735+15Variação de estrelas nos últimos 7 dias
- #40
Mecanismo de recuperação multimodal de código aberto (Morphik Core). Por Morphik — back office de IA para enfermagem especializada e residências para idosos (morphik.ai).
★ 3.710+2Variação de estrelas nos últimos 7 dias - #41
De Chain-of-Thought prompting para OpenAI o1 e DeepSeek-R1 🍓
★ 3.681+6Variação de estrelas nos últimos 7 dias - #42
Código e modelos para o artigo do ICML 2024, NExT-GPT: Any-to-Any Multimodal Large Language Model
★ 3.634-3Variação de estrelas nos últimos 7 dias - #43
MTEB: Avaliação de ponta para embeddings em diversos idiomas e modalidades.
★ 3.414+8Variação de estrelas nos últimos 7 dias - #44
InternGPT (iGPT) é uma plataforma de demonstração de código aberto onde você pode exibir facilmente seus modelos de IA. Agora suporta DragGAN, ChatGPT, ImageBind, chat multimodal como GPT-4, SAM, edição interativa de imagens, etc. Experimente em igpt.opengvlab.com.
★ 3.205+0Variação de estrelas nos últimos 7 dias - #45
Uma estrutura extensível e de última geração para compressão colunar, e o formato de arquivo colunar FOSS mais rápido. Anteriormente na @spiraldb, agora um projeto em estágio de incubação na LFAI&Data, parte da Linux Foundation.
★ 3.171+13Variação de estrelas nos últimos 7 dias - #46
Arquitetura de base para (M)LLMs
★ 3.139+1Variação de estrelas nos últimos 7 dias - #47★ 3.123-1Variação de estrelas nos últimos 7 dias
- #48
[NeurIPS 2024] OSWorld: Benchmarking de agentes multimodais para tarefas abertas em ambientes computacionais reais.
★ 3.118+11Variação de estrelas nos últimos 7 dias - #49
🤖 SDK de IA TypeScript com segurança de tipos e agnóstico de provedor para chat em streaming, chamadas de ferramentas, agentes e aplicativos multimodais em OpenAI, Anthropic, Gemini, React, Vue, Svelte e Solid.
★ 3.057+29Variação de estrelas nos últimos 7 dias - #50
InternLM-XComposer2.5-OmniLive: Um sistema multimodal abrangente para interações de vídeo e áudio em streaming de longa duração
★ 2.925+0Variação de estrelas nos últimos 7 dias - #51
A Camada de Contexto para dados não estruturados: datasets tipados e versionados sobre S3, GCS, Azure
★ 2.816+4Variação de estrelas nos últimos 7 dias - #52
Calcule facilmente embeddings CLIP e construa um sistema de recuperação CLIP com eles
★ 2.796+1Variação de estrelas nos últimos 7 dias - #53
Imagens para inferência sem rotulagem (use modelos de fundação para treinar modelos supervisionados).
★ 2.770+6Variação de estrelas nos últimos 7 dias - #54
Simplifique o processo de fine-tuning para modelos multimodais: PaliGemma 2, Florence-2 e Qwen2.5-VL.
★ 2.695+1Variação de estrelas nos últimos 7 dias - #55
[EMNLP-2024] Crie agentes de linguagem multimodal para prototipagem rápida e produção
★ 2.666+1Variação de estrelas nos últimos 7 dias - #56
Recursos abrangentes sobre IA Generativa, incluindo um roteiro detalhado, projetos, casos de uso, preparação para entrevistas e preparação para codificação.
★ 2.610+2Variação de estrelas nos últimos 7 dias - #57
Repositório oficial do OFA (ICML 2022). Artigo: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2.557+0Variação de estrelas nos últimos 7 dias - #58★ 2.539+0Variação de estrelas nos últimos 7 dias
- #59
HuixiangDou: Superando cenários de chat em grupo com assistência técnica baseada em LLM
★ 2.502+2Variação de estrelas nos últimos 7 dias - #60
(ෆ`꒳´ෆ) Um levantamento sobre geração/síntese de texto para imagem.
★ 2.444+0Variação de estrelas nos últimos 7 dias