Pular para o conteúdo principal
buildradar
Sign in
Tópico · multimodal-llm

multimodal-llm

Repositórios de código aberto acompanhados marcados com multimodal-llm, ordenados por estrelas.

Repositórios
5
Total de estrelas
5.901
Média de estrelas
1.180
Participação
0,00%

Tópicos que aparecem com frequência ao lado de multimodal-llm no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com multimodal-llm.

  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1.350
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • FireRedASR@FireRedTeam

    Modelos ASR de nível industrial de código aberto que suportam mandarim, dialetos chineses e inglês, alcançando um novo SOTA em benchmarks públicos de ASR em mandarim, oferecendo também excelente capacidade de reconhecimento de letras de músicas.

    1.975+2Variação de estrelas nos últimos 7 dias
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1.350+426Variação de estrelas nos últimos 7 dias
  • Catálogo visual com curadoria de mais de 155 arquiteturas de modelos de linguagem visual (VLM/MLLM): artigos, diagramas, receitas de treinamento, conjuntos de dados e uma linha do tempo de lançamentos para agentes de IA multimodal.

    1.310+2Variação de estrelas nos últimos 7 dias
  • MiniGPT-5@UCSB-AI

    Implementação oficial do artigo "MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens"

    869+0Variação de estrelas nos últimos 7 dias
  • FireRedASR2S@FireRedTeam

    Um sistema ASR All-in-One de nível industrial SOTA com módulos ASR, VAD, LID e Punc. O FireRedASR2 suporta chinês (mandarim, mais de 20 dialetos/sotaques), inglês, alternância de código, e ASR de fala e canto. O FireRedVAD suporta fala/canto/música em mais de 100 idiomas. O FireRedLID suporta mais de 100 idiomas e mais de 20 dialetos chineses. O FireRedPunc suporta chinês e inglês.

    670+12Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos