メインコンテンツへスキップ
buildradar
Sign in
トピック · multimodal-llm

multimodal-llm

multimodal-llm がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

リポジトリ
5
総スター数
5,901
平均スター数
1,180
シェア
0.00%

multimodal-llm と同じリポジトリに頻繁に登場するトピック。

最近の急上昇

直近 90 日以内に作成され、multimodal-llm がタグ付けされたリポジトリ。

  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1,330
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • FireRedASR@FireRedTeam

    中国語、方言、英語をサポートするオープンソースの産業グレード ASR モデル。パブリックな中国語 ASR ベンチマークで新たな SOTA を達成し、優れた歌声の歌詞認識能力も提供します。

    1,975+2直近 7 日のスター増減
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1,330+426直近 7 日のスター増減
  • 155種類以上のビジョン・言語モデル(VLM/MLLM)アーキテクチャのキュレーションされたビジュアルカタログ:論文、図解、学習レシピ、データセット、マルチモーダルAIエージェントのリリース年表。

    1,310+2直近 7 日のスター増減
  • MiniGPT-5@UCSB-AI

    論文「MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens」の公式実装。

    869+0直近 7 日のスター増減
  • FireRedASR2S@FireRedTeam

    ASR、VAD、LID、Punc モジュールを備えた SOTA の産業グレードオールインワン ASR システム。FireRedASR2 は中国語(標準語、20以上の方言/アクセント)、英語、コードスイッチング、音声および歌唱の ASR をサポートします。FireRedVAD は 100 以上の言語で音声/歌唱/音楽をサポートします。FireRedLID は 100 以上の言語と 20 以上の中国語方言をサポートします。FireRedPunc は中国語と英語をサポートします。

    670+12直近 7 日のスター増減
← トピック一覧に戻る