メインコンテンツへスキップ
buildradar
Sign in
トピック · multimodal

multimodal

multimodal がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

147 件のリポジトリ
  • tree-of-thoughts@kyegomez

    Tree of Thoughtsのプラグアンドプレイ実装:大規模言語モデルによる熟考的な問題解決でモデルの推論能力を少なくとも70%向上

    4,592+0直近 7 日のスター増減
  • 大規模言語モデル (Large Language Models)、AIペインティングなどの厳選されたチュートリアルとリソース。

    4,537+2直近 7 日のスター増減
  • img2dataset@rom1504

    大量の画像URLを簡単に画像データセットに変換可能。1台のマシンで1億件のURLを20時間でダウンロード、リサイズ、パッケージ化できる。

    4,445+2直近 7 日のスター増減
  • lmms-eval@EvolvingLMMs-Lab

    テキスト、画像、ビデオ、オーディオタスクを網羅するオールインワンのマルチモーダル評価ツールキット

    4,390+7直近 7 日のスター増減
  • Fengshenbang-LM@IDEA-CCNL

    Fengshenbang-LM(封神榜大模型)は、IDEA研究院の認知計算と自然言語研究センターが主導する大規模モデルのオープンソースシステムであり、中国語のAIGCおよび認知インテリジェンスの基盤インフラとなっています。

    4,122-1直近 7 日のスター増減
  • MOSS-TTS@OpenMOSS

    MOSS‑TTSファミリーは、MOSI.AIとOpenMOSSチームによるオープンソースの音声・音響生成モデルファミリーです。高忠実度、高表現力、複雑な実世界シナリオ向けに設計されており、安定した長尺音声、マルチスピーカー対話、ボイス/キャラクターデザイン、環境音エフェクト、リアルタイムストリーミングTTSを網羅しています。

    4,058+18直近 7 日のスター増減
  • mmpretrain@open-mmlab

    OpenMMLabの事前学習用ツールボックスおよびベンチマーク

    3,850-1直近 7 日のスター増減
  • modlens@liustack

    DeepSeek Harness 向けの最初のビジョンプラグインであり、すべてのテキスト専用コーディングエージェントのためのビジョンブリッジ。画像を貼り付けるだけで、構造化された JSON のエビデンス(OCR、レイアウト、セマンティクス)を取得できます。

    3,839+83直近 7 日のスター増減
  • SimpleMem@aiming-lab

    SimpleMem: LLMエージェントのための効率的な生涯記憶 — テキスト&マルチモーダル

    3,735+9直近 7 日のスター増減
  • morphik-core@morphik-org

    オープンソースのマルチモーダル検索エンジン (Morphik Core)。Morphikによる提供 — 熟練看護・高齢者生活のためのAIバックオフィス (morphik.ai)。

    3,710-1直近 7 日のスター増減
  • Chain-of-ThoughtプロンプティングからOpenAI o1、DeepSeek-R1まで 🍓

    3,681+3直近 7 日のスター増減
  • NExT-GPT@NExT-GPT

    ICML 2024論文「NExT-GPT: Any-to-Any Multimodal Large Language Model」のコードとモデル。

    3,634-2直近 7 日のスター増減
  • mteb@embeddings-benchmark

    MTEB:言語およびモダリティを横断した埋め込みの最先端評価

    3,414+5直近 7 日のスター増減
  • InternGPT@OpenGVLab

    InternGPT (iGPT) は、AI モデルを簡単に公開できるオープンソースのデモプラットフォームです。DragGAN、ChatGPT、ImageBind、GPT-4 のようなマルチモーダルチャット、SAM、インタラクティブな画像編集などをサポートしています。igpt.opengvlab.com でお試しください。

    3,205+0直近 7 日のスター増減
  • vortex@vortex-data

    列指向圧縮のための拡張可能で最先端なフレームワークであり、最速のFOSS列指向ファイル形式。元々は@spiraldbに属し、現在はLinux Foundation傘下のLFAI&Dataのインキュベーションステージプロジェクトです。

    3,171+8直近 7 日のスター増減
  • torchscale@microsoft

    (M)LLM向けの基礎アーキテクチャ

    3,139+1直近 7 日のスター増減
  • docarray@docarray

    マルチモーダルデータの表現、送信、保存、検索

    3,123-1直近 7 日のスター増減
  • OSWorld@xlang-ai

    [NeurIPS 2024] OSWorld: 実コンピュータ環境におけるオープンエンドなタスクのためのマルチモーダルエージェントのベンチマーク

    3,118+6直近 7 日のスター増減
  • ai@TanStack

    🤖 OpenAI、Anthropic、Gemini、React、Vue、Svelte、Solidに対応し、ストリーミングチャット、ツール呼び出し、エージェント、マルチモーダルアプリを構築するための、型安全でプロバイダー非依存なTypeScript AI SDK

    3,057+15直近 7 日のスター増減
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive:長期的なストリーミング映像と音声のインタラクションを実現する包括的なマルチモーダルシステム。

    2,925-1直近 7 日のスター増減
  • datachain@datachain-ai

    非構造化データのためのコンテキストレイヤー:S3、GCS、Azure 上の型付き、バージョン管理されたデータセット

    2,816+5直近 7 日のスター増減
  • clip-retrieval@rom1504

    クリップ埋め込みの容易な計算と、それを用いたクリップ検索システムの構築

    2,796+1直近 7 日のスター増減
  • autodistill@autodistill

    ラベル付けなしで推論を行うための画像(基盤モデルを使用して教師ありモデルを訓練します)。

    2,770+3直近 7 日のスター増減
  • maestro@roboflow

    マルチモーダルモデル(PaliGemma 2、Florence-2、Qwen2.5-VL)のファインチューニングプロセスを効率化する

    2,695+1直近 7 日のスター増減
  • OmAgent@om-ai-lab

    [EMNLP-2024] 高速なプロトタイプ作成と本番環境向けマルチモーダル言語エージェントの構築。

    2,666+1直近 7 日のスター増減
  • generative-ai@genieincodebottle

    詳細なロードマップ、プロジェクト、ユースケース、面接対策、コーディング対策を含む、Generative AI に関する包括的なリソース

    2,610+1直近 7 日のスター増減
  • OFA@OFA-Sys

    OFA (ICML 2022) の公式リポジトリ。論文: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2,557+0直近 7 日のスター増減
  • mPLUG-Owl@X-PLUG

    mPLUG-Owl:強力なマルチモーダル大規模言語モデルファミリ

    2,539+0直近 7 日のスター増減
  • HuixiangDou@InternLM

    HuixiangDou: LLM ベースの技術支援によるグループチャットシナリオの克服

    2,502+2直近 7 日のスター増減
  • (ෆ`꒳´ෆ) Text-to-Image 生成/合成に関するサーベイ。

    2,444+0直近 7 日のスター増減
← トピック一覧に戻る