メインコンテンツへスキップ
buildradar
Sign in
トピック · multi-modal

multi-modal

multi-modal がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

42 件のリポジトリ
  • VisRAG@OpenBMB

    VLMによってサポートされる、パース処理不要のRAG

    979-1直近 7 日のスター増減
  • farmvibes-ai@microsoft

    FarmVibes.AI: 農業と持続可能性のためのマルチモーダル地理空間 ML モデル

    895+0直近 7 日のスター増減
  • LanguageBind@PKU-YuanGroup

    【ICLR 2024🔥】言語ベースのセマンティックアライメントによる、ビデオ言語事前学習のNモダリティへの拡張

    885+0直近 7 日のスター増減
  • byaldi@AnswerDotAI

    ColPali などの遅延インタラクション・マルチモーダルモデルをわずか数行のコードで使用できます。

    852+0直近 7 日のスター増減
  • OmniLottie@OpenVGLab

    [CVPR 2026🔥] 🧑‍🎨 OmniLottie は、Lottie JSON を生成する、オープンソースのマルチモーダル指示型ベクターアニメーション生成器です。

    774+3直近 7 日のスター増減
  • Versatile-OCR-Program@raphael-seo

    機械学習のトレーニングに最適化されたマルチモーダル OCR パイプライン(テキスト、図、数式、表、ダイアグラム)

    676+0直近 7 日のスター増減
  • UniControl@salesforce

    統合制御可能な視覚生成モデル

    662+0直近 7 日のスター増減
  • Aether@InternRobotics

    [ICCV 2025 & ICCV 2025 RIWM 優秀論文賞] Aether:幾何学を考慮した統合ワールドモデル

    609+0直近 7 日のスター増減
  • RT-2@kyegomez

    RT-2 の民主化:「RT-2: 視覚と言語をアクションに変換する新しいモデル」

    583-1直近 7 日のスター増減
  • fashion-clip@patrickjohncyh

    FashionCLIP は、ファッションドメイン向けに微調整された CLIP ライクなモデルです。

    537+3直近 7 日のスター増減
  • forge-film@F-R-L

    マルチモデル DAG 駆動型並列 AI 映像生成 — シーンの独立性に応じて並列高速化がスケールします。シーンを1つずつではなく同時に生成します。「把影视生成的执行图从拓扑序变成关键路径最优调度」;シーンの物語依存関係を DAG としてモデル化し、CPM アルゴリズムによって並列スケジュールを駆動する唯一の映像生成エンジン

    536+0直近 7 日のスター増減
  • Robust-R1@jqtangust

    [AAAI 2026 Oral] Robust-R1 の公式実装:ロバストな視覚理解のための劣化認識型推論

    511+0直近 7 日のスター増減
← トピック一覧に戻る