メインコンテンツへスキップ
buildradar
Sign in
トピック · multimodal

multimodal

multimodal がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

147 件のリポジトリ
  • ✨✨基盤モデルの推論に関する最新の論文とベンチマーク

    656+1直近 7 日のスター増減
  • MOSS-Audio@OpenMOSS

    MOSS-Audio は、統合された音声理解のためのオープンソース基盤モデルであり、現実世界のシナリオにおける音声、サウンド、音楽、キャプション生成、QA、推論を可能にします。

    655+5直近 7 日のスター増減
  • SEED@AILab-CVC

    SEED-LLaMAの公式実装(ICLR 2024)。

    641+0直近 7 日のスター増減
  • Seg-Zero@JIA-Lab-research

    「Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement」のプロジェクトページ

    639+1直近 7 日のスター増減
  • 👁️ + 💬 + 🎧 = 🤖 厳選された主要な基盤モデルおよびマルチモーダルモデルのリスト![論文 + コード + サンプル + チュートリアル]

    637+0直近 7 日のスター増減
  • blended-latent-diffusion@omriav

    「Blended Latent Diffusion」の公式実装 [SIGGRAPH 2023]

    632+0直近 7 日のスター増減
  • second-brain@henrydaum

    Second Brain は、ローカルファイルのインテリジェンス、ワークフローの自動化、LLMを使用してタスクを完了し、複数のモダリティやメッセージングプラットフォームを介して通信を行う、オペレーティングシステムとして機能するエージェントフレームワークです。

    629+3直近 7 日のスター増減
  • VisualThinker-R1-Zero@turningpoint-ai

    2B Modelにおけるマルチモーダルな「アハ体験」を探求

    623+0直近 7 日のスター増減
  • RAG-Driven-Generative-AI@Denis2054

    このリポジトリは、OpenAI および Hugging Face のモデルの生成・評価能力を活用し、LlamaIndex、Deep Lake、Pinecone を使用して生成 AI 向けの検索拡張生成(RAG)コードを構築するプログラムを提供します。

    623+1直近 7 日のスター増減
  • Hunyuan3D-Omni@Tencent-Hunyuan

    Hunyuan3D-Omni: 3D アセットの制御可能な生成のための統合フレームワーク。

    615+2直近 7 日のスター増減
  • tokenize-anything@baaivision

    [ECCV 2024] プロンプトによるあらゆるもののトークン化

    600+0直近 7 日のスター増減
  • MMMU@MMMU-Benchmark

    論文「MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI」の評価コードを含むリポジトリ

    593+1直近 7 日のスター増減
  • Relax@redai-studio

    大規模オムニモーダル事後学習のための非同期強化学習エンジン

    590+7直近 7 日のスター増減
  • blended-diffusion@omriav

    「Blended Diffusion for Text-driven Editing of Natural Images」の公式実装 [CVPR 2022]

    589+0直近 7 日のスター増減
  • Groma@FoundationVision

    [ECCV2024] 局所化されたビジュアルトークン化を備えたグラウンデッドマルチモーダル大規模言語モデル

    586+0直近 7 日のスター増減
  • AI-Employe@vignshwarar

    GPT-4 Visionを使用して、人間に教えるかのようにブラウザ自動化を作成する

    585+0直近 7 日のスター増減
  • rai@RobotecAI

    RAI は、物理 AI ロボット向けのベンダー非依存なエージェントフレームワークであり、ROS 2 ツールを活用して、複雑なアクション、定義されたシナリオ、自由なインターフェース実行、ログ要約、音声対話などを実行します。

    581+1直近 7 日のスター増減
  • motis@motis-project

    マルチモーダルルーティング、ジオコーディング、およびマップタイル

    579+12直近 7 日のスター増減
  • LLaVA-Mini@ictnlp

    LLaVA-Miniは、画像、高解像度画像、動画の理解を効率的にサポートする統合型の大規模マルチモーダルモデル(LMM)です。

    577+0直近 7 日のスター増減
  • アプリのためのセルフコーディングシステム — React Native 向け Alan AI SDK

    575+0直近 7 日のスター増減
  • multimodal-agents-course@the-ai-merge

    目と耳を持つ MCP マルチモーダル AI エージェント

    575+0直近 7 日のスター増減
  • psi@microsoft

    状況認識インテリジェンスのためのプラットフォーム

    572+1直近 7 日のスター増減
  • clip.cpp@monatis

    追加の依存関係なしで、プレーンな C/C++ で実装された CLIP 推論

    568+0直近 7 日のスター増減
  • Flame-Code-VLM@Flame-Code-VLM

    Flameは、UIデザインのモックアップを高品質なReactコードに変換するために設計されたオープンソースのマルチモーダルAIシステムです。ビジョン言語モデリング、自動データ合成、構造化されたトレーニングワークフローを活用して、デザインとフロントエンド開発のギャップを埋めます。

    562+1直近 7 日のスター増減
  • vlmrun-hub@vlm-run

    VLMで使用する様々な業界特化型スキーマのハブ

    555+0直近 7 日のスター増減
  • 素晴らしい Multimodal Modeling(MLLM、UMM、NMMを網羅)

    543+3直近 7 日のスター増減
  • EVF-SAM@hustvl

    「EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model」の公式コード

    508+1直近 7 日のスター増減
← トピック一覧に戻る