multimodal
multimodal がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #121
✨✨基盤モデルの推論に関する最新の論文とベンチマーク
★ 656+1直近 7 日のスター増減 - #122
MOSS-Audio は、統合された音声理解のためのオープンソース基盤モデルであり、現実世界のシナリオにおける音声、サウンド、音楽、キャプション生成、QA、推論を可能にします。
★ 655+5直近 7 日のスター増減 - #123★ 641+0直近 7 日のスター増減
- #124
「Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement」のプロジェクトページ
★ 639+1直近 7 日のスター増減 - #125
👁️ + 💬 + 🎧 = 🤖 厳選された主要な基盤モデルおよびマルチモーダルモデルのリスト![論文 + コード + サンプル + チュートリアル]
★ 637+0直近 7 日のスター増減 - #126
「Blended Latent Diffusion」の公式実装 [SIGGRAPH 2023]
★ 632+0直近 7 日のスター増減 - #127
Second Brain は、ローカルファイルのインテリジェンス、ワークフローの自動化、LLMを使用してタスクを完了し、複数のモダリティやメッセージングプラットフォームを介して通信を行う、オペレーティングシステムとして機能するエージェントフレームワークです。
★ 629+3直近 7 日のスター増減 - #128
2B Modelにおけるマルチモーダルな「アハ体験」を探求
★ 623+0直近 7 日のスター増減 - #129
このリポジトリは、OpenAI および Hugging Face のモデルの生成・評価能力を活用し、LlamaIndex、Deep Lake、Pinecone を使用して生成 AI 向けの検索拡張生成(RAG)コードを構築するプログラムを提供します。
★ 623+1直近 7 日のスター増減 - #130
Hunyuan3D-Omni: 3D アセットの制御可能な生成のための統合フレームワーク。
★ 615+2直近 7 日のスター増減 - #131
[ECCV 2024] プロンプトによるあらゆるもののトークン化
★ 600+0直近 7 日のスター増減 - #132
論文「MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI」の評価コードを含むリポジトリ
★ 593+1直近 7 日のスター増減 - #133★ 590+7直近 7 日のスター増減
- #134
「Blended Diffusion for Text-driven Editing of Natural Images」の公式実装 [CVPR 2022]
★ 589+0直近 7 日のスター増減 - #135★ 586+0直近 7 日のスター増減
- #136
GPT-4 Visionを使用して、人間に教えるかのようにブラウザ自動化を作成する
★ 585+0直近 7 日のスター増減 - #137
RAI は、物理 AI ロボット向けのベンダー非依存なエージェントフレームワークであり、ROS 2 ツールを活用して、複雑なアクション、定義されたシナリオ、自由なインターフェース実行、ログ要約、音声対話などを実行します。
★ 581+1直近 7 日のスター増減 - #138★ 579+12直近 7 日のスター増減
- #139
LLaVA-Miniは、画像、高解像度画像、動画の理解を効率的にサポートする統合型の大規模マルチモーダルモデル(LMM)です。
★ 577+0直近 7 日のスター増減 - #140
アプリのためのセルフコーディングシステム — React Native 向け Alan AI SDK
★ 575+0直近 7 日のスター増減 - #141
目と耳を持つ MCP マルチモーダル AI エージェント
★ 575+0直近 7 日のスター増減 - #142★ 572+1直近 7 日のスター増減
- #143★ 568+0直近 7 日のスター増減
- #144
Flameは、UIデザインのモックアップを高品質なReactコードに変換するために設計されたオープンソースのマルチモーダルAIシステムです。ビジョン言語モデリング、自動データ合成、構造化されたトレーニングワークフローを活用して、デザインとフロントエンド開発のギャップを埋めます。
★ 562+1直近 7 日のスター増減 - #145
VLMで使用する様々な業界特化型スキーマのハブ
★ 555+0直近 7 日のスター増減 - #146
素晴らしい Multimodal Modeling(MLLM、UMM、NMMを網羅)
★ 543+3直近 7 日のスター増減 - #147
「EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model」の公式コード
★ 508+1直近 7 日のスター増減