跳到主要内容
buildradar
Sign in
主题 · multi-modal

multi-modal

标记 multi-modal 主题、收录中的开源项目,按星标数排序。

项目数
42
总星标数
189,535
平均星标数
4,513
占比
0.01%

常跟 multi-modal 一起出现在同一个项目上的主题。

近期新秀

近 90 天内创建、标记 multi-modal 主题的项目。

近 90 天内还没有新项目标记这个主题。

  • agentscope@agentscope-ai

    构建与运行可视、可理解且可信赖的代理。

    30,463+420近 7 天星标变化
  • MiniCPM-V@OpenBMB

    口袋大小的 MLLM,在手机上实现超高效的图像和视频理解

    26,283+27近 7 天星标变化
  • ten-framework@TEN-framework

    开源框架,用于对话式语音 AI 代理

    11,102+10近 7 天星标变化
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] InternVL Family:一个先驱性的开源替代 GPT-4o 的多模态对话模型,接近 GPT-4o 的表现

    10,150+3近 7 天星标变化
  • modelscope@modelscope

    ModelScope:将模型即服务(Model-as-a-Service)的概念落地。

    9,121+4近 7 天星标变化
  • big-AGI@enricoros

    AI 套件,结合最先进模型提供高级 AI/AGI 功能,包含 AI 人格、AGI 功能、Beam 多模型聊天、文字转图像、语音、响应流、代码高亮与执行、PDF 导入、开发者预设等,支持本地或云端部署。

    7,108+1近 7 天星标变化
  • data-juicer@datajuicer

    为基础模型提供数据处理!🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

    6,975+26近 7 天星标变化
  • CogVLM@zai-org

    最先进的开放视觉语言模型 | 多模态预训练模型

    6,744+0近 7 天星标变化
  • valhalla@valhalla

    开源的 OpenStreetMap 路由引擎

    6,154+24近 7 天星标变化
  • Chinese-CLIP@OFA-Sys

    中文版本的 CLIP,实现中文跨模态检索与表征生成。

    6,001+1近 7 天星标变化
  • DALLE-pytorch@lucidrains

    在 Pytorch 中实现 / 复制 DALL‑E,OpenAI 的文字转图像 Transformer。

    5,626-2近 7 天星标变化
  • marqo@marqo-ai

    Ecommerce 搜索与发现平台 - marqo.ai

    5,031-1近 7 天星标变化
  • DeepKE@zjunlp

    [EMNLP 2022] 用于知识图谱提取与构建的开源工具包

    4,476+1近 7 天星标变化
  • VLMEvalKit@open-compass

    开源大型多模态模型评估工具包,支持220+ LMMs与80+基准测试

    4,375+13近 7 天星标变化
  • OmniGen@VectorSpaceLab

    OmniGen:统一图像生成。 https://arxiv.org/pdf/2409.11340

    4,342+1近 7 天星标变化
  • VisualGLM-6B@zai-org

    中英双语多模态对话语言模型 | 多模态中英双语对话语言模型

    4,155+0近 7 天星标变化
  • LLamaSharp@SciSharp

    C#/.NET 函式库,可在本机装置高效执行 LLM(🦙LLaMA/LLaVA)

    3,790+2近 7 天星标变化
  • Video-LLaVA@PKU-YuanGroup

    【EMNLP 2024🔥】Video-LLaVA:通过投影前对齐学习统一视觉表示

    3,500+1近 7 天星标变化
  • py-xiaozhi@huangjunsen0406

    开源 AI 助手生态系统,含 MCP 集成、多模态工作流程、IoT 支持与跨平台语音交互

    3,463+9近 7 天星标变化
  • docarray@docarray

    表示、传送、存储与搜索多模态数据。

    3,123-1近 7 天星标变化
  • LISA@JIA-Lab-research

    “LISA: Reasoning Segmentation via Large Language Model”项目页面。

    2,674+0近 7 天星标变化
  • CogVLM2@zai-org

    基于 Llama3-8B 的 GPT4V 级别开源多模态模型

    2,433+0近 7 天星标变化
  • MoE-LLaVA@PKU-YuanGroup

    【TMM 2025🔥】大型视觉语言模型的混合专家模型 (Mixture-of-Experts)

    2,322+0近 7 天星标变化
  • RecSysPapers@tangxyw

    推荐、广告与搜索领域的工业界经典与最新前沿论文集合。

    2,188-1近 7 天星标变化
  • MotionGPT@OpenMotionLab

    [NeurIPS 2023] MotionGPT:将人体动作视为外语,使用 LLM 的统一动作语言生成模型

    1,963+1近 7 天星标变化
  • GPTDiscord@Kav-K

    一个为 Discord 设计的强大一体化 GPT 界面。支持 ChatGPT 风格对话、图片生成、AI 审核、自定义索引/知识库、YouTube 摘要等功能!

    1,853-2近 7 天星标变化
  • SALMONN@bytedance

    SALMONN 系列:一套先进的多模态 LLM

    1,521+3近 7 天星标变化
  • MedMNIST@MedMNIST

    [pip install medmnist] 用于 2D 与 3D 生物医学图像分类的 18 个标准化数据集

    1,399+0近 7 天星标变化
  • transfusion-pytorch@lucidrains

    MetaAI 的 Transfusion Pytorch 实现,“使用一个多模态模型预测下一个 Token 并扩散图像”

    1,398+3近 7 天星标变化
  • 此存储库收集了“Large Language Model 知识蒸馏调查”的相关论文。我们将知识蒸馏(KD)拆解为知识引出与蒸馏算法,并探讨 LLM 的技能与垂直蒸馏。

    1,306+1近 7 天星标变化
← 返回主题列表