Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · multimodal

multimodal

Các kho mã nguồn mở đang theo dõi được gắn thẻ multimodal, sắp xếp theo số sao.

147 kho mã
  • Các bài báo và điểm chuẩn mới nhất về lập luận với các mô hình nền tảng.

    656+1Thay đổi số sao trong 7 ngày qua
  • MOSS-Audio@OpenMOSS

    MOSS-Audio là mô hình nền tảng mã nguồn mở cho việc hiểu âm thanh thống nhất, hỗ trợ lời nói, âm thanh, âm nhạc, chú thích, QA và suy luận trong các tình huống thực tế.

    655+5Thay đổi số sao trong 7 ngày qua
  • SEED@AILab-CVC

    Triển khai chính thức của SEED-LLaMA (ICLR 2024)

    641+0Thay đổi số sao trong 7 ngày qua
  • Seg-Zero@JIA-Lab-research

    Trang dự án cho "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement".

    639+1Thay đổi số sao trong 7 ngày qua
  • Danh sách tổng hợp các mô hình nền tảng và đa phương thức hàng đầu! [Bài báo + Mã nguồn + Ví dụ + Hướng dẫn]

    637+0Thay đổi số sao trong 7 ngày qua
  • blended-latent-diffusion@omriav

    Triển khai chính thức cho "Blended Latent Diffusion" [SIGGRAPH 2023].

    632+0Thay đổi số sao trong 7 ngày qua
  • second-brain@henrydaum

    Second Brain là một khung tác nhân hoạt động như một hệ điều hành, sử dụng trí thông minh tệp tin cục bộ, tự động hóa quy trình làm việc và LLM để hoàn thành các tác vụ cũng như giao tiếp qua nhiều phương thức và nền tảng nhắn tin.

    629+3Thay đổi số sao trong 7 ngày qua
  • VisualThinker-R1-Zero@turningpoint-ai

    Khám phá "Khoảnh khắc Aha" đa phương thức trên mô hình 2B

    623+0Thay đổi số sao trong 7 ngày qua
  • RAG-Driven-Generative-AI@Denis2054

    Kho lưu trữ này cung cấp các chương trình để xây dựng mã RAG (Retrieval Augmented Generation) cho Generative AI với LlamaIndex, Deep Lake và Pinecone, tận dụng sức mạnh của các mô hình OpenAI và Hugging Face để tạo và đánh giá.

    623+1Thay đổi số sao trong 7 ngày qua
  • Hunyuan3D-Omni@Tencent-Hunyuan

    Hunyuan3D-Omni: Khung thống nhất để tạo tài nguyên 3D có thể kiểm soát

    615+2Thay đổi số sao trong 7 ngày qua
  • tokenize-anything@baaivision

    [ECCV 2024] Tokenize Anything via Prompting.

    600+0Thay đổi số sao trong 7 ngày qua
  • MMMU@MMMU-Benchmark

    Kho lưu trữ này chứa mã đánh giá cho bài báo "MMMU: Một điểm chuẩn hiểu và suy luận đa phương thức đa ngành lớn cho AGI chuyên gia"

    593+1Thay đổi số sao trong 7 ngày qua
  • Relax@redai-studio

    Một công cụ học tăng cường bất đồng bộ cho đào tạo hậu kỳ đa phương thức ở quy mô lớn

    590+7Thay đổi số sao trong 7 ngày qua
  • blended-diffusion@omriav

    Triển khai chính thức cho "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022].

    589+0Thay đổi số sao trong 7 ngày qua
  • Groma@FoundationVision

    [ECCV2024] Mô hình ngôn ngữ lớn đa phương thức có căn cứ với mã hóa hình ảnh cục bộ

    586+0Thay đổi số sao trong 7 ngày qua
  • AI-Employe@vignshwarar

    Tạo tự động hóa trình duyệt như thể bạn đang hướng dẫn con người bằng GPT-4 Vision.

    585+0Thay đổi số sao trong 7 ngày qua
  • rai@RobotecAI

    RAI là một khung tác nhân bất khả tri về nhà cung cấp cho robot AI vật lý, sử dụng các công cụ ROS 2 để thực hiện các hành động phức tạp, các kịch bản được xác định, thực thi giao diện tự do, tóm tắt nhật ký, tương tác giọng nói và hơn thế nữa.

    581+1Thay đổi số sao trong 7 ngày qua
  • motis@motis-project

    Định tuyến đa phương thức, mã hóa địa lý và bản đồ gạch (map tiles).

    579+12Thay đổi số sao trong 7 ngày qua
  • LLaVA-Mini@ictnlp

    LLaVA-Mini là mô hình đa phương thức lớn (LMM) hợp nhất, hỗ trợ hiểu hình ảnh, hình ảnh độ phân giải cao và video một cách hiệu quả.

    577+0Thay đổi số sao trong 7 ngày qua
  • Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho React Native.

    575+0Thay đổi số sao trong 7 ngày qua
  • multimodal-agents-course@the-ai-merge

    Một tác nhân AI đa phương thức MCP có mắt và tai!

    575+0Thay đổi số sao trong 7 ngày qua
  • psi@microsoft

    Nền tảng cho Trí tuệ tình huống (Situated Intelligence)

    572+1Thay đổi số sao trong 7 ngày qua
  • clip.cpp@monatis

    Suy luận CLIP bằng C/C++ thuần không phụ thuộc bên ngoài

    568+0Thay đổi số sao trong 7 ngày qua
  • Flame-Code-VLM@Flame-Code-VLM

    Flame là một hệ thống AI đa phương thức mã nguồn mở được thiết kế để chuyển đổi các bản thiết kế UI thành mã React chất lượng cao. Nó tận dụng mô hình ngôn ngữ thị giác, tổng hợp dữ liệu tự động và quy trình đào tạo có cấu trúc để thu hẹp khoảng cách giữa thiết kế và phát triển front-end.

    562+1Thay đổi số sao trong 7 ngày qua
  • vlmrun-hub@vlm-run

    Trung tâm cho các lược đồ chuyên ngành công nghiệp khác nhau để sử dụng với VLM.

    555+0Thay đổi số sao trong 7 ngày qua
  • Tổng hợp các mô hình đa phương thức (bao gồm MLLM, UMM và NMM).

    543+3Thay đổi số sao trong 7 ngày qua
  • EVF-SAM@hustvl

    Mã nguồn chính thức của "EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"

    508+1Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề