multimodal
Các kho mã nguồn mở đang theo dõi được gắn thẻ multimodal, sắp xếp theo số sao.
- #121
Các bài báo và điểm chuẩn mới nhất về lập luận với các mô hình nền tảng.
★ 656+1Thay đổi số sao trong 7 ngày qua - #122
MOSS-Audio là mô hình nền tảng mã nguồn mở cho việc hiểu âm thanh thống nhất, hỗ trợ lời nói, âm thanh, âm nhạc, chú thích, QA và suy luận trong các tình huống thực tế.
★ 655+5Thay đổi số sao trong 7 ngày qua - #123★ 641+0Thay đổi số sao trong 7 ngày qua
- #124
Trang dự án cho "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement".
★ 639+1Thay đổi số sao trong 7 ngày qua - #125
Danh sách tổng hợp các mô hình nền tảng và đa phương thức hàng đầu! [Bài báo + Mã nguồn + Ví dụ + Hướng dẫn]
★ 637+0Thay đổi số sao trong 7 ngày qua - #126
Triển khai chính thức cho "Blended Latent Diffusion" [SIGGRAPH 2023].
★ 632+0Thay đổi số sao trong 7 ngày qua - #127
Second Brain là một khung tác nhân hoạt động như một hệ điều hành, sử dụng trí thông minh tệp tin cục bộ, tự động hóa quy trình làm việc và LLM để hoàn thành các tác vụ cũng như giao tiếp qua nhiều phương thức và nền tảng nhắn tin.
★ 629+3Thay đổi số sao trong 7 ngày qua - #128
Khám phá "Khoảnh khắc Aha" đa phương thức trên mô hình 2B
★ 623+0Thay đổi số sao trong 7 ngày qua - #129
Kho lưu trữ này cung cấp các chương trình để xây dựng mã RAG (Retrieval Augmented Generation) cho Generative AI với LlamaIndex, Deep Lake và Pinecone, tận dụng sức mạnh của các mô hình OpenAI và Hugging Face để tạo và đánh giá.
★ 623+1Thay đổi số sao trong 7 ngày qua - #130
Hunyuan3D-Omni: Khung thống nhất để tạo tài nguyên 3D có thể kiểm soát
★ 615+2Thay đổi số sao trong 7 ngày qua - #131
[ECCV 2024] Tokenize Anything via Prompting.
★ 600+0Thay đổi số sao trong 7 ngày qua - #132
Kho lưu trữ này chứa mã đánh giá cho bài báo "MMMU: Một điểm chuẩn hiểu và suy luận đa phương thức đa ngành lớn cho AGI chuyên gia"
★ 593+1Thay đổi số sao trong 7 ngày qua - #133
Một công cụ học tăng cường bất đồng bộ cho đào tạo hậu kỳ đa phương thức ở quy mô lớn
★ 590+7Thay đổi số sao trong 7 ngày qua - #134
Triển khai chính thức cho "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022].
★ 589+0Thay đổi số sao trong 7 ngày qua - #135
[ECCV2024] Mô hình ngôn ngữ lớn đa phương thức có căn cứ với mã hóa hình ảnh cục bộ
★ 586+0Thay đổi số sao trong 7 ngày qua - #136
Tạo tự động hóa trình duyệt như thể bạn đang hướng dẫn con người bằng GPT-4 Vision.
★ 585+0Thay đổi số sao trong 7 ngày qua - #137
RAI là một khung tác nhân bất khả tri về nhà cung cấp cho robot AI vật lý, sử dụng các công cụ ROS 2 để thực hiện các hành động phức tạp, các kịch bản được xác định, thực thi giao diện tự do, tóm tắt nhật ký, tương tác giọng nói và hơn thế nữa.
★ 581+1Thay đổi số sao trong 7 ngày qua - #138★ 579+12Thay đổi số sao trong 7 ngày qua
- #139
LLaVA-Mini là mô hình đa phương thức lớn (LMM) hợp nhất, hỗ trợ hiểu hình ảnh, hình ảnh độ phân giải cao và video một cách hiệu quả.
★ 577+0Thay đổi số sao trong 7 ngày qua - #140
Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho React Native.
★ 575+0Thay đổi số sao trong 7 ngày qua - #141
Một tác nhân AI đa phương thức MCP có mắt và tai!
★ 575+0Thay đổi số sao trong 7 ngày qua - #142★ 572+1Thay đổi số sao trong 7 ngày qua
- #143★ 568+0Thay đổi số sao trong 7 ngày qua
- #144
Flame là một hệ thống AI đa phương thức mã nguồn mở được thiết kế để chuyển đổi các bản thiết kế UI thành mã React chất lượng cao. Nó tận dụng mô hình ngôn ngữ thị giác, tổng hợp dữ liệu tự động và quy trình đào tạo có cấu trúc để thu hẹp khoảng cách giữa thiết kế và phát triển front-end.
★ 562+1Thay đổi số sao trong 7 ngày qua - #145
Trung tâm cho các lược đồ chuyên ngành công nghiệp khác nhau để sử dụng với VLM.
★ 555+0Thay đổi số sao trong 7 ngày qua - #146
Tổng hợp các mô hình đa phương thức (bao gồm MLLM, UMM và NMM).
★ 543+3Thay đổi số sao trong 7 ngày qua - #147
Mã nguồn chính thức của "EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"
★ 508+1Thay đổi số sao trong 7 ngày qua