multimodal
Các kho mã nguồn mở đang theo dõi được gắn thẻ multimodal, sắp xếp theo số sao.
- #61
SDK để tương tác với các API của stability.ai (ví dụ: suy luận stable diffusion)
★ 2.435-1Thay đổi số sao trong 7 ngày qua - #62
mPLUG-DocOwl: Mô hình ngôn ngữ lớn đa phương thức mô-đun hóa để hiểu tài liệu
★ 2.411+0Thay đổi số sao trong 7 ngày qua - #63
[ECCV2024] Video Foundation Models & Data dành cho thấu hiểu đa phương thức
★ 2.374+6Thay đổi số sao trong 7 ngày qua - #64
🎨 NeMo Data Designer: Tạo dữ liệu tổng hợp chất lượng cao từ đầu hoặc từ dữ liệu gốc.
★ 2.197+11Thay đổi số sao trong 7 ngày qua - #65
GenAI Processors là một thư viện Python nhẹ giúp xử lý nội dung song song hiệu quả.
★ 2.120+0Thay đổi số sao trong 7 ngày qua - #66
Cho phép Claude (hoặc bất kỳ LLM nào) thực sự xem video — nhận biết cảnh, loại bỏ khung hình trùng lặp + bản ghi lời thoại, từ URL hoặc tệp cục bộ. Chạy cục bộ, giấy phép MIT.
★ 2.109+34Thay đổi số sao trong 7 ngày qua - #67★ 2.048+9Thay đổi số sao trong 7 ngày qua
- #68
[ICLR & NeurIPS 2025] Kho lưu trữ cho dòng Show-o, một Transformer duy nhất hợp nhất việc hiểu và tạo đa phương thức.
★ 1.975+2Thay đổi số sao trong 7 ngày qua - #69
Một bản cài đặt mã nguồn mở để tinh chỉnh chuỗi Qwen-VL bởi Alibaba Cloud.
★ 1.961+1Thay đổi số sao trong 7 ngày qua - #70
Triển khai "BitNet: Scaling 1-bit Transformers for Large Language Models" trong pytorch
★ 1.946+1Thay đổi số sao trong 7 ngày qua - #71
Bộ sưu tập các ý tưởng và thuật toán độc đáo, sáng tạo hướng tới Máy móc văn bản nâng cao. Dự án này được duy trì bởi Nhóm OCR thuộc Phòng thí nghiệm Công nghệ Ngôn ngữ, Phòng thí nghiệm Thông Y, Alibaba Group.
★ 1.835+1Thay đổi số sao trong 7 ngày qua - #72
Tổng hợp các chương trình đồ họa cho số liệu khoa học và bản phác thảo bằng TikZ.
★ 1.818+1Thay đổi số sao trong 7 ngày qua - #73
Hệ thống tự động lập trình cho ứng dụng của bạn — Alan AI SDK cho Android
★ 1.807-1Thay đổi số sao trong 7 ngày qua - #74
Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho Flutter
★ 1.756-1Thay đổi số sao trong 7 ngày qua - #75
Hệ thống tự lập trình cho ứng dụng của bạn — Alan AI SDK cho Ionic
★ 1.649-1Thay đổi số sao trong 7 ngày qua - #76
Backend đa phương thức thống nhất cho các ứng dụng dữ liệu AI
★ 1.619+6Thay đổi số sao trong 7 ngày qua - #77★ 1.602+9Thay đổi số sao trong 7 ngày qua
- #78
Lấy dữ liệu sạch từ các tài liệu phức tạp, được hỗ trợ bởi các mô hình thị giác-ngôn ngữ ⚡
★ 1.524+0Thay đổi số sao trong 7 ngày qua - #79
Một kiến trúc Mô hình Ngôn ngữ Lớn Đa phương thức (MLLM) mới, được thiết kế để căn chỉnh cấu trúc giữa các embedding thị giác và văn bản.
★ 1.514+2Thay đổi số sao trong 7 ngày qua - #80
Trí tuệ trực quan cho ngôi nhà của bạn.
★ 1.454+13Thay đổi số sao trong 7 ngày qua - #81
Tổng quan về các LLM tiếng Nhật
★ 1.428+1Thay đổi số sao trong 7 ngày qua - #82
Kho lưu trữ này là bản triển khai chính thức của Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023)
★ 1.406+3Thay đổi số sao trong 7 ngày qua - #83
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.325+892Thay đổi số sao trong 7 ngày qua - #84
Công cụ suy luận ngoại tuyến cho nghệ thuật, trò chuyện thoại thời gian thực, chatbot hỗ trợ bởi LLM và quy trình làm việc tự động
★ 1.314+0Thay đổi số sao trong 7 ngày qua - #85
Danh mục trực quan được tuyển chọn của hơn 155 kiến trúc mô hình ngôn ngữ thị giác (VLM/MLLM): tài liệu nghiên cứu, sơ đồ, công thức huấn luyện, tập dữ liệu và mốc thời gian phát hành cho các tác nhân AI đa phương thức.
★ 1.310+4Thay đổi số sao trong 7 ngày qua - #86
Cung cấp cho Claude khả năng xem và hiểu video — Plugin Claude Code với tính năng trích xuất khung hình và phân tích âm thanh đa phương thức
★ 1.281+15Thay đổi số sao trong 7 ngày qua - #87
AI đa phương thức cỡ nhỏ để hiểu và tạo nội dung trên văn bản đa ngôn ngữ, hình ảnh và video, nhanh hơn tới 5 lần so với OpenAI CLIP và LLaVA
★ 1.247+2Thay đổi số sao trong 7 ngày qua - #88
Xtreme1 là nền tảng gán nhãn và chú thích dữ liệu tất cả trong một dành cho huấn luyện dữ liệu đa phương thức, hỗ trợ đám mây điểm 3D LiDAR, hình ảnh và LLM.
★ 1.239+5Thay đổi số sao trong 7 ngày qua - #89
Thống nhất việc tạo lưới 3D với các Mô hình ngôn ngữ
★ 1.167+1Thay đổi số sao trong 7 ngày qua - #90★ 1.153-22Thay đổi số sao trong 7 ngày qua