multimodal
multimodal 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #61
stability.ai API와 상호작용하기 위한 SDK (예: stable diffusion 추론)
★ 2,435-1최근 7일 스타 변화 - #62
mPLUG-DocOwl: 문서 이해를 위한 모듈식 멀티모달 대형 언어 모델
★ 2,411+0최근 7일 스타 변화 - #63
[ECCV2024] 멀티모달 이해를 위한 비디오 파운데이션 모델 및 데이터
★ 2,374+5최근 7일 스타 변화 - #64
🎨 NeMo Data Designer: 처음부터 또는 시드 데이터를 사용하여 고품질 합성 데이터 생성.
★ 2,197+7최근 7일 스타 변화 - #65
GenAI Processors는 효율적인 병렬 콘텐츠 처리를 지원하는 경량 Python 라이브러리입니다.
★ 2,120+0최근 7일 스타 변화 - #66
Claude(또는 기타 LLM)가 URL이나 로컬 파일에서 텍스트와 함께 장면 인식 기능 및 중복이 제거된 프레임을 통해 동영상을 실제로 시청할 수 있도록 지원합니다. 로컬에서 실행되며, MIT 라이선스입니다.
★ 2,109+20최근 7일 스타 변화 - #67★ 2,048+7최근 7일 스타 변화
- #68★ 1,975+1최근 7일 스타 변화
- #69
Alibaba Cloud의 Qwen-VL 시리즈 파인튜닝을 위한 오픈소스 구현체입니다.
★ 1,961+1최근 7일 스타 변화 - #70★ 1,946+0최근 7일 스타 변화
- #71
고급 리터러트 머시너리(Advanced Literate Machinery)를 위한 독창적이고 혁신적인 아이디어 및 알고리즘 모음입니다. 이 프로젝트는 Alibaba Group Tongyi Lab Language Technology Lab의 OCR 팀에서 유지 관리합니다.
★ 1,835+1최근 7일 스타 변화 - #72★ 1,818+1최근 7일 스타 변화
- #73
앱을 위한 셀프 코딩 시스템 — 안드로이드용 Alan AI SDK
★ 1,807-1최근 7일 스타 변화 - #74
앱을 위한 자체 코딩 시스템 — Flutter용 Alan AI SDK
★ 1,756-1최근 7일 스타 변화 - #75
앱을 위한 셀프 코딩 시스템 — Ionic용 Alan AI SDK
★ 1,649-1최근 7일 스타 변화 - #76
AI 데이터 앱을 위한 통합 멀티모달 백엔드
★ 1,619+5최근 7일 스타 변화 - #77★ 1,602+3최근 7일 스타 변화
- #78★ 1,524+0최근 7일 스타 변화
- #79★ 1,514+2최근 7일 스타 변화
- #80
가정을 위한 시각 지능.
★ 1,454+10최근 7일 스타 변화 - #81
일본어 LLM 모음 - Overview of Japanese LLMs
★ 1,428+1최근 7일 스타 변화 - #82
이 저장소는 손글씨 생성을 위한 필체와 문자 스타일 분리(Disentangling Writer and Character Styles for Handwriting Generation, CVPR 2023)의 공식 구현입니다.
★ 1,406-1최근 7일 스타 변화 - #83
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1,363+462최근 7일 스타 변화 - #84★ 1,314+0최근 7일 스타 변화
- #85
155개 이상의 시각-언어 모델(VLM/MLLM) 아키텍처를 엄선한 시각적 카탈로그: 멀티모달 AI 에이전트를 위한 논문, 다이어그램, 학습 레시피, 데이터셋 및 출시 타임라인.
★ 1,310+2최근 7일 스타 변화 - #86
Claude에게 동영상을 시청하고 이해할 수 있는 능력을 부여하세요 — 프레임 추출 및 멀티모달 오디오 분석 기능이 포함된 Claude Code 플러그인
★ 1,281+6최근 7일 스타 변화 - #87
다국어 텍스트, 이미지, 비디오 전반의 콘텐츠 이해 및 생성을 위한 포켓 사이즈 멀티모달 AI, OpenAI CLIP 및 LLaVA보다 최대 5배 빠름 🖼️ & 🖋️
★ 1,247+1최근 7일 스타 변화 - #88
Xtreme1은 멀티모달 데이터 학습을 위한 올인원 데이터 레이블링 및 주석 플랫폼이며 3D LiDAR 포인트 클라우드, 이미지 및 LLM을 지원합니다.
★ 1,239+2최근 7일 스타 변화 - #89
언어 모델을 활용한 3D Mesh 생성 통합
★ 1,167+0최근 7일 스타 변화 - #90★ 1,153-25최근 7일 스타 변화