multimodal-ai
multimodal-ai 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 multimodal-ai 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 multimodal-ai 태그가 달린 리포지토리예요.
최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.
- #1
🚀 오프라인 비디오 생성 및 디지털 휴먼 클로닝을 위한 진정한 오픈소스 AI 아바타(디지털 휴먼) toolkit.
★ 14,992+65최근 7일 스타 변화 - #2
OpenAI 호환 텍스트, 이미지, 비디오 및 에이전트 워크플로우를 위한 공식 Agnes AI 게이트웨이 및 모델 카탈로그.
★ 5,044+28최근 7일 스타 변화 - #3
AI 어시스턴트(Claude Code, Cursor, Gemini CLI)를 위한 멀티모달 생성형 미디어 스킬. muapi.ai 기반의 고품질 이미지, 비디오, 오디오 생성.
★ 4,205+19최근 7일 스타 변화 - #4
Mano-P: 엣지 디바이스를 위한 오픈소스 GUI-VLA 에이전트. OSWorld 1위(특화 분야, 58.2%). Apple M4 Mac mini/MacBook에서 로컬로 실행되며 데이터가 기기를 벗어나지 않습니다.
★ 2,615+15최근 7일 스타 변화 - #5★ 1,869+87최근 7일 스타 변화
- #6
비디오 검색 및 요약(VSS)을 위한 NVIDIA AI Blueprint는 실시간 검증된 알림, 시각적 Q&A, 자동화된 보고 기능을 갖춘 비디오 분석 에이전트를 구축하기 위한 GPU 가속 레퍼런스 아키텍처입니다. VSS Blueprint는 NVIDIA Cosmos 같은 비전 언어 모델(VLM), NVIDIA Nemotron 같은 LLM, RAG 및 NVIDIA NIM을 사용합니다.
★ 1,840+10최근 7일 스타 변화 - #7
OpenGUI는 GUI를 통해 실제 모바일 앱을 보고, 계획하고, 조작할 수 있는 휴대폰 사용 AI를 위한 Android GUI 에이전트 프레임워크입니다.
★ 1,624+38최근 7일 스타 변화 - #8
Apple Silicon을 위한 고성능 OpenAI 및 Anthropic 호환 LLM 추론 서버. 네이티브 MLX, 연속 배치, 멀티모달 모델, MCP 도구 호출 및 Claude Code 지원.
★ 1,557+6최근 7일 스타 변화 - #9
155개 이상의 시각-언어 모델(VLM/MLLM) 아키텍처를 엄선한 시각적 카탈로그: 멀티모달 AI 에이전트를 위한 논문, 다이어그램, 학습 레시피, 데이터셋 및 출시 타임라인.
★ 1,310+2최근 7일 스타 변화 - #10
XiaoyaoSearch: AI를 활용해 사용자의 말과 이미지를 이해하고 로컬 파일을 검색하는 도구. 채팅하듯 쉬운 검색을 제공합니다.
★ 1,083+0최근 7일 스타 변화 - #11
오픈 소스 자율형 Android 에이전트 — 로컬/원격 LLM 및 접근성 기반 화면 자동화로 구동되는 프로덕션 준비 완료된 자체 계획 AI 비서.
★ 1,021+43최근 7일 스타 변화 - #12
벡터 검색 및 LLM을 활용한 멀티모달 AI, RAG, 에이전트 리소스, 예제 및 튜토리얼
★ 973-1최근 7일 스타 변화 - #13★ 596—최근 7일 스타 변화