multimodal
multimodal 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
- #121
파운데이션 모델의 추론 관련 최신 논문 및 벤치마크
★ 657+1최근 7일 스타 변화 - #122
MOSS-Audio는 통합 오디오 이해를 위한 오픈 소스 파운데이션 모델로, 실제 환경에서 음성, 소리, 음악, 캡션, QA 및 추론 기능을 제공합니다.
★ 657+5최근 7일 스타 변화 - #123★ 641-1최근 7일 스타 변화
- #124★ 640+0최근 7일 스타 변화
- #125
주요 파운데이션 및 멀티모달 모델을 정리한 큐레이션 리스트 (논문, 코드, 예제, 튜토리얼 포함)
★ 637+0최근 7일 스타 변화 - #126
Second Brain은 로컬 파일 인텔리전스, 워크플로우 자동화, LLM을 활용하여 작업을 완료하고 다양한 모달리티 및 메시징 플랫폼에서 통신하는 에이전트 프레임워크이자 운영 체제임
★ 632+13최근 7일 스타 변화 - #127
"Blended Latent Diffusion" [SIGGRAPH 2023] 공식 구현체
★ 632+0최근 7일 스타 변화 - #128
LlamaIndex, Deep Lake, Pinecone을 사용하여 생성형 AI를 위한 RAG 코드를 구축하고, OpenAI 및 Hugging Face 모델을 활용해 생성 및 평가를 수행하는 프로그램 저장소
★ 624+2최근 7일 스타 변화 - #129
2B 모델에서 멀티모달 '아하 모멘트(Aha Moment)' 탐색
★ 623+0최근 7일 스타 변화 - #130
Hunyuan3D-Omni: 3D 에셋의 제어 가능한 생성을 위한 통합 프레임워크
★ 618+5최근 7일 스타 변화 - #131★ 613—최근 7일 스타 변화
- #132
[ECCV 2024] 프롬프팅을 통한 모든 것의 토큰화(Tokenize Anything via Prompting)
★ 600+0최근 7일 스타 변화 - #133★ 597+12최근 7일 스타 변화
- #134★ 594+2최근 7일 스타 변화
- #135
Blended Diffusion for Text-driven Editing of Natural Images [CVPR 2022] 공식 구현체
★ 588+0최근 7일 스타 변화 - #136★ 586+0최근 7일 스타 변화
- #137
GPT-4 Vision을 사용하여 마치 사람을 가르치듯 브라우저 자동화를 생성합니다.
★ 586+1최근 7일 스타 변화 - #138
RAI는 물리적 AI 로봇 공학을 위한 벤더 중립적 에이전트 프레임워크로, ROS 2 도구를 활용하여 복잡한 작업 수행, 시나리오 정의, 자유 인터페이스 실행, 로그 요약, 음성 상호작용 등을 지원합니다.
★ 585+7최근 7일 스타 변화 - #139★ 579+13최근 7일 스타 변화
- #140
LLaVA-Mini는 이미지, 고해상도 이미지 및 비디오 이해를 효율적으로 지원하는 통합 대규모 멀티모달 모델(LMM)입니다.
★ 577+0최근 7일 스타 변화 - #141
앱을 위한 셀프 코딩 시스템 — React Native용 Alan AI SDK.
★ 575+0최근 7일 스타 변화 - #142
보고 들을 수 있는 MCP 멀티모달 AI 에이전트!
★ 575-1최근 7일 스타 변화 - #143★ 572+1최근 7일 스타 변화
- #144★ 568+0최근 7일 스타 변화
- #145
Flame은 UI 디자인 목업을 고품질 React 코드로 변환하도록 설계된 오픈소스 멀티모달 AI 시스템. 비전-언어 모델링, 자동화된 데이터 합성 및 구조화된 학습 워크플로우를 활용하여 디자인과 프론트엔드 개발 간의 격차를 해소
★ 562+0최근 7일 스타 변화 - #146
VLM과 함께 사용할 수 있는 다양한 산업별 스키마 허브
★ 556+0최근 7일 스타 변화 - #147
Awesome Multimodal Modeling [MLLM, UMM 및 NMM 포함]
★ 543+2최근 7일 스타 변화 - #148★ 508+1최근 7일 스타 변화