rlhf
rlhf 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
관련 토픽
같은 리포지토리에 rlhf 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 rlhf 태그가 달린 리포지토리예요.
최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.
- #1
100개 이상의 LLM 및 VLM을 위한 통합 효율적 미세 조정(ACL 2024)
★ 74,532+89최근 7일 스타 변화 - #2
OpenAssistant는 작업을 이해하고, 타사 시스템과 상호 작용하며, 이를 위해 동적으로 정보를 검색할 수 있는 채팅 기반 어시스턴트입니다.
★ 37,401-7최근 7일 스타 변화 - #3★ 12,208+2최근 7일 스타 변화
- #4★ 7,277+4최근 7일 스타 변화
- #5
중국어 LLaMA-2 & Alpaca-2 대형 언어 모델 2기 프로젝트 + 64K 초장문 컨텍스트 모델
★ 7,120+0최근 7일 스타 변화 - #6
인간 및 AI 선호도에 맞춰 언어 모델을 정렬하기 위한 강력한 레시피
★ 5,670-3최근 7일 스타 변화 - #7
OpenClaw-RL: 대화만으로 모든 에이전트 학습
★ 5,665+7최근 7일 스타 변화 - #8
AI 연구원이 로컬 하드웨어에서 GPU 클러스터에 이르기까지 모델을 원활하게 학습, 평가 및 확장할 수 있는 오픈 소스 연구 환경
★ 5,185+3최근 7일 스타 변화 - #9
PyTorch로 처음부터 단계별로 추론 LLM 구현하기
★ 5,138+49최근 7일 스타 변화 - #10★ 5,093+5최근 7일 스타 변화
- #11★ 5,042+5최근 7일 스타 변화
- #12
Align Anything: 피드백을 통한 전모달(All-modality) 모델 학습
★ 4,671+3최근 7일 스타 변화 - #13
인간 피드백 기반 강화 학습(RLHF) 리소스 모음 (지속 업데이트)
★ 4,424+2최근 7일 스타 변화 - #14
🚀 기초 RL 개념부터 LLM 정렬, RLVR, 고급 Agentic 시스템까지의 간극을 메우는 오픈소스 실습 커리큘럼
★ 4,199+54최근 7일 스타 변화 - #15★ 3,485-1최근 7일 스타 변화
- #16
Distilabel은 검증된 연구 논문을 바탕으로 빠르고 안정적이며 확장 가능한 파이프라인이 필요한 엔지니어를 위한 합성 데이터 및 AI 피드백 프레임워크입니다.
★ 3,384+3최근 7일 스타 변화 - #17★ 3,380+6최근 7일 스타 변화
- #18
PyTorch를 위한 LeetCode — Google, Meta, Anthropic의 실제 인터뷰에서 출제된 65개의 ML/AI 인터뷰 문제. Jupyter 노트북, 자동 채점기, MCP AI 튜터 제공.
★ 2,461+12최근 7일 스타 변화 - #19★ 2,357+11최근 7일 스타 변화
- #20
지시사항을 따르는 언어 모델을 위한 자동 평가기. 인간 검증을 거쳤으며, 고품질이고 저렴하며 빠릅니다.
★ 2,012-1최근 7일 스타 변화 - #21
Agentic RL 관련 유용한 목록
★ 1,832+29최근 7일 스타 변화 - #22
[NeurIPS 2023] ImageReward: 텍스트-이미지 생성을 위한 인간 선호도 학습 및 평가
★ 1,703+1최근 7일 스타 변화 - #23★ 1,613+1최근 7일 스타 변화
- #24★ 1,601-1최근 7일 스타 변화
- #25
RLHF를 위한 리워드 모델 학습 레시피
★ 1,541+0최근 7일 스타 변화 - #26★ 1,430+0최근 7일 스타 변화
- #27
Xtreme1은 멀티모달 데이터 학습을 위한 올인원 데이터 레이블링 및 주석 플랫폼이며 3D LiDAR 포인트 클라우드, 이미지 및 LLM을 지원합니다.
★ 1,239+2최근 7일 스타 변화 - #28★ 959+1최근 7일 스타 변화
- #29★ 955+60최근 7일 스타 변화
- #30
AI 기술의 바다를 항해하는 커뮤니티의 길잡이가 되어 줄 'AI-Compass'. 초보자와 숙련된 개발자 모두 AI의 다양한 분야로 향하는 경로를 찾을 수 있습니다.
★ 933+10최근 7일 스타 변화