토픽 · rlhf
rlhf
rlhf 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
리포지토리 44개
- #31★ 909-1최근 7일 스타 변화
- #32★ 820+14최근 7일 스타 변화
- #33
대형 언어 모델의 온폴리시 증류(OPD)를 위한 논문, 기술 보고서, 프레임워크 및 도구 모음
★ 794+31최근 7일 스타 변화 - #34
RewardBench: 보상 모델을 위한 최초의 평가 도구입니다.
★ 735+2최근 7일 스타 변화 - #35
Trinity-RFT는 거대 언어 모델(LLM)의 강화 미세 조정(RFT)을 위해 설계된 범용적이고 유연하며 확장 가능한 프레임워크입니다.
★ 698+2최근 7일 스타 변화 - #36★ 669-1최근 7일 스타 변화
- #37
RLAnything (ICML 2026) 및 AutoTool (ICML 2026), DemyAgent: LLM 및 에이전트 시나리오를 위한 오픈소스 강화학습
★ 634+9최근 7일 스타 변화 - #38
LLM의 쉽고 효율적인 미세 조정 (Llama, Llama2, Llama3, Qwen, Baichuan, GLM, Falcon 지원). 대형 모델의 고효율 양자화 훈련 및 배포
★ 621+0최근 7일 스타 변화 - #39★ 592+11최근 7일 스타 변화
- #40★ 589+0최근 7일 스타 변화
- #41
Hugging Face transformers의 모든 생성 모델(bloomz-176B/bloom/gpt/bart/T5/MetaICL)에 ChatGPT RLHF(인간 피드백 기반 강화학습) 구현
★ 564+0최근 7일 스타 변화 - #42
온라인 RLHF 및 온라인 반복 DPO를 위한 레시피
★ 544+0최근 7일 스타 변화 - #43
대규모 언어 모델(LLM)을 위한 On-Policy Distillation 관련 논문 및 리소스 모음
★ 535+10최근 7일 스타 변화 - #44★ 520+1최근 7일 스타 변화