본문으로 건너뛰기
buildradar
Sign in
토픽 · reinforcement-learning-from-human-feedback

reinforcement-learning-from-human-feedback

reinforcement-learning-from-human-feedback 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
3
총 스타
12,426
평균 스타
4,142
비중
0.00%

같은 리포지토리에 reinforcement-learning-from-human-feedback 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 reinforcement-learning-from-human-feedback 태그가 달린 리포지토리예요.

최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.

  • OpenRLHF@OpenRLHF

    Ray를 기반으로 하는 사용하기 쉽고 확장 가능하며 고성능인 에이전틱 RL 프레임워크 (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & 비동기 RL)

    9,969+9최근 7일 스타 변화
  • safe-rlhf@PKU-Alignment

    Safe RLHF: 안전한 인간 피드백 기반 강화 학습을 통한 제약된 가치 정렬

    1,613+1최근 7일 스타 변화
  • alpaca_farm@tatsu-lab

    RLHF 및 대안을 위한 시뮬레이션 프레임워크. 사람의 데이터 수집 없이 RLHF 방법론을 개발하세요.

    844-1최근 7일 스타 변화
← 토픽 목록으로