토픽 · reinforcement-learning-from-human-feedback
reinforcement-learning-from-human-feedback
reinforcement-learning-from-human-feedback 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
리포지토리
3
총 스타
12,426
평균 스타
4,142
비중
0.00%
관련 토픽
같은 리포지토리에 reinforcement-learning-from-human-feedback 태그와 자주 함께 쓰이는 토픽이에요.
최근 라이징
최근 90일 안에 만들어지고 reinforcement-learning-from-human-feedback 태그가 달린 리포지토리예요.
최근 90일 안에 이 토픽 태그가 달린 새 리포지토리가 없어요.
- #1
Ray를 기반으로 하는 사용하기 쉽고 확장 가능하며 고성능인 에이전틱 RL 프레임워크 (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & 비동기 RL)
★ 9,969+9최근 7일 스타 변화 - #2★ 1,613+1최근 7일 스타 변화
- #3
RLHF 및 대안을 위한 시뮬레이션 프레임워크. 사람의 데이터 수집 없이 RLHF 방법론을 개발하세요.
★ 844-1최근 7일 스타 변화