Chuyển tới nội dung chính
buildradar
Sign in

voidful/TextRL

@voidful

Triển khai RLHF (Học tăng cường từ phản hồi của con người) của ChatGPT trên bất kỳ mô hình tạo nào trong thư viện transformer của Hugging Face (blommz-176B/bloom/gpt/bart/T5/MetaICL).

Sao
564
Fork
61
Ngôn ngữ
Python
Giấy phép
MIT
Push gần nhất
4 tháng trước
Pythonlanguage-modelpytorchchatgptreinforcement-learningnlpgpt-3rlhfgpt-2controlled-nlgnlg

Chưa có intel liên quan

Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.