Chuyển tới nội dung chính
buildradar
Sign in

RobustNLP/CipherChat

@RobustNLP

Một framework để đánh giá khả năng tổng quát hóa của việc căn chỉnh an toàn (safety alignment) cho các mô hình ngôn ngữ lớn (LLM).

Sao
629
Fork
67
Ngôn ngữ
Python
Giấy phép
MIT
Push gần nhất
11 tháng trước
Pythonsecurityllmlarge-language-modelschatgptalignmentjailbreakgpt-4-0613

Chưa có intel liên quan

Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.