rlhf
Các kho mã nguồn mở đang theo dõi được gắn thẻ rlhf, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng rlhf trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ rlhf.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Tinh chỉnh hiệu quả thống nhất cho hơn 100 LLM & VLM (ACL 2024)
★ 74.532+89Thay đổi số sao trong 7 ngày qua - #2
OpenAssistant là trợ lý ảo dựa trên trò chuyện, hiểu các tác vụ, có thể tương tác với hệ thống bên thứ ba và truy xuất thông tin động để thực hiện.
★ 37.401-7Thay đổi số sao trong 7 ngày qua - #3
Trang GitHub chính thức cho bài báo khảo sát "A Survey of Large Language Models".
★ 12.208+2Thay đổi số sao trong 7 ngày qua - #4
Bản phát hành chính thức của dòng InternLM (InternLM, InternLM2, InternLM2.5, InternLM3).
★ 7.277+4Thay đổi số sao trong 7 ngày qua - #5
Dự án mô hình lớn Chinese LLaMA-2 & Alpaca-2 giai đoạn 2 + mô hình ngữ cảnh siêu dài 64K
★ 7.120+0Thay đổi số sao trong 7 ngày qua - #6
Các công thức mạnh mẽ để căn chỉnh các mô hình ngôn ngữ với sở thích của con người và AI
★ 5.670-3Thay đổi số sao trong 7 ngày qua - #7
OpenClaw-RL: Huấn luyện bất kỳ tác nhân nào chỉ bằng cách trò chuyện.
★ 5.665+7Thay đổi số sao trong 7 ngày qua - #8
Môi trường nghiên cứu mã nguồn mở dành cho các nhà nghiên cứu AI để đào tạo, đánh giá và mở rộng quy mô mô hình một cách liền mạch từ phần cứng cục bộ đến cụm GPU.
★ 5.185+3Thay đổi số sao trong 7 ngày qua - #9
Triển khai một LLM suy luận bằng PyTorch từ đầu, từng bước một.
★ 5.138+49Thay đổi số sao trong 7 ngày qua - #10
Argilla là công cụ cộng tác dành cho các kỹ sư AI và chuyên gia lĩnh vực để xây dựng tập dữ liệu chất lượng cao
★ 5.093+5Thay đổi số sao trong 7 ngày qua - #11
Xây dựng, Đánh giá và Tối ưu hóa các Hệ thống AI. Bao gồm đánh giá, RAG, tác nhân, fine-tuning, tạo dữ liệu tổng hợp, quản lý tập dữ liệu, MCP và nhiều tính năng khác.
★ 5.042+5Thay đổi số sao trong 7 ngày qua - #12
Align Anything: Huấn luyện mô hình đa phương thức với phản hồi
★ 4.671+3Thay đổi số sao trong 7 ngày qua - #13
Danh sách tài nguyên học tăng cường có phản hồi từ con người được tuyển chọn (cập nhật liên tục)
★ 4.424+2Thay đổi số sao trong 7 ngày qua - #14
🚀 Chương trình giảng dạy thực hành mã nguồn mở thu hẹp khoảng cách từ các khái niệm RL cơ bản đến căn chỉnh LLM, RLVR và các hệ thống Agentic nâng cao.
★ 4.199+54Thay đổi số sao trong 7 ngày qua - #15★ 3.485-1Thay đổi số sao trong 7 ngày qua
- #16
Distilabel là một framework dành cho dữ liệu tổng hợp và phản hồi AI dành cho các kỹ sư cần các đường ống (pipeline) nhanh, đáng tin cậy và có khả năng mở rộng dựa trên các bài báo nghiên cứu đã được kiểm chứng.
★ 3.384+3Thay đổi số sao trong 7 ngày qua - #17
Thư viện mở rộng hiệu quả và thân thiện với người dùng cho Học tăng cường với các Large Language Model
★ 3.380+6Thay đổi số sao trong 7 ngày qua - #18
LeetCode cho PyTorch — 65 bài toán phỏng vấn ML/AI từ các buổi phỏng vấn thực tế tại Google, Meta, Anthropic. Bao gồm Jupyter notebook, hệ thống tự động chấm điểm và gia sư AI MCP.
★ 2.461+12Thay đổi số sao trong 7 ngày qua - #19★ 2.357+11Thay đổi số sao trong 7 ngày qua
- #20
Trình đánh giá tự động cho các mô hình ngôn ngữ tuân theo hướng dẫn. Được xác thực bởi con người, chất lượng cao, chi phí rẻ và nhanh chóng.
★ 2.012-1Thay đổi số sao trong 7 ngày qua - #21
Danh sách tổng hợp tuyệt vời cho Agentic RL
★ 1.832+29Thay đổi số sao trong 7 ngày qua - #22
[NeurIPS 2023] ImageReward: Học và Đánh giá Sở thích của Con người đối với Tạo ảnh từ văn bản
★ 1.703+1Thay đổi số sao trong 7 ngày qua - #23
Safe RLHF: Căn chỉnh giá trị có ràng buộc thông qua Học tăng cường an toàn từ phản hồi của con người
★ 1.613+1Thay đổi số sao trong 7 ngày qua - #24★ 1.601-1Thay đổi số sao trong 7 ngày qua
- #25
Công thức huấn luyện mô hình phần thưởng (reward model) cho RLHF.
★ 1.541+0Thay đổi số sao trong 7 ngày qua - #26★ 1.430+0Thay đổi số sao trong 7 ngày qua
- #27
Xtreme1 là nền tảng gán nhãn và chú thích dữ liệu tất cả trong một dành cho huấn luyện dữ liệu đa phương thức, hỗ trợ đám mây điểm 3D LiDAR, hình ảnh và LLM.
★ 1.239+2Thay đổi số sao trong 7 ngày qua - #28
[NeurIPS 2024] SimPO: Tối ưu hóa sở thích đơn giản với phần thưởng không cần tham chiếu
★ 959+1Thay đổi số sao trong 7 ngày qua - #29★ 955+60Thay đổi số sao trong 7 ngày qua
- #30
“AI-Compass” sẽ định hướng cho cộng đồng khi điều hướng trong đại dương công nghệ AI, dù bạn là người mới bắt đầu hay nhà phát triển nâng cao, bạn đều có thể tìm thấy con đường dẫn đến các hướng đi lớn của AI tại đây. Nhằm giúp nhà phát triển hiểu một cách có hệ thống các khái niệm cốt lõi, công nghệ chủ đạo, xu hướng biên giới của AI, và nắm vững toàn bộ quá trình từ lý thuyết đến thực tiễn thông qua thực hành.
★ 933+10Thay đổi số sao trong 7 ngày qua