reinforcement-learning
Các kho mã nguồn mở đang theo dõi được gắn thẻ reinforcement-learning, sắp xếp theo số sao.
- #91
🤖 Hướng dẫn Trường hè Học máy
★ 3.033+3Thay đổi số sao trong 7 ngày qua - #92
TF-Agents: Một thư viện TensorFlow đáng tin cậy, có khả năng mở rộng và dễ sử dụng cho Contextual Bandits và Học tăng cường.
★ 3.026+0Thay đổi số sao trong 7 ngày qua - #93
Các bài báo nghiên cứu về Học sâu và Học tăng cường sâu kèm theo một số mã nguồn
★ 3.026+2Thay đổi số sao trong 7 ngày qua - #94
Isaac Lab API, được hỗ trợ bởi MuJoCo-Warp, dành cho nghiên cứu học tăng cường và robot
★ 2.960+82Thay đổi số sao trong 7 ngày qua - #95
Một cánh tay robot hình người mã nguồn mở hoàn toàn dành cho nghiên cứu AI vật lý và triển khai trong môi trường giàu tiếp xúc.
★ 2.919+23Thay đổi số sao trong 7 ngày qua - #96
Khung huấn luyện cho các agent học tăng cường Stable Baselines3, bao gồm tối ưu hóa siêu tham số và các agent được huấn luyện sẵn.
★ 2.873+1Thay đổi số sao trong 7 ngày qua - #97
Triển khai các tài liệu nghiên cứu trong 100 dòng mã.
★ 2.870+3Thay đổi số sao trong 7 ngày qua - #98
MuZero
★ 2.865+2Thay đổi số sao trong 7 ngày qua - #99
Hướng dẫn đơn giản và toàn diện về TensorFlow
★ 2.841+0Thay đổi số sao trong 7 ngày qua - #100
Một thư viện các AI agent cấp doanh nghiệp được thiết kế để dân chủ hóa trí tuệ nhân tạo và cung cấp các lựa chọn thay thế mã nguồn mở, miễn phí cho các công ty khởi nghiệp Y Combinator được định giá quá cao.
★ 2.806+7Thay đổi số sao trong 7 ngày qua - #101
Khung Agent RL cho các tác nhân LLM: học tăng cường nhiều lượt với StarPO và chẩn đoán sụt giảm lý luận
★ 2.786+6Thay đổi số sao trong 7 ngày qua - #102★ 2.657+3Thay đổi số sao trong 7 ngày qua
- #103
Khóa học PPO x Family DRL (Khóa học công khai nhập môn Trí tuệ Quyết định: 8 bài học giúp bạn hiểu rõ lý thuyết thuật toán, làm sạch logic mã nguồn và làm chủ ứng dụng AI quyết định)
★ 2.616+2Thay đổi số sao trong 7 ngày qua - #104
Các bài báo Deep Learning tuyệt vời cho Tìm kiếm, Gợi ý và Quảng cáo trong công nghiệp. Tập trung vào Embedding, Matching, Pre-Ranking, Ranking, Post Ranking, Relevance, LLM và RL. Vui lòng trích dẫn bài báo của chúng tôi "Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives" (TOIS 2026).
★ 2.589+0Thay đổi số sao trong 7 ngày qua - #105
robosuite: Một framework mô phỏng và benchmark dạng mô-đun dành cho học máy robot
★ 2.586+4Thay đổi số sao trong 7 ngày qua - #106
Hướng dẫn/Khảo sát/Tài liệu về Reasoning LLM tuyệt vời
★ 2.533+6Thay đổi số sao trong 7 ngày qua - #107
Lời giải cho Reinforcement Learning, An Introduction
★ 2.433+3Thay đổi số sao trong 7 ngày qua - #108
Một thư viện RL dạng mô-đun để tinh chỉnh các mô hình ngôn ngữ theo sở thích của con người
★ 2.395+1Thay đổi số sao trong 7 ngày qua - #109
Môi trường giao dịch OpenAI Gym đơn giản, linh hoạt và toàn diện nhất (Được phê duyệt bởi OpenAI Gym)
★ 2.387+0Thay đổi số sao trong 7 ngày qua - #110
Bản cài đặt tối giản của thuật toán Proximal Policy Optimization (PPO) với hàm mục tiêu bị cắt xén trong PyTorch
★ 2.381+6Thay đổi số sao trong 7 ngày qua - #111
ProtoMotions là một framework mô phỏng và học tập tăng tốc bằng GPU để đào tạo con người ảo và robot hình người mô phỏng vật lý.
★ 2.359+10Thay đổi số sao trong 7 ngày qua - #112
ICCV2019 - Học vẽ với Học tăng cường sâu dựa trên mô hình
★ 2.308+2Thay đổi số sao trong 7 ngày qua - #113★ 2.293+0Thay đổi số sao trong 7 ngày qua
- #114
Một bộ công cụ nhẹ gồm các phương pháp mô phỏng chuyển động để huấn luyện các bộ điều khiển.
★ 2.280+15Thay đổi số sao trong 7 ngày qua - #115
verl-agent là một phần mở rộng của veRL, được thiết kế để huấn luyện các LLM/VLM agent thông qua RL. verl-agent cũng là mã nguồn chính thức cho bài báo "Group-in-Group Policy Optimization for LLM Agent Training"
★ 2.274+17Thay đổi số sao trong 7 ngày qua - #116
Bộ sưu tập các bài báo kinh điển trong ngành và tiên tiến nhất trong lĩnh vực khuyến nghị/quảng cáo/tìm kiếm.
★ 2.188-1Thay đổi số sao trong 7 ngày qua - #117
Môi trường PyBullet Gymnasium cho học tăng cường đơn và đa tác nhân để điều khiển quadcopter
★ 2.119-2Thay đổi số sao trong 7 ngày qua - #118
[RSS 2025] "ASAP: Đồng bộ mô phỏng và vật lý thực tế để học kỹ năng toàn thân linh hoạt cho robot hình người"
★ 2.107+3Thay đổi số sao trong 7 ngày qua - #119
DIAMOND (DIffusion As a Model Of eNvironment Dreams) là một tác nhân học tăng cường được huấn luyện dựa trên mô hình thế giới khuếch tán. NeurIPS 2024 Spotlight.
★ 2.100+1Thay đổi số sao trong 7 ngày qua - #120★ 2.065+0Thay đổi số sao trong 7 ngày qua