reinforcement-learning
Các kho mã nguồn mở đang theo dõi được gắn thẻ reinforcement-learning, sắp xếp theo số sao.
- #151
ReSearch: Học suy luận với tìm kiếm cho LLM thông qua Reinforcement Learning & ReCall: Học suy luận với gọi công cụ cho LLM thông qua Reinforcement Learning
★ 1.432+1Thay đổi số sao trong 7 ngày qua - #152
Các thuật toán ngắn gọn và đẹp mắt được viết bằng Julia
★ 1.426+0Thay đổi số sao trong 7 ngày qua - #153
Danh sách tổng hợp các tài nguyên học tăng cường dựa trên mô hình tuyệt vời (được cập nhật liên tục)
★ 1.393+0Thay đổi số sao trong 7 ngày qua - #154★ 1.385+2Thay đổi số sao trong 7 ngày qua
- #155
Mèo robot có thể lập trình và linh hoạt cao dành cho giáo dục STEM và các dịch vụ tích hợp AI.
★ 1.372+1Thay đổi số sao trong 7 ngày qua - #156★ 1.367+1Thay đổi số sao trong 7 ngày qua
- #157
Framework Deep Reinforcement Learning mô-đun trong PyTorch. Thư viện đi kèm của cuốn sách "Foundations of Deep Reinforcement Learning".
★ 1.362+0Thay đổi số sao trong 7 ngày qua - #158
Học tăng cường sâu cho điều hướng robot di động trong trình mô phỏng ROS Gazebo. Sử dụng mạng nơ-ron Twin Delayed Deep Deterministic Policy Gradient (TD3), robot học cách di chuyển đến một điểm đích ngẫu nhiên trong môi trường mô phỏng đồng thời tránh các chướng ngại vật.
★ 1.362+2Thay đổi số sao trong 7 ngày qua - #159
Bản cài đặt bằng PyTorch của Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet..
★ 1.359+1Thay đổi số sao trong 7 ngày qua - #160
Hệ sinh thái sống động nơi các AI agent hoàn thành nhiệm vụ thông qua các vòng lặp quy trình làm việc, cải thiện thông qua thực thi lặp đi lặp lại, được đánh giá bởi các agent cố vấn hoặc con người trong vòng lặp, và biến công việc đã hoàn thành thành kinh nghiệm làm việc và dữ liệu có thể tái sử dụng để cải thiện các agent trong tương lai.
★ 1.334+0Thay đổi số sao trong 7 ngày qua - #161
Các triển khai Deep Q Learning (DQN & DDQN) tối giản trong Keras
★ 1.329+1Thay đổi số sao trong 7 ngày qua - #162
Định dạng chuẩn cho các tập dữ liệu học tăng cường ngoại tuyến (offline reinforcement learning), đi kèm các tập dữ liệu tham chiếu phổ biến và các tiện ích liên quan
★ 1.294+3Thay đổi số sao trong 7 ngày qua - #163
Ghi chú đọc tài liệu về Deep Learning và Machine Learning
★ 1.270+0Thay đổi số sao trong 7 ngày qua - #164
Một bản cài đặt PPO đơn giản và có phong cách. Dựa trên chuỗi bài viết trên Medium của tôi: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8.
★ 1.269+1Thay đổi số sao trong 7 ngày qua - #165
Nghiên cứu RL trên thiết bị Android.
★ 1.240+0Thay đổi số sao trong 7 ngày qua - #166
Tạo các tập hợp nhân tố cổ phiếu alpha (dự đoán) dạng công thức thông qua học tăng cường.
★ 1.213+8Thay đổi số sao trong 7 ngày qua - #167
Đào tạo robot hình người di chuyển bằng Học tăng cường
★ 1.210+3Thay đổi số sao trong 7 ngày qua - #168
Ghi chú bài giảng, bài tập hướng dẫn kèm theo lời giải cũng như video trực tuyến cho khóa học học tăng cường do Đại học Paderborn tổ chức
★ 1.192+1Thay đổi số sao trong 7 ngày qua - #169★ 1.188+0Thay đổi số sao trong 7 ngày qua
- #170★ 1.177+0Thay đổi số sao trong 7 ngày qua
- #171★ 1.155+7Thay đổi số sao trong 7 ngày qua
- #172
Đánh giá và tái tạo các chính sách điều khiển robot trong thế giới thực (ví dụ: RT-1, RT-1-X, Octo) trong mô phỏng với các thiết lập phổ biến (ví dụ: Google Robot, WidowX+Bridge) (CoRL 2024)
★ 1.153+3Thay đổi số sao trong 7 ngày qua - #173
JMLR: OmniSafe là một framework cơ sở hạ tầng nhằm đẩy nhanh nghiên cứu về SafeRL.
★ 1.150+1Thay đổi số sao trong 7 ngày qua - #174
Thư viện tính toán tiến hóa tiên tiến được xây dựng trực tiếp trên PyTorch, tạo bởi NNAISENSE.
★ 1.144+1Thay đổi số sao trong 7 ngày qua - #175★ 1.134+0Thay đổi số sao trong 7 ngày qua
- #176
Học cách làm cho máy học để bạn không phải vật lộn lập trình chúng; Danh sách cuối cùng
★ 1.128+0Thay đổi số sao trong 7 ngày qua - #177
Một trình mô phỏng robot hạng nhẹ dựa trên Python được thiết kế cho việc điều hướng, điều khiển và học tập
★ 1.125+6Thay đổi số sao trong 7 ngày qua - #178
Embedding kỹ năng đối kháng để huấn luyện bộ điều khiển có thể tái sử dụng cho nhân vật giả lập vật lý.
★ 1.121+3Thay đổi số sao trong 7 ngày qua - #179★ 1.117+5Thay đổi số sao trong 7 ngày qua
- #180
Chúng tôi giới thiệu bộ dữ liệu Suy luận Lô-gic Âm thanh (ALR), bao gồm 6.446 mẫu được chú thích văn bản-âm thanh được thiết kế đặc biệt cho các tác vụ suy luận phức tạp. Dựa trên tài nguyên này, chúng tôi đề xuất SoundMind, một thuật toán học tăng cường (RL) dựa trên quy tắc được điều chỉnh để trang bị cho các mô hình ngôn ngữ âm thanh (ALM) khả năng suy luận hai phương thức sâu sắc.
★ 1.113+0Thay đổi số sao trong 7 ngày qua