rl
Các kho mã nguồn mở đang theo dõi được gắn thẻ rl, sắp xếp theo số sao.
- #31
MobileGym: Nền tảng mô phỏng có thể kiểm chứng và song song hóa cao cho nghiên cứu tác nhân GUI di động · Trình mô phỏng Android chạy trên trình duyệt · Đánh giá có thể kiểm chứng · Đào tạo RL trực tuyến có khả năng mở rộng
★ 786+10Thay đổi số sao trong 7 ngày qua - #32
Gói đóng góp cho Stable-Baselines3 - Mã học tăng cường (RL) thử nghiệm
★ 736+5Thay đổi số sao trong 7 ngày qua - #33
Danh sách các bài báo nghiên cứu về tìm kiếm cây Monte Carlo kèm theo các bản triển khai
★ 715+1Thay đổi số sao trong 7 ngày qua - #34
Nền tảng nghiên cứu AI cho học tăng cường từ hình ảnh toàn cảnh thực tế.
★ 713+1Thay đổi số sao trong 7 ngày qua - #35
Kho lưu trữ chính thức cho DR Tulu: Học tăng cường với các Rubric tiến hóa cho Nghiên cứu chuyên sâu.
★ 704+4Thay đổi số sao trong 7 ngày qua - #36
Triển khai các thuật toán Học tăng cường nghịch đảo (IRL) trong Python/Tensorflow. Deep MaxEnt, MaxEnt, LPIRL
★ 681+2Thay đổi số sao trong 7 ngày qua - #37
Trình mô phỏng Hearthstone sử dụng C++ kết hợp học tăng cường
★ 680+1Thay đổi số sao trong 7 ngày qua - #38
BenchMARL là một thư viện để đánh giá hiệu năng Học tăng cường đa tác nhân (MARL). BenchMARL cho phép so sánh nhanh các thuật toán, tác vụ và mô hình MARL khác nhau dựa trên hai nguyên tắc cốt lõi: khả năng tái lập và tiêu chuẩn hóa.
★ 656+2Thay đổi số sao trong 7 ngày qua - #39
Những tiến bộ mới nhất về suy luận chuỗi tư duy dài (Long Chain-of-Thought).
★ 647-1Thay đổi số sao trong 7 ngày qua - #40
[NeurIPS 2022] 🛒WebShop: Hướng tới tương tác web thực tế có thể mở rộng với các Grounded Language Agent
★ 589+3Thay đổi số sao trong 7 ngày qua - #41
Triển khai ROS2-Control cho robot bốn chân, bao gồm sim2real
★ 567+4Thay đổi số sao trong 7 ngày qua - #42
Meta Agents Research Environments là một nền tảng toàn diện được thiết kế để đánh giá các tác nhân AI trong các tình huống thực tế và năng động. Không giống như các tiêu chuẩn tĩnh, nền tảng này giới thiệu các môi trường phát triển nơi các tác nhân phải điều chỉnh chiến lược khi có thông tin mới, phản ánh các thách thức trong thế giới thực.
★ 551+4Thay đổi số sao trong 7 ngày qua - #43
Triển khai các thuật toán học tăng cường đa mục tiêu.
★ 533+1Thay đổi số sao trong 7 ngày qua - #44
DeepThinkVLA: Nâng cao khả năng suy luận của các mô hình Vision-Language-Action
★ 528+0Thay đổi số sao trong 7 ngày qua - #45★ 506+1Thay đổi số sao trong 7 ngày qua
- #46
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Thay đổi số sao trong 7 ngày qua