reinforcement-learning
Các kho mã nguồn mở đang theo dõi được gắn thẻ reinforcement-learning, sắp xếp theo số sao.
- #241
Bộ sưu tập các bài báo gần đây về xây dựng tác nhân tự hành. Bao gồm hai chủ đề: tác nhân dựa trên RL và tác nhân dựa trên LLM.
★ 760+3Thay đổi số sao trong 7 ngày qua - #242
Các môi trường Gymnasium đa mục tiêu cho học tăng cường
★ 760-1Thay đổi số sao trong 7 ngày qua - #243★ 737+2Thay đổi số sao trong 7 ngày qua
- #244
Gói đóng góp cho Stable-Baselines3 - Mã học tăng cường (RL) thử nghiệm
★ 736+5Thay đổi số sao trong 7 ngày qua - #245★ 730+1Thay đổi số sao trong 7 ngày qua
- #246
Đây là dự án về thuật toán tránh chướng ngại vật tự động dựa trên học tăng cường sâu cho UAV.
★ 730+0Thay đổi số sao trong 7 ngày qua - #247
Mã nguồn đi kèm cho ấn phẩm Nature "Discovering State-of-the-art Reinforcement Algorithms".
★ 729+2Thay đổi số sao trong 7 ngày qua - #248
Các triển khai thuật toán Học tăng cường (Reinforcement Learning) và Lập kế hoạch (Planning)
★ 726-1Thay đổi số sao trong 7 ngày qua - #249
Danh sách các tài nguyên học tập về Reinforcement Learning (RL) chất lượng (được cập nhật liên tục)
★ 723+0Thay đổi số sao trong 7 ngày qua - #250
Công cụ poker dành cho phát triển AI poker bằng Python
★ 723+1Thay đổi số sao trong 7 ngày qua - #251
Môi trường poker OpenAI gym cho Texas holdem với học tăng cường dựa trên keras-rl. Bao gồm kết xuất ảo và montecarlo để tính toán equity.
★ 722+1Thay đổi số sao trong 7 ngày qua - #252
Mã nguồn cho bài báo "Tối ưu hóa giảm tải tính toán cho điện toán biên di động hỗ trợ UAV: Phương pháp Deep Deterministic Policy Gradient".
★ 722+1Thay đổi số sao trong 7 ngày qua - #253
[COLM’25] DeepRetrieval — Huấn luyện Search Agent bằng RLVR với kết quả truy xuất.
★ 719+2Thay đổi số sao trong 7 ngày qua - #254
Danh sách các bài báo nghiên cứu về tìm kiếm cây Monte Carlo kèm theo các bản triển khai
★ 715+1Thay đổi số sao trong 7 ngày qua - #255
Nền tảng nghiên cứu AI cho học tăng cường từ hình ảnh toàn cảnh thực tế.
★ 713+1Thay đổi số sao trong 7 ngày qua - #256
Học tăng cường với điều khiển dự báo mô hình (Model Predictive Control)
★ 710+1Thay đổi số sao trong 7 ngày qua - #257
Bộ sưu tập Frontend và khảo sát các bài báo, mô hình về vision-language. Cập nhật liên tục.
★ 708+3Thay đổi số sao trong 7 ngày qua - #258
Các thuật toán MARL đã được tinh chỉnh trên SMAC (tỷ lệ thắng 100% trong hầu hết các kịch bản)
★ 708-1Thay đổi số sao trong 7 ngày qua - #259
ns3-gym - Sân chơi cho học tăng cường (Reinforcement Learning) trong nghiên cứu mạng.
★ 694+2Thay đổi số sao trong 7 ngày qua - #260
Một khung thống nhất giúp học tăng cường dễ dàng trong các mô hình Flow-Matching
★ 692+9Thay đổi số sao trong 7 ngày qua - #261
Triển khai các thuật toán Học tăng cường nghịch đảo (IRL) trong Python/Tensorflow. Deep MaxEnt, MaxEnt, LPIRL
★ 681+2Thay đổi số sao trong 7 ngày qua - #262
Trình mô phỏng Hearthstone sử dụng C++ kết hợp học tăng cường
★ 680+1Thay đổi số sao trong 7 ngày qua - #263
Một framework C++ cho MDP và POMDP với các liên kết Python
★ 671+1Thay đổi số sao trong 7 ngày qua - #264
BenchMARL là một thư viện để đánh giá hiệu năng Học tăng cường đa tác nhân (MARL). BenchMARL cho phép so sánh nhanh các thuật toán, tác vụ và mô hình MARL khác nhau dựa trên hai nguyên tắc cốt lõi: khả năng tái lập và tiêu chuẩn hóa.
★ 659+2Thay đổi số sao trong 7 ngày qua - #265
Thư viện PyTorch để xây dựng các tác nhân học tăng cường sâu
★ 657+0Thay đổi số sao trong 7 ngày qua - #266
Vòng đời hoàn chỉnh của một dự án khoa học dữ liệu
★ 653+0Thay đổi số sao trong 7 ngày qua - #267
Một gói học tăng cường (reinforcement learning) dành cho Julia.
★ 652-1Thay đổi số sao trong 7 ngày qua - #268
Những tiến bộ mới nhất về suy luận chuỗi tư duy dài (Long Chain-of-Thought).
★ 647-1Thay đổi số sao trong 7 ngày qua - #269★ 644+4Thay đổi số sao trong 7 ngày qua
- #270
Trang dự án cho "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement".
★ 640+0Thay đổi số sao trong 7 ngày qua