reinforcement-learning
Các kho mã nguồn mở đang theo dõi được gắn thẻ reinforcement-learning, sắp xếp theo số sao.
- #271
Kho lưu trữ này tập hợp một số mã nguồn đóng gói các thuật toán thường dùng trong lĩnh vực học máy. Hầu hết dựa trên Numpy, Pandas hoặc Torch. Bạn có thể đào sâu hiểu biết về các mô hình và thuật toán liên quan hoặc sửa đổi để tạo mã tùy chỉnh của riêng mình bằng cách tham khảo kho lưu trữ này.
★ 635+0Thay đổi số sao trong 7 ngày qua - #272★ 633+0Thay đổi số sao trong 7 ngày qua
- #273
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL mã nguồn mở cho LLM và các kịch bản tác nhân.
★ 632+9Thay đổi số sao trong 7 ngày qua - #274
API để chạy VirtualHome, một trình mô phỏng hộ gia đình đa tác nhân (Multi-Agent Household Simulator).
★ 632+2Thay đổi số sao trong 7 ngày qua - #275★ 631+0Thay đổi số sao trong 7 ngày qua
- #276★ 629—Thay đổi số sao trong 7 ngày qua
- #277
Triển khai dự án walk-these-ways trên Unitree Go2.
★ 623+3Thay đổi số sao trong 7 ngày qua - #278
Khám phá "Khoảnh khắc Aha" đa phương thức trên mô hình 2B
★ 623+0Thay đổi số sao trong 7 ngày qua - #279
Đã được xuất bản trên Nature Machine Intelligence! Robot thực tế (quadrotor) đầu tiên dựa trên huấn luyện vật lý có thể tính đạo hàm.
★ 614+7Thay đổi số sao trong 7 ngày qua - #280
Ghi chú khóa học Machine Learning Spring 2021 của Giáo sư Lý Hoành Nghị (Li Hung-yi) tại Đại học Quốc gia Đài Loan (NTU).
★ 602+2Thay đổi số sao trong 7 ngày qua - #281
[ICLR 2026] ReCogDrive: Khung nhận thức tăng cường cho lái xe tự động đầu cuối
★ 599+4Thay đổi số sao trong 7 ngày qua - #282
Các bài báo liên quan đến học tăng cường, bao gồm các bài báo kinh điển và mới nhất tại các hội nghị hàng đầu.
★ 595+0Thay đổi số sao trong 7 ngày qua - #283
Các bài báo AAAI 2024: Khám phá bộ sưu tập toàn diện các bài nghiên cứu sáng tạo được trình bày tại một trong những hội nghị hàng đầu về trí tuệ nhân tạo. Tích hợp mã nguồn để hiểu rõ hơn. Trải nghiệm sự tiến bộ vượt bậc trong trí tuệ nhân tạo với kho lưu trữ này!
★ 592+1Thay đổi số sao trong 7 ngày qua - #284
Danh sách các bài báo nghiên cứu về học tăng cường cho tạo video
★ 591+1Thay đổi số sao trong 7 ngày qua - #285
Một công cụ học tăng cường bất đồng bộ cho đào tạo hậu kỳ đa phương thức ở quy mô lớn
★ 591+10Thay đổi số sao trong 7 ngày qua - #286
[ICML 2026] Tài nguyên chính thức của "Graph-R1: Hướng tới khung GraphRAG tác tử thông qua học tăng cường đầu cuối".
★ 591+1Thay đổi số sao trong 7 ngày qua - #287★ 585+0Thay đổi số sao trong 7 ngày qua
- #288
NeurIPS 2023: Safety-Gymnasium: Một chuẩn đánh giá học tăng cường an toàn thống nhất
★ 580+1Thay đổi số sao trong 7 ngày qua - #289★ 577+1Thay đổi số sao trong 7 ngày qua
- #290
Triển khai RLHF (Học tăng cường từ phản hồi của con người) của ChatGPT trên bất kỳ mô hình tạo nào trong thư viện transformer của Hugging Face (blommz-176B/bloom/gpt/bart/T5/MetaICL).
★ 564+0Thay đổi số sao trong 7 ngày qua - #291
Học tăng cường sâu (PPO) trong lái xe tự động (Carla) [từ đầu]
★ 563-1Thay đổi số sao trong 7 ngày qua - #292
Meta Agents Research Environments là một nền tảng toàn diện được thiết kế để đánh giá các tác nhân AI trong các tình huống thực tế và năng động. Không giống như các tiêu chuẩn tĩnh, nền tảng này giới thiệu các môi trường phát triển nơi các tác nhân phải điều chỉnh chiến lược khi có thông tin mới, phản ánh các thách thức trong thế giới thực.
★ 550+3Thay đổi số sao trong 7 ngày qua - #293
Danh sách tổng hợp các tài nguyên trí tuệ nhân tạo (Khóa học, Công cụ, Ứng dụng, Dự án mã nguồn mở)
★ 548-1Thay đổi số sao trong 7 ngày qua - #294
[NeurIPS 2025 Spotlight] Bộ công cụ hậu đào tạo LLM — bao gồm ReasonFlux, ReasonFlux-PRM và ReasonFlux-Coder
★ 542+0Thay đổi số sao trong 7 ngày qua - #295★ 537+2Thay đổi số sao trong 7 ngày qua
- #296
UMI on Legs: Hiện thực hóa các chính sách thao tác di động với bộ điều khiển toàn thân tập trung vào thao tác
★ 537+3Thay đổi số sao trong 7 ngày qua - #297
Danh sách các khóa học kỹ thuật học máy công khai từ CalTech, Columbia, Berkeley, MIT và Stanford.
★ 536+0Thay đổi số sao trong 7 ngày qua - #298
Triển khai các thuật toán học tăng cường đa mục tiêu.
★ 533+1Thay đổi số sao trong 7 ngày qua - #299
[CVPR 2025 Highlight] InterMimic: Hướng tới điều khiển toàn thân phổ quát cho các tương tác người-vật dựa trên vật lý.
★ 528+1Thay đổi số sao trong 7 ngày qua - #300
Trình mô phỏng đa năng, linh hoạt và dễ sử dụng cùng với môi trường giao dịch OpenAI Gym cho nền tảng MetaTrader 5 (Được OpenAI Gym phê duyệt)
★ 524+0Thay đổi số sao trong 7 ngày qua