Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · reinforcement-learning

reinforcement-learning

Các kho mã nguồn mở đang theo dõi được gắn thẻ reinforcement-learning, sắp xếp theo số sao.

304 kho mã
  • mlimpl@vincen-github

    Kho lưu trữ này tập hợp một số mã nguồn đóng gói các thuật toán thường dùng trong lĩnh vực học máy. Hầu hết dựa trên Numpy, Pandas hoặc Torch. Bạn có thể đào sâu hiểu biết về các mô hình và thuật toán liên quan hoặc sửa đổi để tạo mã tùy chỉnh của riêng mình bằng cách tham khảo kho lưu trữ này.

    635+0Thay đổi số sao trong 7 ngày qua
  • ma-gym@koulanurag

    Bộ sưu tập các môi trường đa tác nhân dựa trên OpenAI gym.

    633+0Thay đổi số sao trong 7 ngày qua
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL mã nguồn mở cho LLM và các kịch bản tác nhân.

    632+9Thay đổi số sao trong 7 ngày qua
  • virtualhome@xavierpuigf

    API để chạy VirtualHome, một trình mô phỏng hộ gia đình đa tác nhân (Multi-Agent Household Simulator).

    632+2Thay đổi số sao trong 7 ngày qua
  • robohive@vikashplus

    Một framework thống nhất cho học máy robot

    631+0Thay đổi số sao trong 7 ngày qua
  • reef@Human-Agent-Society

    Continual learning infra for self-improving agents

    629Thay đổi số sao trong 7 ngày qua
  • Triển khai dự án walk-these-ways trên Unitree Go2.

    623+3Thay đổi số sao trong 7 ngày qua
  • VisualThinker-R1-Zero@turningpoint-ai

    Khám phá "Khoảnh khắc Aha" đa phương thức trên mô hình 2B

    623+0Thay đổi số sao trong 7 ngày qua
  • DiffPhysDrone@HenryHuYu

    Đã được xuất bản trên Nature Machine Intelligence! Robot thực tế (quadrotor) đầu tiên dựa trên huấn luyện vật lý có thể tính đạo hàm.

    614+7Thay đổi số sao trong 7 ngày qua
  • ML-2021-notes@chsiang426

    Ghi chú khóa học Machine Learning Spring 2021 của Giáo sư Lý Hoành Nghị (Li Hung-yi) tại Đại học Quốc gia Đài Loan (NTU).

    602+2Thay đổi số sao trong 7 ngày qua
  • recogdrive@xiaomi-research

    [ICLR 2026] ReCogDrive: Khung nhận thức tăng cường cho lái xe tự động đầu cuối

    599+4Thay đổi số sao trong 7 ngày qua
  • Các bài báo liên quan đến học tăng cường, bao gồm các bài báo kinh điển và mới nhất tại các hội nghị hàng đầu.

    595+0Thay đổi số sao trong 7 ngày qua
  • AAAI-2024-Papers@DmitryRyumin

    Các bài báo AAAI 2024: Khám phá bộ sưu tập toàn diện các bài nghiên cứu sáng tạo được trình bày tại một trong những hội nghị hàng đầu về trí tuệ nhân tạo. Tích hợp mã nguồn để hiểu rõ hơn. Trải nghiệm sự tiến bộ vượt bậc trong trí tuệ nhân tạo với kho lưu trữ này!

    592+1Thay đổi số sao trong 7 ngày qua
  • Danh sách các bài báo nghiên cứu về học tăng cường cho tạo video

    591+1Thay đổi số sao trong 7 ngày qua
  • Relax@redai-studio

    Một công cụ học tăng cường bất đồng bộ cho đào tạo hậu kỳ đa phương thức ở quy mô lớn

    591+10Thay đổi số sao trong 7 ngày qua
  • Graph-R1@LHRLAB

    [ICML 2026] Tài nguyên chính thức của "Graph-R1: Hướng tới khung GraphRAG tác tử thông qua học tăng cường đầu cuối".

    591+1Thay đổi số sao trong 7 ngày qua
  • crafter@danijar

    Đánh giá hiệu năng các khả năng của tác nhân (Agent)

    585+0Thay đổi số sao trong 7 ngày qua
  • safety-gymnasium@PKU-Alignment

    NeurIPS 2023: Safety-Gymnasium: Một chuẩn đánh giá học tăng cường an toàn thống nhất

    580+1Thay đổi số sao trong 7 ngày qua
  • OmniDrones@btx0424
    577+1Thay đổi số sao trong 7 ngày qua
  • TextRL@voidful

    Triển khai RLHF (Học tăng cường từ phản hồi của con người) của ChatGPT trên bất kỳ mô hình tạo nào trong thư viện transformer của Hugging Face (blommz-176B/bloom/gpt/bart/T5/MetaICL).

    564+0Thay đổi số sao trong 7 ngày qua
  • Học tăng cường sâu (PPO) trong lái xe tự động (Carla) [từ đầu]

    563-1Thay đổi số sao trong 7 ngày qua
  • Meta Agents Research Environments là một nền tảng toàn diện được thiết kế để đánh giá các tác nhân AI trong các tình huống thực tế và năng động. Không giống như các tiêu chuẩn tĩnh, nền tảng này giới thiệu các môi trường phát triển nơi các tác nhân phải điều chỉnh chiến lược khi có thông tin mới, phản ánh các thách thức trong thế giới thực.

    550+3Thay đổi số sao trong 7 ngày qua
  • awesome-ai@hades217

    Danh sách tổng hợp các tài nguyên trí tuệ nhân tạo (Khóa học, Công cụ, Ứng dụng, Dự án mã nguồn mở)

    548-1Thay đổi số sao trong 7 ngày qua
  • ReasonFlux@Gen-Verse

    [NeurIPS 2025 Spotlight] Bộ công cụ hậu đào tạo LLM — bao gồm ReasonFlux, ReasonFlux-PRM và ReasonFlux-Coder

    542+0Thay đổi số sao trong 7 ngày qua
  • flybody@TuragaLab

    Mô hình cơ thể ruồi giấm MuJoCo và các tác vụ học tăng cường (RL) về vận động.

    537+2Thay đổi số sao trong 7 ngày qua
  • umi-on-legs@real-stanford

    UMI on Legs: Hiện thực hóa các chính sách thao tác di động với bộ điều khiển toàn thân tập trung vào thao tác

    537+3Thay đổi số sao trong 7 ngày qua
  • Danh sách các khóa học kỹ thuật học máy công khai từ CalTech, Columbia, Berkeley, MIT và Stanford.

    536+0Thay đổi số sao trong 7 ngày qua
  • morl-baselines@LucasAlegre

    Triển khai các thuật toán học tăng cường đa mục tiêu.

    533+1Thay đổi số sao trong 7 ngày qua
  • InterMimic@Sirui-Xu

    [CVPR 2025 Highlight] InterMimic: Hướng tới điều khiển toàn thân phổ quát cho các tương tác người-vật dựa trên vật lý.

    528+1Thay đổi số sao trong 7 ngày qua
  • gym-mtsim@AminHP

    Trình mô phỏng đa năng, linh hoạt và dễ sử dụng cùng với môi trường giao dịch OpenAI Gym cho nền tảng MetaTrader 5 (Được OpenAI Gym phê duyệt)

    524+0Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề