grpo
Các kho mã nguồn mở đang theo dõi được gắn thẻ grpo, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng grpo trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ grpo.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Sử dụng PEFT hoặc Full-parameter cho CPT/SFT/DPO/GRPO hơn 600 LLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) và hơn 300 MLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).
★ 15.488+88Thay đổi số sao trong 7 ngày qua - #2
Thư viện mã nguồn mở toàn diện gồm các kỹ năng nghiên cứu và kỹ thuật AI cho bất kỳ mô hình AI nào. Đóng gói các kỹ năng và tác nhân claude code/codex/gemini của bạn sẽ trở thành một tác nhân nghiên cứu AI với công suất tối đa. Được duy trì bởi Orchestra Research.
★ 12.256+104Thay đổi số sao trong 7 ngày qua - #3
Agent Reinforcement Trainer: huấn luyện các agent nhiều bước cho các tác vụ thực tế bằng GRPO. Cung cấp đào tạo tại chỗ cho các agent của bạn. Học tăng cường (Reinforcement learning) cho Qwen3.6, GPT-OSS, Llama và nhiều mô hình khác!
★ 10.689+10Thay đổi số sao trong 7 ngày qua - #4
https://adongwanai.github.io/AgentGuide | Hướng dẫn phát triển AI Agent | Thực chiến LangGraph | RAG nâng cao | Chuyển ngành LLM | Phỏng vấn LLM | Kỹ sư thuật toán | Ngân hàng câu hỏi phỏng vấn | Học tăng cường | Tổng hợp dữ liệu
★ 9.116+169Thay đổi số sao trong 7 ngày qua - #5★ 6.018+4Thay đổi số sao trong 7 ngày qua
- #6
OpenClaw-RL: Huấn luyện bất kỳ tác nhân nào chỉ bằng cách trò chuyện.
★ 5.665+7Thay đổi số sao trong 7 ngày qua - #7
Triển khai một LLM suy luận bằng PyTorch từ đầu, từng bước một.
★ 5.138+49Thay đổi số sao trong 7 ngày qua - #8
🚀 Chương trình giảng dạy thực hành mã nguồn mở thu hẹp khoảng cách từ các khái niệm RL cơ bản đến căn chỉnh LLM, RLVR và các hệ thống Agentic nâng cao.
★ 4.199+54Thay đổi số sao trong 7 ngày qua - #9
Skywork-R1V là dòng mô hình AI đa phương thức nâng cao do Skywork AI phát triển, chuyên về lập luận thị giác-ngôn ngữ.
★ 3.168+0Thay đổi số sao trong 7 ngày qua - #10
verl-agent là một phần mở rộng của veRL, được thiết kế để huấn luyện các LLM/VLM agent thông qua RL. verl-agent cũng là mã nguồn chính thức cho bài báo "Group-in-Group Policy Optimization for LLM Agent Training"
★ 2.274+17Thay đổi số sao trong 7 ngày qua - #11★ 1.177+0Thay đổi số sao trong 7 ngày qua
- #12
Stack cải tiến liên tục dành cho Agent. Dữ liệu môi trường và các bài đánh giá của chúng tôi hỗ trợ cải thiện và giám sát agent.
★ 1.060+2Thay đổi số sao trong 7 ngày qua - #13★ 959+60Thay đổi số sao trong 7 ngày qua
- #14
🌾 OAT: Khung nghiên cứu thân thiện cho việc căn chỉnh trực tuyến LLM, bao gồm học tăng cường, học ưu tiên, v.v.
★ 669-1Thay đổi số sao trong 7 ngày qua - #15
[NeurIPS 2025] AutoVLA: Mô hình Vision-Language-Action cho lái xe tự động end-to-end với khả năng suy luận thích ứng và tinh chỉnh bằng học tăng cường.
★ 640+6Thay đổi số sao trong 7 ngày qua - #16
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL mã nguồn mở cho LLM và các kịch bản tác nhân.
★ 632+9Thay đổi số sao trong 7 ngày qua - #17
Khám phá "Khoảnh khắc Aha" đa phương thức trên mô hình 2B
★ 623+0Thay đổi số sao trong 7 ngày qua - #18
Một công cụ học tăng cường bất đồng bộ cho đào tạo hậu kỳ đa phương thức ở quy mô lớn
★ 591+10Thay đổi số sao trong 7 ngày qua - #19
Danh sách các bài báo nghiên cứu về học tăng cường cho tạo video
★ 591+1Thay đổi số sao trong 7 ngày qua - #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—Thay đổi số sao trong 7 ngày qua