Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · grpo

grpo

Các kho mã nguồn mở đang theo dõi được gắn thẻ grpo, sắp xếp theo số sao.

Kho mã
20
Tổng số sao
81.418
Số sao trung bình
4.071
Tỷ trọng
0,00%

Những chủ đề thường xuất hiện cùng grpo trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ grpo.

Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.

  • ms-swift@modelscope

    Sử dụng PEFT hoặc Full-parameter cho CPT/SFT/DPO/GRPO hơn 600 LLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) và hơn 300 MLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).

    15.488+88Thay đổi số sao trong 7 ngày qua
  • AI-Research-SKILLs@Orchestra-Research

    Thư viện mã nguồn mở toàn diện gồm các kỹ năng nghiên cứu và kỹ thuật AI cho bất kỳ mô hình AI nào. Đóng gói các kỹ năng và tác nhân claude code/codex/gemini của bạn sẽ trở thành một tác nhân nghiên cứu AI với công suất tối đa. Được duy trì bởi Orchestra Research.

    12.256+104Thay đổi số sao trong 7 ngày qua
  • ART@OpenPipe

    Agent Reinforcement Trainer: huấn luyện các agent nhiều bước cho các tác vụ thực tế bằng GRPO. Cung cấp đào tạo tại chỗ cho các agent của bạn. Học tăng cường (Reinforcement learning) cho Qwen3.6, GPT-OSS, Llama và nhiều mô hình khác!

    10.689+10Thay đổi số sao trong 7 ngày qua
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | Hướng dẫn phát triển AI Agent | Thực chiến LangGraph | RAG nâng cao | Chuyển ngành LLM | Phỏng vấn LLM | Kỹ sư thuật toán | Ngân hàng câu hỏi phỏng vấn | Học tăng cường | Tổng hợp dữ liệu

    9.116+169Thay đổi số sao trong 7 ngày qua
  • VLM-R1@om-ai-lab

    Giải quyết bài toán Hiểu biết Trực quan bằng các VLM có tăng cường

    6.018+4Thay đổi số sao trong 7 ngày qua
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: Huấn luyện bất kỳ tác nhân nào chỉ bằng cách trò chuyện.

    5.665+7Thay đổi số sao trong 7 ngày qua
  • reasoning-from-scratch@rasbt

    Triển khai một LLM suy luận bằng PyTorch từ đầu, từng bước một.

    5.138+49Thay đổi số sao trong 7 ngày qua
  • hands-on-modern-rl@walkinglabs

    🚀 Chương trình giảng dạy thực hành mã nguồn mở thu hẹp khoảng cách từ các khái niệm RL cơ bản đến căn chỉnh LLM, RLVR và các hệ thống Agentic nâng cao.

    4.199+54Thay đổi số sao trong 7 ngày qua
  • Skywork-R1V@SkyworkAI

    Skywork-R1V là dòng mô hình AI đa phương thức nâng cao do Skywork AI phát triển, chuyên về lập luận thị giác-ngôn ngữ.

    3.168+0Thay đổi số sao trong 7 ngày qua
  • verl-agent@langfengQ

    verl-agent là một phần mở rộng của veRL, được thiết kế để huấn luyện các LLM/VLM agent thông qua RL. verl-agent cũng là mã nguồn chính thức cho bài báo "Group-in-Group Policy Optimization for LLM Agent Training"

    2.274+17Thay đổi số sao trong 7 ngày qua
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: Mở khóa hiệu suất GRPO dựa trên Flow với Mixed ODE-SDE

    1.177+0Thay đổi số sao trong 7 ngày qua
  • judgeval@JudgmentLabs

    Stack cải tiến liên tục dành cho Agent. Dữ liệu môi trường và các bài đánh giá của chúng tôi hỗ trợ cải thiện và giám sát agent.

    1.060+2Thay đổi số sao trong 7 ngày qua
  • verl-omni@verl-project

    Khung huấn luyện RL đa phương thức cho các mô hình diffusion và omni

    959+60Thay đổi số sao trong 7 ngày qua
  • oat@sail-sg

    🌾 OAT: Khung nghiên cứu thân thiện cho việc căn chỉnh trực tuyến LLM, bao gồm học tăng cường, học ưu tiên, v.v.

    669-1Thay đổi số sao trong 7 ngày qua
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA: Mô hình Vision-Language-Action cho lái xe tự động end-to-end với khả năng suy luận thích ứng và tinh chỉnh bằng học tăng cường.

    640+6Thay đổi số sao trong 7 ngày qua
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL mã nguồn mở cho LLM và các kịch bản tác nhân.

    632+9Thay đổi số sao trong 7 ngày qua
  • VisualThinker-R1-Zero@turningpoint-ai

    Khám phá "Khoảnh khắc Aha" đa phương thức trên mô hình 2B

    623+0Thay đổi số sao trong 7 ngày qua
  • Relax@redai-studio

    Một công cụ học tăng cường bất đồng bộ cho đào tạo hậu kỳ đa phương thức ở quy mô lớn

    591+10Thay đổi số sao trong 7 ngày qua
  • Danh sách các bài báo nghiên cứu về học tăng cường cho tạo video

    591+1Thay đổi số sao trong 7 ngày qua
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề