post-training
Các kho mã nguồn mở đang theo dõi được gắn thẻ post-training, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng post-training trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ post-training.
- #1
Hệ sinh thái sống động nơi các AI agent hoàn thành nhiệm vụ thông qua các vòng lặp quy trình làm việc, cải thiện thông qua thực thi lặp đi lặp lại, được đánh giá bởi các agent cố vấn hoặc con người trong vòng lặp, và biến công việc đã hoàn thành thành kinh nghiệm làm việc và dữ liệu có thể tái sử dụng để cải thiện các agent trong tương lai.
★ 1.333
- #1★ 4.150+128Thay đổi số sao trong 7 ngày qua
- #2
Hướng dẫn/Khảo sát/Tài liệu về Reasoning LLM tuyệt vời
★ 2.527+4Thay đổi số sao trong 7 ngày qua - #3
Mô hình ngôn ngữ lớn về sức khỏe tâm thần (LLM x Mental Health), Tiền huấn luyện & Tinh chỉnh, Bộ dữ liệu, Đánh giá, Triển khai & RAG, với các dòng mô hình InternLM / Qwen / Baichuan / DeepSeek / Mixtral / LLama / GLM
★ 1.781+3Thay đổi số sao trong 7 ngày qua - #4
Hệ sinh thái sống động nơi các AI agent hoàn thành nhiệm vụ thông qua các vòng lặp quy trình làm việc, cải thiện thông qua thực thi lặp đi lặp lại, được đánh giá bởi các agent cố vấn hoặc con người trong vòng lặp, và biến công việc đã hoàn thành thành kinh nghiệm làm việc và dữ liệu có thể tái sử dụng để cải thiện các agent trong tương lai.
★ 1.333-3Thay đổi số sao trong 7 ngày qua - #5
Bộ sưu tập các bài báo, báo cáo kỹ thuật, khung làm việc và công cụ được tuyển chọn cho việc chưng cất theo chính sách (OPD) của các mô hình ngôn ngữ lớn
★ 766+29Thay đổi số sao trong 7 ngày qua - #6
Mã nguồn chính thức cho Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights (ICML 2026 Spotlight)
★ 640+0Thay đổi số sao trong 7 ngày qua - #7
Khám phá "Khoảnh khắc Aha" đa phương thức trên mô hình 2B
★ 623+0Thay đổi số sao trong 7 ngày qua - #8
[ACL 2026 Oral] "LightReasoner: Các mô hình ngôn ngữ nhỏ có thể dạy các mô hình ngôn ngữ lớn cách suy luận không?"
★ 608+1Thay đổi số sao trong 7 ngày qua - #9
Một công cụ học tăng cường bất đồng bộ cho đào tạo hậu kỳ đa phương thức ở quy mô lớn
★ 582+2Thay đổi số sao trong 7 ngày qua - #10
[NeurIPS 2025 Spotlight] Bộ công cụ hậu đào tạo LLM — bao gồm ReasonFlux, ReasonFlux-PRM và ReasonFlux-Coder
★ 542-1Thay đổi số sao trong 7 ngày qua - #11
Đo lường khả năng của các CLI agent như Claude Code hoặc Codex CLI trong việc hậu huấn luyện các LLM cơ sở trên một GPU H100 trong 10 giờ
★ 541+14Thay đổi số sao trong 7 ngày qua - #12★ 533+2Thay đổi số sao trong 7 ngày qua