post-training
Repositórios de código aberto acompanhados marcados com post-training, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de post-training no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com post-training.
- #1
Um ecossistema vivo onde agentes de IA completam tarefas através de loops de fluxo de trabalho, melhoram por meio de execução iterativa, são avaliados por agentes mentores ou humanos, e transformam o trabalho concluído em experiência e dados reutilizáveis para aprimorar futuros agentes.
★ 1.333
- #1
Uma estrutura unificada de inferência e pós-treinamento para geração de vídeo acelerada.
★ 4.150+128Variação de estrelas nos últimos 7 dias - #2
Tutorial, levantamento e guia sobre LLMs de raciocínio
★ 2.527+4Variação de estrelas nos últimos 7 dias - #3
LLM para saúde mental, incluindo pré e pós-treinamento, conjunto de dados, avaliação, implantação e RAG, com modelos das séries InternLM, Qwen, Baichuan, DeepSeek, Mixtral, LLama e GLM
★ 1.781+3Variação de estrelas nos últimos 7 dias - #4
Um ecossistema vivo onde agentes de IA completam tarefas através de loops de fluxo de trabalho, melhoram por meio de execução iterativa, são avaliados por agentes mentores ou humanos, e transformam o trabalho concluído em experiência e dados reutilizáveis para aprimorar futuros agentes.
★ 1.333-3Variação de estrelas nos últimos 7 dias - #5
Uma coleção curada de artigos, relatórios técnicos, frameworks e ferramentas para destilação on-policy (OPD) de grandes modelos de linguagem
★ 766+29Variação de estrelas nos últimos 7 dias - #6
Código-base oficial para "Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights" (ICML 2026 Spotlight)
★ 640+0Variação de estrelas nos últimos 7 dias - #7
Explore o "Momento Aha" Multimodal em um modelo de 2B
★ 623+0Variação de estrelas nos últimos 7 dias - #8
[ACL 2026 Oral] "LightReasoner: Modelos de Linguagem Pequenos Podem Ensinar Raciocínio a Modelos de Linguagem Grandes?"
★ 608+1Variação de estrelas nos últimos 7 dias - #9
Um Motor de Aprendizado por Reforço Assíncrono para Pós-Treinamento Omni-Modal em Escala
★ 582+2Variação de estrelas nos últimos 7 dias - #10
[Destaque do NeurIPS 2025] Suite de pós-treinamento de LLM — apresentando ReasonFlux, ReasonFlux-PRM e ReasonFlux-Coder.
★ 542-1Variação de estrelas nos últimos 7 dias - #11
Mede quão bem agentes de CLI como Claude Code ou Codex CLI conseguem pós-treinar LLMs base em uma única GPU H100 em 10 horas
★ 541+14Variação de estrelas nos últimos 7 dias - #12★ 533+2Variação de estrelas nos últimos 7 dias