ReCite: Agentic Reasoning for Faithful Citation
ReCite usa raciocínio de agente para melhorar citações.
Tudo o que o radar captou de arXiv cs.AI / cs.CL / cs.LG, do mais novo ao mais antigo.
ReCite usa raciocínio de agente para melhorar citações.
Grafos procedurais evoluem estruturas para guiar LLM.
Comportamento coletivo de agentes IA em wiki é explicado…
ERPO aplica RL em tempo de teste à geração de código via…
Correção especialista on-policy melhora modelos fracos com…
ExecCritic treina agentes para gerar testes e reparar…
Decodificabilidade canônica de cor revela informação…
Estabilidade de otimização invariante à escala é governada…
MeClear usa teoria dos jogos para limpar memórias nocivas…
SAEScientist-Bench avalia SAE autônoma de agentes IA…
SPINE mede a bajulação de LLM em múltiplas rodadas…
Os sumidouros de atenção e ativações massivas originam-se…
GoDeep eleva descrições de linguagem para 3D para…
Existem ótimos de cobertura de domínio no treino médio, mas…
ActReview usa refutações para treinar modelos para ações…
ToolLoop sintetiza dados de uso de ferramentas via loop…
A IA clínica Doctorina supera médicos e de ponta…
PlayTrain gera jogos JavaScript para RL eficiente…
O framework Narratives modela dados variáveis no tempo como…
Introduz vetores de tarefa sem treino para comportamento de…
A construção de auditoria afeta as descobertas de viés de…
Representações de raciocínio nem sempre ajudam a avaliar.
Rastreia distribuições de respostas de LLM para revelar…
Explora propriedade e responsabilidade em código assistido…
Difusão contínua precisa de autocorreção para restrições.
Propõe métrica de grafo de conhecimento S3KG para avaliar…
Deposon adiciona camada de dispersão auditável ao…
Aprendizado profundo informado por física reduz alarmes…
Transformers atuam como amostradores em contexto para dados.
Gander unifica percepção omni, interação em tempo real e…
Melhores checkpoints de pré-treinamento podem não ser os…
PlannerForge usa agentes LLM para testes ADS baseados em…
SQLMorph muta consultas e fornece métricas detalhadas…
Benchmark ONECYL para modelagem substituta baseada em…
SkillAdam otimiza habilidades de agentes com inspiração de…
LLMs dependem de conhecimento paramétrico em vez de…
AuK é um modelo de código aberto para geração de fala e…
Pistas atribuídas à fonte podem fazer LLMs aderirem a…
Agentes auto-evolutivos alternam estado rápido e política…
Artefatos de BatchNorm confundem a avaliação de…
Registros de decisão auditáveis melhoram deepfakes de fala…
Compara frameworks de QA multimodal, mostrando mudança para…
Benchmark em larga escala para recuperação RAG agêntica com…
Grafo de conhecimento para consultas auditáveis de…
Pontuações de benchmark de API não transferem de forma…
Agentes auto-evolutivos reduzem a lacuna de consistência no…
Estimador de forma fechada para correlação de erro de…
Simulador diferenciável lida com contato rígido em grande…
Modelo Ising-Potts para confiabilidade de pontuação…
Loops de feedback de estado hierárquicos para modelos…
Recuperação baseada em evidências para pistas de caça de…
Mede mudanças não divulgadas em estruturas de segurança de…
A representação de informações afeta eventos glicêmicos de…
Pontuações de benchmark de LLM de cibersegurança dependem…
Dataset para modelagem de vídeo-linguagem de granulação…
Busca multiagente de qualidade-diversidade para fatores…
Modelo de grafo mistura-de-especialistas para…
TTS em streaming com codec hierárquico e contexto limitado.
O agrupamento de registros controla o peso da evidência em…
SSMs e transformers diferem globalmente, mas convergem…