ai-safety
Repositórios de código aberto acompanhados marcados com ai-safety, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de ai-safety no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com ai-safety.
- #1
Arquitetura de referência para agentes de IA que propõem ações, mas não podem autorizá-las — captura de intenção imutável, um veredito de política Decionis independente (ALLOW/ESCALATE/BLOCK), aprovação humana verificada e um SafeExecutor que consome uma concessão de uso único vinculada à intenção.
★ 533 - #2
O medidor de gastos e controle de orçamento para agentes de voz de IA. Mede STT + TTS + LLM + telefonia por chamada, pronto para uso (Pipecat, LiveKit — Python & TypeScript). Interrompe bruscamente o próximo turno antes que ultrapasse o limite. Local, sem conta, sem telemetria. Construído por Floe — controles de custo para Voice AI.
★ 434
- #1
Auditoria independente de agentes de IA. Executada por humanos ou pelo próprio agente para responder à pergunta mais crucial na economia de agentes de IA: o agente está fazendo o que deveria fazer? Com o iFixAi, você obtém essa resposta em menos de 120 segundos.
★ 12.643+1.459Variação de estrelas nos últimos 7 dias - #2
Toolkit de governança para agentes de IA — aplicação de políticas, identidade zero-trust, sandbox de execução e engenharia de confiabilidade para agentes de IA autônomos. Cobre 10/10 do OWASP Agentic Top 10.
★ 6.180+51Variação de estrelas nos últimos 7 dias - #3
Uma plataforma full-stack de Red Teaming para IA que protege ecossistemas de IA por meio de varredura de agentes, habilidades, MCP, infraestrutura de IA e avaliação de jailbreak de LLM.
★ 6.117+128Variação de estrelas nos últimos 7 dias - #4
Uma lista curada de recursos incríveis sobre aprendizado de máquina responsável.
★ 4.065+5Variação de estrelas nos últimos 7 dias - #5
Guardrails focados em segurança para operações de nuvem e Kubernetes impulsionadas por IA
★ 1.921+85Variação de estrelas nos últimos 7 dias - #6
Safe RLHF: Alinhamento de valor restrito via Aprendizado por Reforço Seguro a partir de Feedback Humano
★ 1.613+2Variação de estrelas nos últimos 7 dias - #7
Um guardrail para agentes de codificação de IA — um hook de CLI que bloqueia comandos destrutivos de git e sistema de arquivos, além de acesso a arquivos secretos antes da execução. Suporta Amp Code, Antigravity CLI, Claude Code, Codex, Copilot CLI, Cursor, Gemini CLI, Hermes Agent, Kimi Code, OpenClaw, OpenCode e Pi.
★ 1.521+13Variação de estrelas nos últimos 7 dias - #8★ 1.430+1Variação de estrelas nos últimos 7 dias
- #9
[JMLR 2026] "UQLM: Um pacote Python para quantificação de incerteza em grandes modelos de linguagem"
★ 1.194+2Variação de estrelas nos últimos 7 dias - #10
CLI oficial para muapi.ai — gere imagens, vídeos e áudio a partir do terminal. Servidor MCP, 14 modelos de IA, instalável via npm e pip.
★ 1.049+0Variação de estrelas nos últimos 7 dias - #11
O Agentlens é uma plataforma de negociação de agentes confiável. Aqui, você pode encontrar rapidamente o Agente que atende às suas necessidades e também publicar seu próprio Agente para transformá-lo em seu ativo digital. Encorajamos todos a transformar suas áreas de expertise em Agentes e convertê-los em ativos digitais, permitindo que outros vejam seus pontos fortes exclusivos.
★ 1.035+0Variação de estrelas nos últimos 7 dias - #12
Um repositório de recursos para machine unlearning em grandes modelos de linguagem
★ 623+0Variação de estrelas nos últimos 7 dias - #13
Colaboração em sandbox para equipes multiagentes: um fórum de mensagens baseado em Git, onde cada agente é isolado em sua própria sandbox descartável. Transforme um repositório Git em um fórum de mensagens seguro para agentes de IA.
★ 623+60Variação de estrelas nos últimos 7 dias - #14★ 559+0Variação de estrelas nos últimos 7 dias
- #15
Mede quão bem agentes de CLI como Claude Code ou Codex CLI conseguem pós-treinar LLMs base em uma única GPU H100 em 10 horas
★ 546+12Variação de estrelas nos últimos 7 dias - #16
Arquitetura de referência para agentes de IA que propõem ações, mas não podem autorizá-las — captura de intenção imutável, um veredito de política Decionis independente (ALLOW/ESCALATE/BLOCK), aprovação humana verificada e um SafeExecutor que consome uma concessão de uso único vinculada à intenção.
★ 533+2Variação de estrelas nos últimos 7 dias - #17
PromptInject é um framework que monta prompts de forma modular para fornecer uma análise quantitativa da robustez de LLMs contra ataques de prompt adversarial. 🏆 Prêmio de Melhor Artigo no NeurIPS ML Safety Workshop 2022
★ 522+1Variação de estrelas nos últimos 7 dias - #18
The action firewall for AI agents. Enforce policy and human approval before risky tool calls, shell commands, workflows, and production changes, with auditable evidence.
★ 501—Variação de estrelas nos últimos 7 dias