ai-safety
Repositorios de código abierto monitorizados etiquetados con ai-safety, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a ai-safety en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con ai-safety.
- #1
Arquitectura de referencia para agentes de IA que proponen acciones pero no pueden autorizarlas: captura de intención inmutable, veredicto de política de decisión independiente (PERMITIR/ESCALAR/BLOQUEAR), aprobación humana verificada y un SafeExecutor que consume una concesión vinculada a la intención de un solo uso.
★ 533 - #2
Medidor de gastos y control de presupuesto para agentes de voz con IA. Mide STT, TTS, LLM y telefonía por llamada (Pipecat, LiveKit — Python y TypeScript). Detiene la ejecución antes de exceder el límite establecido. Local, sin cuentas ni telemetría. Creado por Floe para el control de costes en Voice AI.
★ 434
- #1
Auditoría independiente de agentes de IA. Ejecutada por humanos o por el propio agente, para responder a la pregunta más crucial en la economía de los agentes de IA: ¿Está el agente haciendo lo que se supone que debe hacer? Con iFixAi puedes obtener esta respuesta en menos de 120 segundos.
★ 12.643+1247Variación de estrellas de los últimos 7 días - #2
Kit de herramientas de gobernanza para agentes de IA: cumplimiento de políticas, identidad de confianza cero, aislamiento de ejecución e ingeniería de confiabilidad para agentes de IA autónomos. Cubre el 10/10 de OWASP Agentic Top 10.
★ 6180+32Variación de estrellas de los últimos 7 días - #3
Una plataforma de Red Teaming de IA full-stack que asegura ecosistemas de IA mediante escaneo de agentes, habilidades, MCP, infraestructura de IA y evaluación de jailbreak de LLM.
★ 6117+59Variación de estrellas de los últimos 7 días - #4
Una lista seleccionada de recursos increíbles sobre machine learning responsable.
★ 4065+2Variación de estrellas de los últimos 7 días - #5★ 1921+48Variación de estrellas de los últimos 7 días
- #6
Safe RLHF: Alineación de valores restringida mediante aprendizaje por refuerzo seguro a partir de retroalimentación humana
★ 1613+1Variación de estrellas de los últimos 7 días - #7
Un guardrail para agentes de codificación IA: un hook de CLI que bloquea comandos destructivos de git y del sistema de archivos, así como el acceso a archivos secretos antes de su ejecución. Compatible con Amp Code, Antigravity CLI, Claude Code, Codex, Copilot CLI, Cursor, Gemini CLI, Hermes Agent, Kimi Code, OpenClaw, OpenCode y Pi.
★ 1521+9Variación de estrellas de los últimos 7 días - #8★ 1430+0Variación de estrellas de los últimos 7 días
- #9
[JMLR 2026] "UQLM: Un paquete de Python para la cuantificación de la incertidumbre en modelos de lenguaje grandes"
★ 1194+1Variación de estrellas de los últimos 7 días - #10
CLI oficial para muapi.ai: genera imágenes, vídeos y audio desde la terminal. Servidor MCP, 14 modelos de IA, instalable vía npm y pip.
★ 1049+7Variación de estrellas de los últimos 7 días - #11
Agentlens es una plataforma de comercio de agentes de confianza. Aquí puedes encontrar rápidamente el agente que satisface tus necesidades y también publicar tu propio agente para convertirlo en tu activo digital. Animamos a todos a transformar sus áreas de experiencia en agentes y convertirlos en activos digitales, permitiendo que otros vean tus fortalezas únicas.
★ 1035+0Variación de estrellas de los últimos 7 días - #12
Colaboración en entorno aislado para equipos multi-agente: un foro de mensajes respaldado por Git donde cada agente está aislado en su propio sandbox desechable. Coordina entre máquinas sin compartir credenciales ni acceso al host.
★ 628+48Variación de estrellas de los últimos 7 días - #13
Repositorio de recursos sobre machine unlearning en modelos de lenguaje de gran tamaño
★ 623+0Variación de estrellas de los últimos 7 días - #14★ 559+0Variación de estrellas de los últimos 7 días
- #15
Medición de la capacidad de agentes CLI como Claude Code o Codex CLI para realizar post-entrenamiento de LLMs base en una sola GPU H100 en 10 horas
★ 548+9Variación de estrellas de los últimos 7 días - #16
Arquitectura de referencia para agentes de IA que proponen acciones pero no pueden autorizarlas: captura de intención inmutable, veredicto de política de decisión independiente (PERMITIR/ESCALAR/BLOQUEAR), aprobación humana verificada y un SafeExecutor que consume una concesión vinculada a la intención de un solo uso.
★ 533+3Variación de estrellas de los últimos 7 días - #17
PromptInject es un marco que ensambla prompts de forma modular para proporcionar un análisis cuantitativo de la robustez de los LLM frente a ataques adversarios. 🏆 Premio al mejor artículo en el NeurIPS ML Safety Workshop 2022
★ 522+2Variación de estrellas de los últimos 7 días - #18
The action firewall for AI agents. Enforce policy and human approval before risky tool calls, shell commands, workflows, and production changes, with auditable evidence.
★ 502—Variación de estrellas de los últimos 7 días