Saltar al contenido principal
buildradar
Sign in
Tema · ai-safety

ai-safety

Repositorios de código abierto monitorizados etiquetados con ai-safety, ordenados por estrellas.

Repositorios
18
Estrellas totales
41.106
Estrellas de media
2284
Proporción
0,00%

Temas que aparecen con frecuencia junto a ai-safety en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con ai-safety.

  • agent-safe-pipeline@decionis

    Arquitectura de referencia para agentes de IA que proponen acciones pero no pueden autorizarlas: captura de intención inmutable, veredicto de política de decisión independiente (PERMITIR/ESCALAR/BLOQUEAR), aprobación humana verificada y un SafeExecutor que consume una concesión vinculada a la intención de un solo uso.

    533
  • floe-guard@Floe-Labs

    Medidor de gastos y control de presupuesto para agentes de voz con IA. Mide STT, TTS, LLM y telefonía por llamada (Pipecat, LiveKit — Python y TypeScript). Detiene la ejecución antes de exceder el límite establecido. Local, sin cuentas ni telemetría. Creado por Floe para el control de costes en Voice AI.

    434
  • iFixAi@ifixai-ai

    Auditoría independiente de agentes de IA. Ejecutada por humanos o por el propio agente, para responder a la pregunta más crucial en la economía de los agentes de IA: ¿Está el agente haciendo lo que se supone que debe hacer? Con iFixAi puedes obtener esta respuesta en menos de 120 segundos.

    12.643+1247Variación de estrellas de los últimos 7 días
  • Kit de herramientas de gobernanza para agentes de IA: cumplimiento de políticas, identidad de confianza cero, aislamiento de ejecución e ingeniería de confiabilidad para agentes de IA autónomos. Cubre el 10/10 de OWASP Agentic Top 10.

    6180+32Variación de estrellas de los últimos 7 días
  • AI-Infra-Guard@Tencent

    Una plataforma de Red Teaming de IA full-stack que asegura ecosistemas de IA mediante escaneo de agentes, habilidades, MCP, infraestructura de IA y evaluación de jailbreak de LLM.

    6117+59Variación de estrellas de los últimos 7 días
  • Una lista seleccionada de recursos increíbles sobre machine learning responsable.

    4065+2Variación de estrellas de los últimos 7 días
  • valqore@valqore

    Barreras de seguridad para operaciones de nube y Kubernetes impulsadas por IA.

    1921+48Variación de estrellas de los últimos 7 días
  • safe-rlhf@PKU-Alignment

    Safe RLHF: Alineación de valores restringida mediante aprendizaje por refuerzo seguro a partir de retroalimentación humana

    1613+1Variación de estrellas de los últimos 7 días
  • cc-safety-net@kenryu42

    Un guardrail para agentes de codificación IA: un hook de CLI que bloquea comandos destructivos de git y del sistema de archivos, así como el acceso a archivos secretos antes de su ejecución. Compatible con Amp Code, Antigravity CLI, Claude Code, Codex, Copilot CLI, Cursor, Gemini CLI, Hermes Agent, Kimi Code, OpenClaw, OpenCode y Pi.

    1521+9Variación de estrellas de los últimos 7 días
  • MOSS-RLHF@OpenLMLab

    Secretos de RLHF en Modelos de Lenguaje Grandes Parte I: PPO

    1430+0Variación de estrellas de los últimos 7 días
  • uqlm@cvs-health

    [JMLR 2026] "UQLM: Un paquete de Python para la cuantificación de la incertidumbre en modelos de lenguaje grandes"

    1194+1Variación de estrellas de los últimos 7 días
  • CLI oficial para muapi.ai: genera imágenes, vídeos y audio desde la terminal. Servidor MCP, 14 modelos de IA, instalable vía npm y pip.

    1049+7Variación de estrellas de los últimos 7 días
  • AgentLens@ZhangJinHaHaHa

    Agentlens es una plataforma de comercio de agentes de confianza. Aquí puedes encontrar rápidamente el agente que satisface tus necesidades y también publicar tu propio agente para convertirlo en tu activo digital. Animamos a todos a transformar sus áreas de experiencia en agentes y convertirlos en activos digitales, permitiendo que otros vean tus fortalezas únicas.

    1035+0Variación de estrellas de los últimos 7 días
  • h5i@h5i-dev

    Colaboración en entorno aislado para equipos multi-agente: un foro de mensajes respaldado por Git donde cada agente está aislado en su propio sandbox desechable. Coordina entre máquinas sin compartir credenciales ni acceso al host.

    628+48Variación de estrellas de los últimos 7 días
  • Repositorio de recursos sobre machine unlearning en modelos de lenguaje de gran tamaño

    623+0Variación de estrellas de los últimos 7 días
  • langtest@PacificAI

    Entrega modelos de lenguaje seguros y efectivos

    559+0Variación de estrellas de los últimos 7 días
  • PostTrainBench@aisa-group

    Medición de la capacidad de agentes CLI como Claude Code o Codex CLI para realizar post-entrenamiento de LLMs base en una sola GPU H100 en 10 horas

    548+9Variación de estrellas de los últimos 7 días
  • agent-safe-pipeline@decionis

    Arquitectura de referencia para agentes de IA que proponen acciones pero no pueden autorizarlas: captura de intención inmutable, veredicto de política de decisión independiente (PERMITIR/ESCALAR/BLOQUEAR), aprobación humana verificada y un SafeExecutor que consume una concesión vinculada a la intención de un solo uso.

    533+3Variación de estrellas de los últimos 7 días
  • PromptInject@agencyenterprise

    PromptInject es un marco que ensambla prompts de forma modular para proporcionar un análisis cuantitativo de la robustez de los LLM frente a ataques adversarios. 🏆 Premio al mejor artículo en el NeurIPS ML Safety Workshop 2022

    522+2Variación de estrellas de los últimos 7 días
  • cordum@cordum-io

    The action firewall for AI agents. Enforce policy and human approval before risky tool calls, shell commands, workflows, and production changes, with auditable evidence.

    502Variación de estrellas de los últimos 7 días
← Volver a temas