ai-safety
Dépôts open source suivis étiquetés ai-safety, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de ai-safety sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés ai-safety.
- #1
Architecture de référence pour agents IA proposant des actions sans autorisation directe : capture d'intention immuable, verdict de politique de décision indépendant (AUTORISER/ESCALADER/BLOQUER), approbation humaine vérifiée et SafeExecutor consommant une autorisation liée à une intention à usage unique.
★ 533 - #2
Compteur de dépenses et limiteur de budget pour agents vocaux IA. Mesure le STT, TTS, LLM et la téléphonie par appel (Pipecat, LiveKit — Python & TypeScript). Bloque les requêtes avant de dépasser votre plafond. Local, sans compte, sans télémétrie. Créé par Floe — contrôle des coûts pour l'IA vocale.
★ 434
- #1
Audit indépendant d'agents IA. Exécuté par un humain ou par l'agent lui-même pour répondre à la question cruciale de l'économie des agents IA : l'agent fait-il ce qu'il est censé faire ? Avec iFixAi, obtenez cette réponse en moins de 120 secondes.
★ 12 643+1 247Évolution des étoiles sur les 7 derniers jours - #2
Boîte à outils de gouvernance pour agents IA : application de politiques, identité zéro confiance, bac à sable d'exécution et ingénierie de fiabilité. Couvre les 10 points du classement OWASP Agentic Top 10.
★ 6 180+32Évolution des étoiles sur les 7 derniers jours - #3
Une plateforme complète de Red Teaming pour l'IA, sécurisant les écosystèmes d'IA via l'analyse d'agents, de compétences, de MCP, d'infrastructures IA et l'évaluation de jailbreak LLM.
★ 6 117+59Évolution des étoiles sur les 7 derniers jours - #4
Une liste organisée de ressources exceptionnelles sur l'apprentissage automatique responsable.
★ 4 065+2Évolution des étoiles sur les 7 derniers jours - #5
Gardes-fous axés sur la sécurité pour les opérations cloud et Kubernetes pilotées par l'IA.
★ 1 921+48Évolution des étoiles sur les 7 derniers jours - #6
Safe RLHF : Alignement de valeur contraint via l'apprentissage par renforcement sécurisé à partir de la rétroaction humaine
★ 1 613+1Évolution des étoiles sur les 7 derniers jours - #7
Un garde-fou pour agent de codage IA — un hook CLI qui bloque les commandes git et système de fichiers destructrices ainsi que l'accès aux fichiers secrets avant leur exécution. Prend en charge Amp Code, Antigravity CLI, Claude Code, Codex, Copilot CLI, Cursor, Gemini CLI, Hermes Agent, Kimi Code, OpenClaw, OpenCode et Pi.
★ 1 521+9Évolution des étoiles sur les 7 derniers jours - #8★ 1 430+0Évolution des étoiles sur les 7 derniers jours
- #9
[JMLR 2026] « UQLM : un package Python pour la quantification de l'incertitude dans les grands modèles de langage ».
★ 1 194+1Évolution des étoiles sur les 7 derniers jours - #10
CLI officiel pour muapi.ai — générez des images, vidéos et audios depuis le terminal. Serveur MCP, 14 modèles d'IA, installable via npm et pip.
★ 1 061+19Évolution des étoiles sur les 7 derniers jours - #11
Agentlens est une plateforme de trading d'agents de confiance. Vous pouvez y trouver rapidement l'agent qui répond à vos besoins et publier le vôtre pour en faire un actif numérique. Nous encourageons chacun à transformer ses domaines d'expertise en agents et en actifs numériques, permettant aux autres de découvrir vos forces uniques.
★ 1 034-1Évolution des étoiles sur les 7 derniers jours - #12
Collaboration en bac à sable pour équipes multi-agents : un forum de discussion basé sur Git, où chaque agent est isolé dans son propre environnement éphémère. Transformez un dépôt Git en un forum sécurisé pour agents IA.
★ 628+53Évolution des étoiles sur les 7 derniers jours - #13
Un dépôt de ressources pour le désapprentissage automatique dans les grands modèles de langage
★ 623+0Évolution des étoiles sur les 7 derniers jours - #14★ 559+0Évolution des étoiles sur les 7 derniers jours
- #15
Mesurer la capacité des agents CLI tels que Claude Code ou Codex CLI à effectuer le post-entraînement de LLMs de base sur un seul GPU H100 en 10 heures
★ 548+11Évolution des étoiles sur les 7 derniers jours - #16
Architecture de référence pour agents IA proposant des actions sans autorisation directe : capture d'intention immuable, verdict de politique de décision indépendant (AUTORISER/ESCALADER/BLOQUER), approbation humaine vérifiée et SafeExecutor consommant une autorisation liée à une intention à usage unique.
★ 533+3Évolution des étoiles sur les 7 derniers jours - #17
PromptInject est un framework modulaire d'assemblage de prompts permettant une analyse quantitative de la robustesse des LLM face aux attaques par injection. 🏆 Prix du meilleur article au NeurIPS ML Safety Workshop 2022.
★ 522+2Évolution des étoiles sur les 7 derniers jours - #18
The action firewall for AI agents. Enforce policy and human approval before risky tool calls, shell commands, workflows, and production changes, with auditable evidence.
★ 502—Évolution des étoiles sur les 7 derniers jours