Skip to main content

ai-red-teaming

Run structured AI red team exercises for jailbreak resistance, data exfiltration risk, harmful output controls, and agent tool abuse resilience.

インストールへ移動

ソース情報

リポジトリ
Njones17/AI-agent-master-cyber-skills-list
ソースの最終更新活動
2026年3月6日 16:13
検出された SKILL.md の言語
英語
スター
23
フォーク
6

インストール方法

デフォルトでは、最初にソースを確認する Prompt が選択されています。直接コマンドに切り替えるか、ローカルコピーをダウンロードすることもできます。

ソースファイルを確認

インストールを決める前に、SKILL.md と SkillsMP に表示されている付属ファイルをお読みください。

SKILL.md を表示中

SKILL.md
ソースの指示 · 読み取り専用プレビュー
name
ai-red-teaming
description
Run structured AI red team exercises for jailbreak resistance, data exfiltration risk, harmful output controls, and agent tool abuse resilience.
license
MIT
metadata
{"author":"devops-skills","version":"1.0"}
# AI Red Teaming Continuously test AI applications like an adversary to discover exploitable failure modes before attackers do. ## Program Design - Define threat scenarios: jailbreaks, policy evasion, prompt injection, model abuse. - Build reusable attack suites by domain (support bot, coding agent, RAG assistant). - Include multilingual and obfuscated attack prompts. - Track results in a risk register with severity and exploitability. ## Test Categories 1. **Jailbreak robustness**: bypassing safety instructions. 2. **Data exfiltration**: extracting secrets, system prompts, tenant data. 3. **Tool abuse**: unauthorized API calls or command execution. 4. **Social engineering**: inducing unsafe business actions. 5. **Availability abuse**: token amplification and DoS-style prompts. ## Exercise Cadence - Pre-release blocking red-team gate. - Monthly deep-dive campaigns. - Post-incident targeted retests. ## Scoring Model - Likelihood (1-5) - Impact (1-5) - Detectability (1-5) - Control maturity (low/medium/high) Use scores to prioritize fixes and define SLA for remediation. ## Reporting Essentials - Reproducible prompt traces - Model/version and config used - Successful attack chain narrative - Recommended mitigations + verification steps ## Related Skills - [agent-evals](../../../devops/ai/agent-evals/) - Convert findings into regression tests - [prompt-injection-defense](../prompt-injection-defense/) - Implement injection countermeasures - [penetration-testing](../../operations/penetration-testing/) - Broader offensive security process
GitHubで見る