| name | input-output-guardrails |
| version | 2.0.0 |
| description | Implementing safety filters, content moderation, and guardrails for AI system inputs and outputs |
| sasmp_version | 1.3.0 |
| bonded_agent | 05-defense-strategy-developer |
| bond_type | SECONDARY_BOND |
| input_schema | {"type":"object","required":["guardrail_type"],"properties":{"guardrail_type":{"type":"string","enum":["input","output","both"]},"strictness":{"type":"string","enum":["permissive","balanced","strict"],"default":"balanced"}}} |
| output_schema | {"type":"object","properties":{"blocked_requests":{"type":"integer"},"filtered_outputs":{"type":"integer"},"false_positive_rate":{"type":"number"}}} |
| owasp_llm_2025 | ["LLM01","LLM02","LLM05","LLM07"] |
| nist_ai_rmf | ["Manage"] |
Input/Output Guardrails
Implement multi-layer safety systems to filter malicious inputs and harmful outputs.
Quick Reference
Skill: input-output-guardrails
Agent: 05-defense-strategy-developer
OWASP: LLM01 (Injection), LLM02 (Disclosure), LLM05 (Output), LLM07 (Leakage)
NIST: Manage
Use Case: Production safety filtering
Guardrail Architecture
User Input → [Input Guardrails] → [AI Model] → [Output Guardrails] → Response
↓ ↓
[Blocked/Modified] [Blocked/Modified]
↓ ↓
[Fallback Response] [Safe Alternative]
Input Guardrails
1. Injection Detection
Category: prompt_injection
Latency: <10ms
Block Rate: 95%+
class InputGuardrails:
INJECTION_PATTERNS = [
r'ignore\s+(previous|prior|all)\s+(instructions?|guidelines?)',
r'you\s+are\s+(now|an?)\s+(unrestricted|evil)',
r'(developer|admin|debug)\s+mode',
r'bypass\s+(safety|security|filter)',
r'pretend\s+(you|to)\s+(are|be)',
r'what\s+(is|are)\s+your\s+(instructions?|prompt)',
]
def ():
.patterns = [re.(p, re.I) p .INJECTION_PATTERNS]
.max_length = config.get(, )
.pii_detector = PIIDetector()
() -> [, ]:
(user_input) > .max_length:
,
user_input.strip():
,
pattern .patterns:
pattern.search(user_input):
,
.pii_detector.contains_pii(user_input):
, .pii_detector.redact(user_input)
, user_input