Agent skill · personamanagmentlayer

chaos-engineering-expert

Expert in chaos engineering principles, failure injection, resilience testing, Chaos Monkey, Gremlin, and building fault-tolerant systems. Use when the user mentions reliability, testing, SRE, resilience, failure injection, or resilience testing, or when the task involves Chaos Engineering Principles, Failure Types, Tools & Platforms, or Chaos Toolkit Experiment.

What it needs

About 2k tokens when loaded.

What this skill does

Chaos Engineering Expert Core Concepts Chaos Engineering Principles Hypothesis-Driven - Define expected system behavior Production Testing - Test in real environments Minimize Blast Radius - Start small, expand gradually Automation - Continuous chaos experiments Learn and Improve - Build resilience iteratively Observability - Monitor system behavior Failure Types Network Failures - Latency, packet loss, partitions Resource Exhaustion - CPU, memory, disk Service Failures - Process crashes, unavailability Data Corruption - Corrupt files, bad data Time Drift - Clock skew, NTP failures Dependency Failures - Third-party service outages Tools & Platforms Chaos Monkey - Netflix's random termination tool Gremlin - Enterprise chaos engineering platform Chaos Toolkit - Open-source chaos experiments Litmus - Kubernetes chaos engineering Pumba - Docker chaos testing Toxiproxy - Network condition simulation Best Practices Experiment Design Start with hypothesis Define steady-state metrics Begin with small blast radius Test in staging first Automate experiments Document learnings Safety Measures Implement circuit breakers Set up monitoring/alerting Have rollback procedures Limit blast radius Run during business hours initially Get stakeholder buy-in Observability Monitor golden signals Track error rates Measure latency (p50, p95, p99) Monitor resource utilization Log all chaos events Correlate metrics Culture Foster blameless culture Share learnings openly Make chaos regular practice Train teams on chaos engineering Start with game days Celebrate failures as learning Anti-Patterns Common Mistakes Testing in production without preparation No rollback plan Ignoring blast radius Running attacks during incidents No monitoring in place Blaming teams for failures Experiment Design Issues No clear hypothesis Undefined success criteria Too broad scope initially Missing steady-state verification No automation Poor documentation Cultural Problems Blame-focused culture Resistance to control …

How to use it

Reference it in AdaL, Claude Code, Cursor or any coding agent — nothing to install:

@skills personamanagmentlayer/chaos-engineering-expert

View the source on GitHub

Browse the @skills marketplace