| name | castai-reference-architecture |
| description | CAST AI reference architecture for multi-cluster Kubernetes cost optimization.
Use when designing CAST AI deployment across environments, planning
Terraform module structure, or establishing team standards.
Trigger with phrases like "cast ai architecture", "cast ai best practices",
"cast ai multi-cluster", "cast ai terraform structure".
|
| allowed-tools | Read, Write, Edit, Grep |
| version | 1.4.0 |
| license | MIT |
| author | Jeremy Longshore <jeremy@intentsolutions.io> |
| tags | ["saas","kubernetes","cost-optimization","castai"] |
| compatibility | Designed for Claude Code |
CAST AI Reference Architecture
Overview
Production-grade architecture for managing CAST AI across multiple Kubernetes clusters. Covers Terraform module layout, per-environment policies, API key management, and observability integration.
Prerequisites
- Multiple Kubernetes clusters (dev, staging, production)
- Terraform for infrastructure management
- Centralized secrets management
- Monitoring stack (Prometheus, Grafana, or Datadog)
Terraform Module Structure
infrastructure/
โโโ modules/
โ โโโ castai-cluster/
โ โโโ main.tf # CAST AI provider resources
โ โโโ variables.tf # Cluster-specific inputs
โ โโโ outputs.tf # Cluster ID, savings metrics
โ โโโ policies.tf # Autoscaler policy configuration
โ โโโ node-templates.tf # Node template definitions
โ โโโ security.tf # Kvisor, RBAC
โโโ environments/
โ โโโ dev/
โ โ โโโ main.tf # Dev cluster onboarding
โ โ โโโ terraform.tfvars # Dev-specific values
โ โ โโโ backend.tf # State storage
โ โโโ staging/
โ โ โโโ main.tf
โ โ โโโ terraform.tfvars
โ โ โโโ backend.tf
โ โโโ prod/
โ โโโ main.tf
โ โโโ terraform.tfvars
โ โโโ backend.tf
โโโ shared/
โโโ api-keys.tf # Key management
โโโ monitoring.tf # Alerting rules
Reusable Module
# modules/castai-cluster/main.tf
variable "cluster_name" { type = string }
variable "cluster_id" { type = string }
variable "environment" { type = string }
variable "api_token" { type = string; sensitive = true }
variable "provider_type" { type = string } # eks, gke, aks
variable "max_cpu_cores" { type = number; default = 100 }
variable "spot_enabled" { type = bool; default = true }
variable "hibernation_enabled" { type = bool; default = false }
variable "evictor_aggressive" { type = bool; default = false }
resource "castai_autoscaler" "this" {
cluster_id = var.cluster_id
autoscaler_policies_json = jsonencode({
enabled = true
unschedulablePods = {
enabled = true
headroom = {
enabled = true
cpuPercentage = var.environment == "prod" ? 15 : 5
memoryPercentage = var.environment == "prod" ? 15 : 5
}
}
nodeDownscaler = {
enabled = true
emptyNodes = {
enabled = true
delaySeconds = var.environment == "prod" ? 300 : 60
}
}
spotInstances = {
enabled = var.spot_enabled
spotDiversityEnabled = true
}
clusterLimits = {
enabled = true
cpu = { minCores = 2, maxCores = var.max_cpu_cores }
}
})
}
resource "castai_node_template" "default_spot" {
cluster_id = var.cluster_id
name = "${var.environment}-spot-workers"
is_enabled = var.spot_enabled
constraints {
spot = true
use_spot_fallbacks = true
architectures = ["amd64"]
}
}