원클릭으로
server-management
服务器管理原则与决策方法。涵盖进程管理、监控策略与扩缩容判断。强调思维方式,而非死记命令。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
服务器管理原则与决策方法。涵盖进程管理、监控策略与扩缩容判断。强调思维方式,而非死记命令。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
务实的编码标准—— 简洁、直接、不做过度设计、不写无用注释(Pragmatic coding standards)
性能分析原则。测量、分析与优化技术。
API design principles and decision-making(API 设计原则与决策逻辑)。REST vs GraphQL vs tRPC selection(选择)、response formats(响应格式)、versioning(版本控制)、pagination(分页)。
App Builder(应用构建编排器)主编排器。根据自然语言请求创建全栈应用,确定项目类型、选择技术栈并协调智能体。
Project scaffolding templates(项目脚手架模板)。用于从零创建新项目。包含 12 个技术栈模板。
Architectural decision-making framework(架构决策框架)。Requirements analysis(需求分析)、trade-off evaluation(权衡评估)、ADR documentation(架构决策记录)。Use when making architecture decisions or analyzing system design(用于架构决策与系统设计分析)。
| name | server-management |
| description | 服务器管理原则与决策方法。涵盖进程管理、监控策略与扩缩容判断。强调思维方式,而非死记命令。 |
| allowed-tools | Read, Write, Edit, Glob, Grep, Bash |
面向生产运维的服务器管理原则。
学习如何思考,不是背命令。
| 场景 | 工具 |
|---|---|
| Node.js 应用 | PM2(集群 clustering、重载 reload) |
| 任意应用 | systemd(Linux 原生) |
| 容器 | Docker/Podman |
| 编排 | Kubernetes, Docker Swarm |
| 目标 | 含义 |
|---|---|
| 崩溃后重启(Restart on crash) | 自动恢复(Auto-recovery) |
| 零停机重载(Zero-downtime reload) | 服务不中断 |
| 集群(Clustering) | 用满 CPU 多核 |
| 持久化(Persistence) | 服务器重启后仍可恢复 |
| 类别 | 关键指标 |
|---|---|
| 可用性(Availability) | 在线率(Uptime)、健康检查 |
| 性能(Performance) | 响应时间、吞吐量 |
| 错误(Errors) | 错误率、错误类型 |
| 资源(Resources) | CPU、内存、磁盘 |
| 级别 | 响应 |
|---|---|
| Critical(严重) | 立即处理 |
| Warning(警告) | 尽快排查 |
| Info(信息) | 每日审查 |
| 需求 | 可选工具 |
|---|---|
| 简单/免费 | PM2 metrics, htop |
| 全链路可观测 | Grafana, Datadog |
| 错误追踪 | Sentry |
| 在线率监控 | UptimeRobot, Pingdom |
| 日志类型 | 用途 |
|---|---|
| 应用日志(Application logs) | 调试、审计 |
| 访问日志(Access logs) | 流量分析 |
| 错误日志(Error logs) | 问题发现 |
| 症状 | 应对 |
|---|---|
| CPU 持续高负载 | 增加实例(水平扩展 horizontal) |
| 内存持续高占用 | 增加 RAM 或修复内存泄漏 |
| 响应变慢 | 先做性能分析(Profile)再扩容 |
| 流量突增 | 自动扩缩容(Auto-scaling) |
| 类型 | 适用场景 |
|---|---|
| 垂直扩展(Vertical) | 快速止血、单实例场景 |
| 水平扩展(Horizontal) | 长期可持续、分布式场景 |
| 自动扩缩容(Auto) | 流量波动明显 |
| 检查项 | 含义 |
|---|---|
| HTTP 200 | 服务可响应 |
| 数据库已连接 | 数据可访问 |
| 依赖可用 | 外部服务可达 |
| 资源正常 | CPU/内存未耗尽 |
| 领域 | 原则 |
|---|---|
| 访问控制(Access) | 仅用 SSH key,禁用口令登录 |
| 防火墙(Firewall) | 只开放必要端口 |
| 更新(Updates) | 定期打安全补丁 |
| 密钥管理(Secrets) | 放环境变量,不落地文件 |
| 审计(Audit) | 记录访问与变更 |
当系统异常时按顺序排查:
| [FAIL] 不要这样做 | [OK] 推荐做法 |
|---|---|
| 以 root 身份直接运行服务 | 使用非 root 账号运行 |
| 忽略日志管理 | 配置日志轮转 |
| 不做监控 | 从第一天就接入监控 |
| 手工重启服务 | 配置自动重启 |
| 没有备份策略 | 制定并执行定期备份 |
牢记: 管得好的服务器应当“平平无奇”。这正是目标。