ワンクリックで
server-management
服务器管理原则与决策方法。涵盖进程管理、监控策略与扩缩容判断。强调思维方式,而非死记命令。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
服务器管理原则与决策方法。涵盖进程管理、监控策略与扩缩容判断。强调思维方式,而非死记命令。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
SOC 職業分類に基づく
务实的编码标准—— 简洁、直接、不做过度设计、不写无用注释(Pragmatic coding standards)
性能分析原则。测量、分析与优化技术。
API design principles and decision-making(API 设计原则与决策逻辑)。REST vs GraphQL vs tRPC selection(选择)、response formats(响应格式)、versioning(版本控制)、pagination(分页)。
App Builder(应用构建编排器)主编排器。根据自然语言请求创建全栈应用,确定项目类型、选择技术栈并协调智能体。
Project scaffolding templates(项目脚手架模板)。用于从零创建新项目。包含 12 个技术栈模板。
Architectural decision-making framework(架构决策框架)。Requirements analysis(需求分析)、trade-off evaluation(权衡评估)、ADR documentation(架构决策记录)。Use when making architecture decisions or analyzing system design(用于架构决策与系统设计分析)。
| name | server-management |
| description | 服务器管理原则与决策方法。涵盖进程管理、监控策略与扩缩容判断。强调思维方式,而非死记命令。 |
| allowed-tools | Read, Write, Edit, Glob, Grep, Bash |
面向生产运维的服务器管理原则。
学习如何思考,不是背命令。
| 场景 | 工具 |
|---|---|
| Node.js 应用 | PM2(集群 clustering、重载 reload) |
| 任意应用 | systemd(Linux 原生) |
| 容器 | Docker/Podman |
| 编排 | Kubernetes, Docker Swarm |
| 目标 | 含义 |
|---|---|
| 崩溃后重启(Restart on crash) | 自动恢复(Auto-recovery) |
| 零停机重载(Zero-downtime reload) | 服务不中断 |
| 集群(Clustering) | 用满 CPU 多核 |
| 持久化(Persistence) | 服务器重启后仍可恢复 |
| 类别 | 关键指标 |
|---|---|
| 可用性(Availability) | 在线率(Uptime)、健康检查 |
| 性能(Performance) | 响应时间、吞吐量 |
| 错误(Errors) | 错误率、错误类型 |
| 资源(Resources) | CPU、内存、磁盘 |
| 级别 | 响应 |
|---|---|
| Critical(严重) | 立即处理 |
| Warning(警告) | 尽快排查 |
| Info(信息) | 每日审查 |
| 需求 | 可选工具 |
|---|---|
| 简单/免费 | PM2 metrics, htop |
| 全链路可观测 | Grafana, Datadog |
| 错误追踪 | Sentry |
| 在线率监控 | UptimeRobot, Pingdom |
| 日志类型 | 用途 |
|---|---|
| 应用日志(Application logs) | 调试、审计 |
| 访问日志(Access logs) | 流量分析 |
| 错误日志(Error logs) | 问题发现 |
| 症状 | 应对 |
|---|---|
| CPU 持续高负载 | 增加实例(水平扩展 horizontal) |
| 内存持续高占用 | 增加 RAM 或修复内存泄漏 |
| 响应变慢 | 先做性能分析(Profile)再扩容 |
| 流量突增 | 自动扩缩容(Auto-scaling) |
| 类型 | 适用场景 |
|---|---|
| 垂直扩展(Vertical) | 快速止血、单实例场景 |
| 水平扩展(Horizontal) | 长期可持续、分布式场景 |
| 自动扩缩容(Auto) | 流量波动明显 |
| 检查项 | 含义 |
|---|---|
| HTTP 200 | 服务可响应 |
| 数据库已连接 | 数据可访问 |
| 依赖可用 | 外部服务可达 |
| 资源正常 | CPU/内存未耗尽 |
| 领域 | 原则 |
|---|---|
| 访问控制(Access) | 仅用 SSH key,禁用口令登录 |
| 防火墙(Firewall) | 只开放必要端口 |
| 更新(Updates) | 定期打安全补丁 |
| 密钥管理(Secrets) | 放环境变量,不落地文件 |
| 审计(Audit) | 记录访问与变更 |
当系统异常时按顺序排查:
| [FAIL] 不要这样做 | [OK] 推荐做法 |
|---|---|
| 以 root 身份直接运行服务 | 使用非 root 账号运行 |
| 忽略日志管理 | 配置日志轮转 |
| 不做监控 | 从第一天就接入监控 |
| 手工重启服务 | 配置自动重启 |
| 没有备份策略 | 制定并执行定期备份 |
牢记: 管得好的服务器应当“平平无奇”。这正是目标。