| name | app-and-automation |
| description | 应用界面与自动化操作中枢。 |
应用界面与自动化操作 (App and Automation)
模块定位
本模块是处理应用层交互与业务流自动化的顶层入口。当任务目标超出单纯的后台数据读写,需要介入操作系统的图形用户界面(GUI)、操控第三方应用软件(如浏览器、办公软件客户端)、或在特定平台上执行具象化操作(如发布内容、发送消息)时,应进入此模块。
任务路由与子 Skill 分发
在执行自动化任务前,需根据目标操作的抽象层级和依赖环境进行路由分发:
- 底层无头脚本:对于无 GUI 依赖的基础系统级指令,直接在当前层级调用基础工具(如
exec_command)执行 shell 或 Python 脚本即可。
- 图形界面与外设模拟:当任务要求强制模拟人类物理操作(如鼠标相对坐标点击、键盘特定快捷键输入、屏幕元素视觉定位 OCR)时,必须调用专属的图形界面控制子 Skill。
- 特定平台与软件工作流:针对高度结构化的应用操作场景(如网页端自动发帖、客户端邮件批量发送、自动化测试流程),应优先调用封装好的特定子 Skill,以保证执行的稳定性和接口的可靠性。
默认自动化执行能力
若在当前顶层通过基础工具编写临时自动化脚本,需遵循以下规范:
- 环境探测:在操作第三方应用前,必须先探明环境状态(如检查进程是否存在、特定端口是否被占用)。
- 进程生命周期管理:调起外部应用程序后,需明确是长期驻留后台还是执行完毕后销毁,避免系统资源泄漏。
执行纪律
- 状态前置校验:严禁在“盲态”下执行自动化操作。所有 GUI 交互或 API 调用前,必须获取当前界面状态或确认登录/授权凭证有效,确保操作目标客观存在。
- 高危操作阻断机制:任何涉及数据不可逆删除、公开内容发布(发帖/回复)、资金变动的操作,必须严格遵循任务下达时的权限要求。在不能确保 100% 安全的前提下,必须中止流程并向上游申请二次确认,禁止静默强行通过。
- 幂等性与容错要求:自动化流程极易因不可控的网络延迟或界面卡顿导致中断。执行逻辑应尽量具备幂等性(重复执行结果一致)。若遇到超时或异常弹窗阻塞,必须立刻捕获错误并汇报原因,严禁执行引擎陷入无限等待。
- 验证与闭环反馈:操作动作下发不等于操作成功。必须通过获取执行后的状态码、读取目标平台最新数据或验证界面元素变化,以证明操作已切实生效,随后方可生成最终结果报告。