当你要判断 Agent 变好还是变坏、选择模型、决定是否上线某项改动时使用;当需要区分"模型能力不足"还是"Harness 设计缺陷"、或需要构建回归测试和评估数据集时使用。不适用于评估环境的代码实现细节(那是工程任务),聚焦于评估方法与决策。
Quellsprache: Chinesisch
Menü
SkillsMP hat 46 Skills aus GongLingRui/agent-dev-skills gesammelt. Öffne einen Skill, um Quelle und Details zu prüfen.
Es werden 40 von 46 gesammelten Skills angezeigt.
当你要判断 Agent 变好还是变坏、选择模型、决定是否上线某项改动时使用;当需要区分"模型能力不足"还是"Harness 设计缺陷"、或需要构建回归测试和评估数据集时使用。不适用于评估环境的代码实现细节(那是工程任务),聚焦于评估方法与决策。
Quellsprache: Chinesisch
当你要为生产级 Agent 建立可观测性(追踪、监控、日志、成本追踪、问题诊断)、或把生产轨迹回流为评估资产时使用;当 Agent 出问题无法定位、成本失控、需要 A/B 测试和提示词版本管理时使用。不适用于评估指标体系设计(见 eval-metrics)。
Quellsprache: Chinesisch
当你在设计 Agent 的安全防线、接入第三方工具/MCP/不可信输入、处理提示注入、越权操作、数据外泄时使用;当需要确定"谁能对什么数据做什么"的边界时使用。不适用于单一工具的参数校验实现(见 tool-design),聚焦分层防御架构与信任边界。
Quellsprache: Chinesisch
当你在构建或改进 Coding Agent(能自主读写文件、执行命令、跑测试的 Agent)、或以开放任务为目标的通用 Agent 时使用;当需要把代码生成作为"元能力"来扩展 Agent 能力边界时使用。核心认识:通用 Agent 的核心 = Coding Agent + 文件系统。不适用于单个工具接口设计(见 tool-design)或上下文布局(见 context-engineering)。
Quellsprache: Chinesisch
当你想用代码生成能力做编程之外的事——精确思考、业务规则约束、多媒体生成(PPT/视频)、系统适配器(日志解析/RPA)、生成式 UI、Agent 自举时使用。不适用于 Coding Agent 本身的工具和流程(见 coding-workflow)。
Quellsprache: Chinesisch
当你在搭建 Coding Agent 的七个核心工具、设计五阶段工作流程、实现 Harness 保障机制、优化实现技巧(并行调用/上下文管理/状态持久化)时使用;当 Agent 写代码不可靠、跳过测试、频繁编辑失败时使用。不适用于代码作为元能力的六个方向(见 coding-meta-capability)。
Quellsprache: Chinesisch
当上下文膨胀接近窗口上限、Agent 决策质量随上下文变长而下降(上下文腐化)、或需要主动为上下文做减法时使用。核心目标:在保留决策/约束/失败/来源的前提下提高历史信息密度。不适用于静态前缀设计(见 context-kv-cache-friendly)或状态提炼注入(见 context-status-bar)。
Quellsprache: Chinesisch
当你在设计或调试 Agent 的上下文(系统提示词、工具定义、消息历史、状态注入、上下文压缩)时使用;当出现 KV Cache 命中率低、首 token 延迟高、Agent 决策随上下文变长而下降(上下文腐化)时使用。不适用于纯提示词措辞优化(见 prompt-engineering)或知识库检索调优(见 memory-rag)。
Quellsprache: Chinesisch
当你在设计系统提示词、工具定义、消息历史的布局与顺序,或排查 KV Cache/Prompt Cache 命中率低、首 token 延迟高、推理成本异常时使用。核心目标:让上下文前缀字节级稳定,最大化缓存复用。不适用于状态注入(见 context-status-bar)或为上下文做减法(见 context-compression)。
Quellsprache: Chinesisch
当 Agent 陷入循环、状态遗忘、目标偏离,或在长上下文下决策质量下降时使用;当需要让模型随时感知任务进度、工具调用计数、环境状态时使用。核心目标:把分散在上下文各处的隐式状态提炼为可直接使用的显式知识。不适用于静态提示词设计(见 prompt-engineering)或缓存布局(见 context-kv-cache-friendly)。
Quellsprache: Chinesisch
当你要让 Agent 从运行经验中自主学习、把生产轨迹转化为下一版本能力时使用;当 Agent"处理一万次相似任务第二天仍犯第一天错误"时使用。核心认识:保存经历 ≠ 从经历中学习。不适用于一次性模型训练(见 post-training)或单次上下文适应(见 context-engineering)。
Quellsprache: Chinesisch
当你在设计评估环境(工具调用型/人机交互型)和评估任务数据集、处理防泄漏、任务描述精确性、复杂度层次化、可验证性时使用。不适用于指标口径定义(见 eval-metrics)或评分方法(见 eval-llm-judge)。
Quellsprache: Chinesisch
当你要把评估结果转化为系统改进(从 Benchmark 报告定位问题、构建改进假设、做消融/AB 测试、部署决策)或搭建生产级内部评估基础设施(特性开关、提示词敏感性、隐私感知分析)时使用;当需要"观察→假设→实验→决策→迭代"的科学迭代闭环时使用。不适用于评估指标/数据集设计(见 eval-metrics / eval-dataset)。
Quellsprache: Chinesisch
当你要对开放式任务(无标准答案)自动评分、设计 Rubric、做失败归因、构建回归任务、或比较模型排名时使用;当需要判断分数差异是否真实可信(统计显著性)时使用。不适用于指标口径(见 eval-metrics)或数据集设计(见 eval-dataset)。
Quellsprache: Chinesisch
当你要定义"什么算成功"、选择评估指标口径(能力上限 vs 业务可靠性)、建立过程指标和安全鲁棒性指标时使用;当需要区分"技术奇观"与"稳定可靠"时使用。不适用于评估数据集设计(见 eval-dataset)或评分方法(见 eval-llm-judge)。
Quellsprache: Chinesisch
当你要把单次更新组织成可长期运行的进化闭环(双循环、发布/回滚、睡眠学习、安全边界)时使用;当需要区分"完成"与"进步"、防止进化退化时使用。不适用于具体更新载体选择(见 evolution-methods)。
Quellsprache: Chinesisch
当你要从运行轨迹中提炼学习信号、决定经验写到哪里(知识/指令/程序/参数)时使用;当需要把"在什么条件下应该怎样行动"沉淀为可复用能力时使用。不适用于进化闭环的发布/回滚/睡眠学习(见 evolution-loop)。
Quellsprache: Chinesisch
当 Agent 陷入死循环、反复重试同一失败、静默卡死、工具调用失败后无法自恢复、或单点故障导致任务中断时使用;当需要设计错误处理、重试策略、熔断与降级时使用。不适用于工具的日常设计(见 tool-design),聚焦运行期故障的检测、恢复与终止。
Quellsprache: Chinesisch
当你要实现 Harness 的约束(限定能做什么)、验证(检查做得对不对)、纠正(做错怎么补救)三层保障机制时使用;当 Agent"能做事"但"不做错事"没保障时使用。不适用于编排模式选择(见 orchestration)或故障恢复(见 fault-recovery)。
Quellsprache: Chinesisch
当你在搭建模型外围的运行与治理层(约束、验证、纠正、故障恢复、回退)时使用;当 Agent"能做事"但"不可靠做事"——频繁幻觉、选错工具、越权、无法自恢复、过早声称完成时使用。不适用于单个工具的描述设计(见 tool-design),也不适用于提示词措辞(见 prompt-engineering)。
Quellsprache: Chinesisch
当你要选择编排模式(工作流 vs 自主 Agent vs 混合)、设计执行路径、选择模型、决定框架时使用;当需要权衡"确定性与可靠性"vs"灵活性与动态决策"时使用。不适用于约束/验证/纠正的实现(见 harness-constrain-verify)。
Quellsprache: Chinesisch
当你要让 Agent 响应随时到达的外部事件(邮件/定时/Webhook/用户打断)、支持多任务并发、处理异步打断时使用;当 Agent 只能被动响应用户输入、无法在指定时间自主行动时使用。不适用于语音(见 interaction-voice)或 GUI(见 interaction-computer-use)。
Quellsprache: Chinesisch
当你在构建 GUI 自动化 Agent(观察屏幕、操作鼠标键盘)、设计视觉定位方案(SoM/DOM/坐标预测)、处理动作后状态确认时使用;当 Agent 需要像人类一样操作软件界面时使用。不适用于语音(见 interaction-voice)或异步事件(见 interaction-async)。
Quellsprache: Chinesisch
当你要扩展 Agent 观察与动作空间的模态(语音/GUI/物理)和时机(异步事件/连续流/可打断)时使用;当 Agent 从"回合制"走向"实时交互"时使用。核心认识:回合制是训练留下的假设,不是环境的性质。不适用于纯文本的上下文/工具设计。
Quellsprache: Chinesisch
当你在构建语音 Agent(听/想/说的实时交互)、选择级联/端到端/全双工范式、做快慢思考分离、让 TTS 更像人时使用。不适用于异步事件驱动(见 interaction-async)或 Computer Use(见 interaction-computer-use)。
Quellsprache: Chinesisch
当你在组织知识结构(结构化索引/文件系统范式)、设计知识更新机制(增量 PR 流程/定期整理)、或让 Agent 自主决定检索策略(Agentic RAG)时使用;当知识库膨胀后检索不到正确信息、知识过期冲突、原始案例平铺无法提炼规则时使用。不适用于检索算法本身(见 memory-rag-retrieval)。
Quellsprache: Chinesisch
当你在构建或调优 RAG 检索管道(分块、嵌入、索引、混合检索、重排序)时使用;当检索不准、召回率低、同义词搜不到、关键词搜不到时使用。不适用于用户记忆的存储格式(见 memory-user)或知识组织更新(见 memory-knowledge)。
Quellsprache: Chinesisch
当你在构建用户记忆系统或知识库、调优检索质量、处理知识过期/冲突/隐私时使用;当 Agent 跨会话记不住、检索不准、知识库膨胀后查不到正确信息时使用。不适用于单次会话内的上下文管理(见 context-engineering)。
Quellsprache: Chinesisch
当你在构建用户记忆系统(跨会话个性化)、选择记忆存储格式、处理记忆冲突/压缩/隐私时使用;当 Agent 跨会话记不住、记忆爆炸、同名实体混淆时使用。不适用于知识库检索管道(见 memory-rag-retrieval)或知识组织更新(见 memory-knowledge)。
Quellsprache: Chinesisch
当单个 Agent 的上下文窗口或能力边界不够、需要分工/并行/相互验证时使用;当任务可分解为有依赖的子任务、或需要"生成-验证"分离时使用。不适用于单个 Agent 内部的 ReAct 循环设计(那是 harness-engineering)。先问自己:多 Agent 是否真的引入了新信息?否则单 Agent 更划算。
Quellsprache: Chinesisch
当多 Agent 系统出现并发冲突、错误级联、同质趋同、互相扯皮、循环失控、理解债时使用;当需要设计容错机制(乐观锁、交叉验证、预算控制、级联终止)时使用。不适用于协作拓扑设计(见 multiagent-topology)。
Quellsprache: Chinesisch
当你要设计多 Agent 的上下文共享方式(共享/隔离)和协作拓扑(对等/管理者/去中心化)时使用;当需要决定"如何分工、如何通信、谁控制谁"时使用。不适用于失败模式与容错(见 multiagent-failures)。
Quellsprache: Chinesisch
当你要通过更新模型权重来提升 Agent 能力(Mid-training 补知识、SFT 固化格式、RL 泛化策略、蒸馏降成本)时使用;当需要判断"某个问题该靠 prompt 解决还是值得训练"时使用。核心认识:数据和环境比算法更重要;SFT 记忆、RL 泛化。不适用于 Harness/上下文层的能力提升。
Quellsprache: Chinesisch
当你要把生产问题案例转化为后训练数据、识别后训练中的常见陷阱(过拟合/奖励黑客/数值失配/成本低估)时使用;当需要"从问题案例到参数更新"的完整链路(失败归因→轨迹前缀回归→DPO/SFT→双集验证)时使用。不适用于训练阶段选择(见 posttrain-stage)或奖励设计(见 posttrain-reward)。
Quellsprache: Chinesisch
当你要设计 RL 的奖励信号(来源/时机/表示)、处理信用分配、防范 reward hacking、或做蒸馏提升样本效率时使用;当需要把任务目标变成学习信号时使用。不适用于训练阶段选择(见 posttrain-stage)。
Quellsprache: Chinesisch
当你要判断某个能力缺口该用 Mid-training、SFT 还是 RL 来补、或决定是否值得训练时使用;当需要构造 SFT 数据、理解四阶段全景时使用。不适用于奖励信号设计(见 posttrain-reward)。
Quellsprache: Chinesisch
当你在编写或优化系统提示词、定义 Agent 的身份/规则/工作流程时使用;当 Agent 行为不稳定、规则执行不一致、频繁违反业务规则时使用。不适用于上下文布局与缓存优化(见 context-engineering),也不适用于工具接口描述(见 tool-design)。
Quellsprache: Chinesisch
当你要让 Agent 在物理世界操作(机械臂抓取/放置)、设计 VLA 控制与动作分块、理解世界模型与 sim-to-real 迁移时使用;当任务涉及"感知-动作"闭环且有物理延迟/不可逆后果时使用。不适用于 GUI 自动化(见 interaction-computer-use)或异步事件(见 interaction-async)。
Quellsprache: Chinesisch
当你要设计执行层(工具权限、沙盒隔离、独立审查)和数据层(行级安全、约束校验、访问上下文)的防御时使用;当需要确定"谁能对什么数据做什么"、防止越权操作时使用。不适用于提示注入的上下文层防御(见 security-prompt-injection)。
Quellsprache: Chinesisch
当你要防御提示注入(攻击者经外部数据间接操纵 Agent)、做指令与数据分离、识别越狱 vs 提示注入时使用;当 Agent 处理网页/邮件/文档等不可信内容时使用。不适用于执行层/数据层权限控制(见 security-execution-data)。
Quellsprache: Chinesisch