在大模型应用快速落地的当下,如何让AI Agent稳定执行预定义任务仍是行业痛点。前端工具链专家Matt Pocock的开源项目/writing-great-skills,以一套可工程化的方法论,将AI Skill的设计从经验主义推向结构化。这套指南已成为他个人最常调用的Skill,其核心逻辑是“以过程可预测为目标”。
Pocock首先区分了model-invoked(模型自动触发)与user-invoked(用户调用)两种Skill类型。前者要求description字段充当精准触发器,模型据此决策何时激活技能;后者则依赖用户显式调用。这一区分直击当前Agent开发中“触发模糊”的常见问题——许多定义不清的Skill常常在无关场景下被错误激活。
指南中最具实操价值的是三层信息结构:主步骤(core instructions)、参考(reference)、外部文件(external files)。这种渐进式披露设计,让模型在每一步只关注必要信息,避免一次性加载全部上下文导致注意力稀释。每层内部的步骤都需要明确完成标准(completion criteria),例如“生成三个备选标题”或“返回JSON格式响应”。完成标准是打破“黑箱”的关键:它让模型知道何时终止,并为开发者提供可验证的边界。
Pocock还提出leading word(领先词)概念,用于压缩行为要求。例如在步骤描述开头使用“First, Next, Finally”等顺序词,或用“Verb: Object”结构(如“Validate: Schema”),能显著降低模型对指令的误读概率。这种“元指令压缩”在上下文窗口有限时尤其有效。
针对实践中常见的失败场景,指南系统归纳了五种失败模式:Premature completion(模型过早判断任务完成)、Duplication(同一步骤被多次执行)、Sediment(历史步骤残留干扰后续)、Sprawl(步骤间边界模糊导致逻辑蔓延)、No-op(指令未产生实际效果)。其中No-op测试被特别强调:如果从指令中移除一句话后模型行为没有变化,这句话就是无效的No-op,应立即删除。
这套方法论的本质,是将LLM的“黑箱推理”分解为可控的子任务序列。对比当前业界流行的LangChain或AutoGPT式的链式调用,Pocock更关注单个Skill内部的注意力管理——通过拆分步骤、明确标准、压缩提示,让模型在有限上下文内保持聚焦。对于正在构建Agent应用开发者,最直接的行动建议是:检查每个Skill的description是否能作为唯一触发器;为每个步骤写下完成标准;运行No-op测试清理冗余指令。这三点足以大幅提升Agent行为的可预测性。