Aug 17, 2026

用 Context Engineering Skills 构建生产级 AI Agent

17 个围绕 context engineering 与 harness engineering 的 skill——覆盖 context 基础、多 agent 模式、记忆系统、工具设计、评估与自改进回路,用于生产 AI agent。

#tutorial#context-engineering#best-practices#ai-agents#developer-tools

大多数 agent skill 合集只是把更多 skill 扔给同样问题:更多提示词、更多工具、更多模型调用。muratcankoylan 的这个合集直击生产 agent 真正的失败模式:长时窗下的 context 退化、丢三落四的记忆、把不同职责混在一起的工具,以及不衡量自身表现的 harness。17 个 skill,按每个严肃的 agent 系统最终都会遇到的模式来组织。

为什么这个 Skill 重要

生产中 agent 失败很少是模型的问题——而是 context 的问题。"Context engineering" 这个说法是给老问题贴的新标签:agent 跑得越久,context 越满、压缩得越差、关键细节丢失,决策在无声地退化。这个合集把处理每种失败模式的模式都编码出来了:

  • 基础层(3 个 skill)—— context 究竟是什么、为什么会退化、如何压缩。
  • 架构层(6 个 skill)—— 多 agent 模式、长时窗提示、记忆系统、工具设计、基于文件系统的 context、托管 agent。
  • 运营层(6 个 skill)—— context 优化、潜在简报、harness 工程、评估、高级评估、自改进回路。

对任何要建一个跑得比单轮聊天更久的 agent 的人,这就是 agent 自身 应该携带的那套 skill。

安装

Claude Code:

/plugin marketplace add muratcankoylan/Agent-Skills-for-Context-Engineering
/plugin install context-engineering@context-engineering-marketplace

其他 agent 宿主,沿用各自市场的安装方式(Codex、Cursor、Windsurf 各自有路径,见你的宿主文档)。

实战:搭建一个多 agent 的"X-to-Book"系统

真实场景,不是"hello world":监控你关心的 X 账号,让多 agent 流水线把它们的推文合成一本每日书。

流水线:

  1. 激活 multi-agent-patterns 设计 agent 拓扑。
  2. 激活 memory-systems 定义每个 agent 记住什么。
  3. 激活 context-optimization 保持长跑 context 精简。
  4. 激活 tool-design 收紧每个 agent 的工具面。
  5. 激活 evaluation 衡量合成书是否真的贴合源推文。

给 agent 的提示:

Build a daily X-to-book system: monitor N accounts, deduplicate posts,
group by theme, draft a chapter per theme, and produce a synthesized book.
Use multi-agent-patterns, memory-systems, context-optimization, tool-design,
and evaluation. Output the chapter drafts and an evaluation report.

预期输出:一份结构化的流水线描述(哪个 agent 负责什么)、一份记忆布局(什么留在哪里)、按 agent 收窄的工具定义,以及一份可度量的评估报告——例如:

Daily run, 2026-08-17
  posts: 184 across 6 accounts (deduplicated: 142)
  chapters: 7
  evaluation:
    thematic-coverage: 0.92  (target ≥ 0.85)
    source-fidelity:    0.88  (target ≥ 0.80)
    length-appropriateness: 0.79 (target ≥ 0.75, flag)

让这个合集不同于通用多 agent 草图的,正是 evaluation——每一章都有可度量的质量,而不是凭感觉。

实战:诊断一个长跑 agent 的退化

真实场景:你的 agent 前 30 分钟表现很好,后面 30 分钟决策越来越糟,你却说不出为什么。

工作:

  1. 激活 context-degradation 识别失败模式。
  2. 激活 context-compression 修正压缩策略。
  3. 激活 context-optimization 精简留在 context 中的内容。
  4. 激活 self-improvement-loops 把失败捕获下来,让它不再重复。

给 agent 的提示:

This agent has been running 2 hours and decisions degraded in the last
30 minutes. Use context-degradation to diagnose, context-compression to
fix the compression policy, context-optimization to slim the kept context,
and self-improvement-loops to capture the failure mode so it doesn't
recur on the next long run. Output a before/after report.

预期输出:一份诊断,指明具体的退化模式(例如"指令在第 4 轮压缩后失去显著性")、一条压缩策略改动,以及一份要规避的失败清单。这才是 context engineering 的真正样貌——不是提示词小把戏,而是跨时间的、被工程化的行为。

技巧

  • 先装基础层。 三个基础层 skill(context-fundamentals、context-degradation、context-compression)是底。架构层和运营层在装好它们之后才最有价值。
  • 任何上线的功能都配 evaluation。 没有 evaluation,多 agent 模式就是玩具;有了它,才能衡量好坏。
  • 每个长跑 agent 都启用 self-improvement-loops。 手工复盘不规模化;这个回路能自动捕获并反馈。
  • 工具面一变就重读 tool-design。 长跑失败最常见的原因是工具蔓延——agent 拥有太多工具,决策反而变差。

何时不用这个 Skill

  • 你在做单次式 agent。 如果你的 agent 每轮一次完成,没有长时窗行为,context engineering 只加负担不加收益。
  • 你不衡量结果。 evaluation 是这个合集的脊柱。没有它,skill 给你更好的架构,但没有证据说明它更好。
  • 你想要一个开箱即用的 agent 框架。 这些是 skill,不是运行时。你要把它们和自己的 harness 组合起来——而且你得懂得自己的 harness 在做什么。

查看 排行榜 了解更多 skill。