agent20 min read最后更新 Updated 2026.09.14

Agent Harness Engineering 权威原文分类阅读清单

harness engineering
开始阅读

共 24 篇,覆盖 OpenAI、Anthropic、NVIDIA、Cursor、Stripe、Manus、Temporal、LangChain、Thoughtworks、Princeton NLP、Letta、GitHub、Replit 及学术研究团队。

分类维度:Harness 总体方法论、长程执行与持久化、Context 与 Memory、Tool / Interface / Runtime、Eval / Feedback / Safety、Multi-Agent 与生产级 Coding Harness。


1. Harness Engineering 总体方法论

这一类回答最基础的问题:Harness 到底是什么、为什么需要 Harness,以及应该从什么原则出发设计 Harness。

1.1 OpenAI — Harness engineering: leveraging Codex in an agent-first world

发布者: OpenAI

原文: https://openai.com/index/harness-engineering/

核心主题: 通过 Codex 的真实工程实践解释 Harness Engineering,强调人的角色从直接写代码转向设计环境、约束、反馈机制以及 Agent 可理解的工程系统。


1.2 Thoughtworks / Martin Fowler — Harness engineering for coding agent users

发布者: Thoughtworks / Martin Fowler / Birgitta Böckeler

原文: https://martinfowler.com/articles/harness-engineering.html

核心主题: 提出 Guides + Sensors 的 Harness Engineering 心智模型,把工程规范、测试、Lint、架构检查和 AI Review 组织成 Agent 的持续反馈闭环。


1.3 LangChain — The Anatomy of an Agent Harness

发布者: LangChain

原文: https://www.langchain.com/blog/the-anatomy-of-an-agent-harness

核心主题: 从 Planning、State、Filesystem、Tools、Subagents 和 Constraints 等维度系统拆解 Agent = Model + Harness 中 Harness 的组成。


1.4 Anthropic — Building Effective AI Agents

发布者: Anthropic

原文: https://www.anthropic.com/engineering/building-effective-agents

核心主题: 提出从最简单 Agent Loop 开始、根据 Eval 逐步增加 Workflow、Routing、Parallelization 和 Multi-Agent 等复杂机制的设计原则。


1.5 Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses

发布者: 复旦大学、北京大学等研究团队

原文: https://arxiv.org/abs/2604.25850

核心主题: 研究如何利用组件、经验和决策三层可观测性,让 Coding Agent Harness 根据真实运行轨迹持续自动演化。


2. 长程 Agent、状态与 Durable Execution

这一类解决的问题是:当任务运行几十分钟、数小时甚至跨多个 Session 时,Agent 如何不中断、不丢失状态并可靠恢复。

2.1 Anthropic — Effective harnesses for long-running agents

发布者: Anthropic

原文: https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents

核心主题: 研究跨 Context Window 的长时间任务执行,提出 Initializer Agent、增量任务执行、结构化进度文件和 Session Handoff 等机制。


2.2 Anthropic — Harness design for long-running application development

发布者: Anthropic

原文: https://www.anthropic.com/engineering/harness-design-long-running-apps

核心主题: 研究长程软件开发 Agent 的 Harness,重点讨论 Planner、Generator、Evaluator、任务分解、状态交接与反馈循环。


2.3 Temporal — Temporal Agent Harness: An early look at durable agent infrastructure

发布者: Temporal

原文: https://temporal.io/blog/temporal-agent-harness-durable-agent-infrastructure

核心主题: 提出 Inner Harness / Outer Harness 分层,用持久化工作流解决崩溃恢复、重试、暂停、人工审批、副作用和事件历史问题。


3. Context Engineering 与 Memory

这一类研究:有限 Context Window 应该装什么、什么时候加载、什么时候卸载,以及 Agent 如何获得长期记忆。

3.1 Anthropic — Effective context engineering for AI agents

发布者: Anthropic

原文: https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents

核心主题: 系统介绍 Agent Context Engineering,讨论 System Prompt、Tools、Examples、History、Retrieval 和长期状态应该如何以最少 Token 提供最高信号。


3.2 Manus — Context Engineering for AI Agents: Lessons from Building Manus

发布者: Manus

原文: https://manus.im/blog/Context-Engineering-for-AI-Agents-Lessons-from-Building-Manus

核心主题: 从生产 Agent 实践提出 KV Cache 稳定性、Append-only Context、工具 Mask、文件外部记忆和保留失败轨迹等 Context Harness 原则。


3.3 Cursor — Dynamic context discovery

发布者: Cursor

原文: https://cursor.com/blog/dynamic-context-discovery

核心主题: 提出 Dynamic Context Discovery,让 Agent 根据当前任务按需发现文件、规则、历史、Skills 和工具,而不是预先把所有信息塞进 Context。


3.4 Letta — Anatomy of a Context Window: A Guide to Context Engineering

发布者: Letta

原文: https://www.letta.com/blog/guide-to-context-engineering/

核心主题: 将 Context Window 看作 Agent Runtime 需要主动管理的稀缺计算资源,系统分析 Prompt、Memory、Retrieval 与动态 Context 编译。


3.5 Letta — Introducing Context Repositories: Git-based Memory for Coding Agents

发布者: Letta

原文: https://www.letta.com/blog/context-repositories/

核心主题: 提出利用文件系统和 Git 管理 Agent 长期记忆,使 Memory 支持版本、Diff、回滚、分支、合并和渐进式加载。


4. Agent-Computer Interface、Tools 与 Runtime

这一类关注:模型究竟应该通过什么接口控制计算机,以及 Harness 应该为模型暴露怎样的动作空间。

4.1 Princeton NLP / SWE-agent — Agent-Computer Interface

发布者: Princeton NLP / SWE-agent

原文: https://swe-agent.com/0.7/background/aci/

论文: https://arxiv.org/abs/2405.15793

核心主题: 提出 Agent-Computer Interface(ACI),主张像为人设计 GUI 一样,为 LLM 专门设计文件浏览、搜索、编辑、命令执行和错误反馈接口。


4.2 Anthropic — Writing effective tools for AI agents — using AI agents

发布者: Anthropic

原文: https://www.anthropic.com/engineering/writing-tools-for-agents

核心主题: 系统讨论 Tool Interface Engineering,包括工具粒度、命名、参数设计、返回结果、Token 效率以及如何使用 Eval 优化工具。


4.3 NVIDIA — Six Agent Harness Capabilities for Higher Model Performance

发布者: NVIDIA

原文: https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/

核心主题: 提出 Typed I/O、Pass-by-reference、Code-as-action、Programmable Agent Loop、Explicit State 和 Model-callable Harness API 六项 Harness 能力。


4.4 OpenAI — Unlocking the Codex harness: how we built the App Server

发布者: OpenAI

原文: https://openai.com/index/unlocking-the-codex-harness/

核心主题: 从 Codex 内部架构解释 Harness 如何管理 Agent Loop、工具执行、Session State,并通过统一 Runtime 服务 CLI、IDE 和其他客户端。


5. Evaluation、Feedback 与 Safety Harness

这一类解决:Agent 做完以后如何判断对错,以及怎样把错误转化为下一轮可以利用的反馈。

5.1 Cursor — Continually improving our agent harness

发布者: Cursor

原文: https://cursor.com/blog/continually-improving-agent-harness

核心主题: 介绍 Cursor 如何利用真实任务、Eval 和模型专项实验不断修改 Agent Harness,使 Harness 与不同模型一起持续演化。


5.2 GitHub — Validating agentic behavior when “correct” isn’t deterministic

发布者: GitHub

原文: https://github.blog/ai-and-ml/generative-ai/validating-agentic-behavior-when-correct-isnt-deterministic/

核心主题: 研究 Agent 行为非确定性后的验证方法,强调不要验证固定操作路径,而应验证最终结果和必须成立的系统不变量。


5.3 Replit — Defense in Depth: How Replit Secures Every Layer of the Vibe Coding Stack

发布者: Replit

原文: https://replit.com/blog/defense-in-depth-how-replit-secures-every-layer-of-the-vibe-coding-stack

核心主题: 从安全 Harness 角度介绍 Sandbox、静态扫描、模型审查、运行时隔离和发布门等多层 Defense-in-Depth 机制。


6. Multi-Agent 与生产级 Coding Harness

这一类关注:一个 Agent 不够时如何拆任务,以及 Agent 如何真正进入企业的软件开发流水线。

6.1 Anthropic — How we built our multi-agent research system

发布者: Anthropic

原文: https://www.anthropic.com/engineering/multi-agent-research-system

核心主题: 介绍 Anthropic Research 的 Orchestrator–Worker 架构,以及任务拆分、并行 Subagent、上下文隔离、Tool Design 和 Multi-Agent Eval。


6.2 Cursor — Agent swarms and the new model economics

发布者: Cursor

原文: https://cursor.com/blog/agent-swarm-model-economics

核心主题: 研究 Agent Swarm 的 Planner/Worker 分层、任务树、上下文隔离、多模型分工和大规模并行 Agent 执行。


6.3 Stripe — Minions: Stripe’s one-shot, end-to-end coding agents

发布者: Stripe

原文: https://stripe.dev/blog/minions-stripes-one-shot-end-to-end-coding-agents

核心主题: 介绍 Stripe 如何将 Coding Agent 接入真实代码库、开发环境、测试、PR 和人工 Review,展示生产级 Coding Harness 的整体形态。


6.4 Stripe — Minions: Stripe’s one-shot, end-to-end coding agents — Part 2

发布者: Stripe

原文: https://stripe.dev/blog/minions-stripes-one-shot-end-to-end-coding-agents-part-2

核心主题: 深入介绍 Blueprints、确定性 Workflow、Agent 自由探索、CI Feedback 和执行边界如何共同组成企业级 Coding Harness。


7. 24 篇文章对应的 Harness Engineering 知识地图

TEXT
Agent Harness Engineering
│
├── 1. 总体方法论
│   ├── OpenAI — Harness Engineering
│   ├── Thoughtworks — Guides & Sensors
│   ├── LangChain — Anatomy of Agent Harness
│   ├── Anthropic — Building Effective Agents
│   └── Agentic Harness Engineering — Harness Evolution
│
├── 2. Long-running / Durable
│   ├── Anthropic — Effective Harnesses
│   ├── Anthropic — Long-running App Harness
│   └── Temporal — Outer Harness
│
├── 3. Context / Memory
│   ├── Anthropic — Context Engineering
│   ├── Manus — Production Context Engineering
│   ├── Cursor — Dynamic Context Discovery
│   ├── Letta — Context Window
│   └── Letta — Context Repositories
│
├── 4. Interface / Tools / Runtime
│   ├── SWE-agent — ACI
│   ├── Anthropic — Tool Engineering
│   ├── NVIDIA — Harness Capabilities
│   └── OpenAI — Codex Harness Runtime
│
├── 5. Evaluation / Feedback / Safety
│   ├── Cursor — Harness Evaluation
│   ├── GitHub — Behavioral Validation
│   └── Replit — Security Harness
│
└── 6. Multi-Agent / Production Coding
    ├── Anthropic — Multi-Agent Research
    ├── Cursor — Agent Swarms
    ├── Stripe — Minions Part 1
    └── Stripe — Minions Part 2

8. 推荐阅读顺序

如果目标是从零建立对 Harness Engineering 的完整理解,建议:

TEXT
第一阶段:建立 Harness 心智模型
OpenAI Harness Engineering
    ↓
Thoughtworks Harness Engineering
    ↓
LangChain Anatomy of an Agent Harness

第二阶段:理解模型与环境的接口
SWE-agent ACI
    ↓
Anthropic Tool Engineering
    ↓
NVIDIA Six Harness Capabilities

第三阶段:理解 Context
Anthropic Context Engineering
    ↓
Manus Context Engineering
    ↓
Cursor Dynamic Context Discovery
    ↓
Letta Context / Memory

第四阶段:理解长期运行
Anthropic Effective Harnesses
    ↓
Anthropic Long-running App Harness
    ↓
Temporal Outer Harness

第五阶段:理解 Feedback 与 Eval
Cursor Continually Improving Harness
    ↓
GitHub Agent Validation
    ↓
Replit Defense in Depth

第六阶段:理解生产规模化
Stripe Minions
    ↓
Anthropic Multi-Agent Research
    ↓
Cursor Agent Swarms

最终:
Agentic Harness Engineering
→ 思考如何让 Harness 本身持续自动演化

相关文章

2026.09.14让 AI 的工作可理解、可验证、可接续:基于 Gavin 博客的 Harness Engineering 方法论2026.09.14与 AI 一起构建软件:让工作可恢复,让判断有依据2026.09.14优化AGENT.md和所有skill
返回文章列表