共 24 篇,覆盖 OpenAI、Anthropic、NVIDIA、Cursor、Stripe、Manus、Temporal、LangChain、Thoughtworks、Princeton NLP、Letta、GitHub、Replit 及学术研究团队。
分类维度:Harness 总体方法论、长程执行与持久化、Context 与 Memory、Tool / Interface / Runtime、Eval / Feedback / Safety、Multi-Agent 与生产级 Coding Harness。
1. Harness Engineering 总体方法论
这一类回答最基础的问题:Harness 到底是什么、为什么需要 Harness,以及应该从什么原则出发设计 Harness。
1.1 OpenAI — Harness engineering: leveraging Codex in an agent-first world
发布者: OpenAI
原文: https://openai.com/index/harness-engineering/
核心主题: 通过 Codex 的真实工程实践解释 Harness Engineering,强调人的角色从直接写代码转向设计环境、约束、反馈机制以及 Agent 可理解的工程系统。
1.2 Thoughtworks / Martin Fowler — Harness engineering for coding agent users
发布者: Thoughtworks / Martin Fowler / Birgitta Böckeler
原文: https://martinfowler.com/articles/harness-engineering.html
核心主题: 提出 Guides + Sensors 的 Harness Engineering 心智模型,把工程规范、测试、Lint、架构检查和 AI Review 组织成 Agent 的持续反馈闭环。
1.3 LangChain — The Anatomy of an Agent Harness
发布者: LangChain
原文: https://www.langchain.com/blog/the-anatomy-of-an-agent-harness
核心主题: 从 Planning、State、Filesystem、Tools、Subagents 和 Constraints 等维度系统拆解 Agent = Model + Harness 中 Harness 的组成。
1.4 Anthropic — Building Effective AI Agents
发布者: Anthropic
原文: https://www.anthropic.com/engineering/building-effective-agents
核心主题: 提出从最简单 Agent Loop 开始、根据 Eval 逐步增加 Workflow、Routing、Parallelization 和 Multi-Agent 等复杂机制的设计原则。
1.5 Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
发布者: 复旦大学、北京大学等研究团队
原文: https://arxiv.org/abs/2604.25850
核心主题: 研究如何利用组件、经验和决策三层可观测性,让 Coding Agent Harness 根据真实运行轨迹持续自动演化。
2. 长程 Agent、状态与 Durable Execution
这一类解决的问题是:当任务运行几十分钟、数小时甚至跨多个 Session 时,Agent 如何不中断、不丢失状态并可靠恢复。
2.1 Anthropic — Effective harnesses for long-running agents
发布者: Anthropic
原文: https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents
核心主题: 研究跨 Context Window 的长时间任务执行,提出 Initializer Agent、增量任务执行、结构化进度文件和 Session Handoff 等机制。
2.2 Anthropic — Harness design for long-running application development
发布者: Anthropic
原文: https://www.anthropic.com/engineering/harness-design-long-running-apps
核心主题: 研究长程软件开发 Agent 的 Harness,重点讨论 Planner、Generator、Evaluator、任务分解、状态交接与反馈循环。
2.3 Temporal — Temporal Agent Harness: An early look at durable agent infrastructure
发布者: Temporal
原文: https://temporal.io/blog/temporal-agent-harness-durable-agent-infrastructure
核心主题: 提出 Inner Harness / Outer Harness 分层,用持久化工作流解决崩溃恢复、重试、暂停、人工审批、副作用和事件历史问题。
3. Context Engineering 与 Memory
这一类研究:有限 Context Window 应该装什么、什么时候加载、什么时候卸载,以及 Agent 如何获得长期记忆。
3.1 Anthropic — Effective context engineering for AI agents
发布者: Anthropic
原文: https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents
核心主题: 系统介绍 Agent Context Engineering,讨论 System Prompt、Tools、Examples、History、Retrieval 和长期状态应该如何以最少 Token 提供最高信号。
3.2 Manus — Context Engineering for AI Agents: Lessons from Building Manus
发布者: Manus
原文: https://manus.im/blog/Context-Engineering-for-AI-Agents-Lessons-from-Building-Manus
核心主题: 从生产 Agent 实践提出 KV Cache 稳定性、Append-only Context、工具 Mask、文件外部记忆和保留失败轨迹等 Context Harness 原则。
3.3 Cursor — Dynamic context discovery
发布者: Cursor
原文: https://cursor.com/blog/dynamic-context-discovery
核心主题: 提出 Dynamic Context Discovery,让 Agent 根据当前任务按需发现文件、规则、历史、Skills 和工具,而不是预先把所有信息塞进 Context。
3.4 Letta — Anatomy of a Context Window: A Guide to Context Engineering
发布者: Letta
原文: https://www.letta.com/blog/guide-to-context-engineering/
核心主题: 将 Context Window 看作 Agent Runtime 需要主动管理的稀缺计算资源,系统分析 Prompt、Memory、Retrieval 与动态 Context 编译。
3.5 Letta — Introducing Context Repositories: Git-based Memory for Coding Agents
发布者: Letta
原文: https://www.letta.com/blog/context-repositories/
核心主题: 提出利用文件系统和 Git 管理 Agent 长期记忆,使 Memory 支持版本、Diff、回滚、分支、合并和渐进式加载。
4. Agent-Computer Interface、Tools 与 Runtime
这一类关注:模型究竟应该通过什么接口控制计算机,以及 Harness 应该为模型暴露怎样的动作空间。
4.1 Princeton NLP / SWE-agent — Agent-Computer Interface
发布者: Princeton NLP / SWE-agent
原文: https://swe-agent.com/0.7/background/aci/
论文: https://arxiv.org/abs/2405.15793
核心主题: 提出 Agent-Computer Interface(ACI),主张像为人设计 GUI 一样,为 LLM 专门设计文件浏览、搜索、编辑、命令执行和错误反馈接口。
4.2 Anthropic — Writing effective tools for AI agents — using AI agents
发布者: Anthropic
原文: https://www.anthropic.com/engineering/writing-tools-for-agents
核心主题: 系统讨论 Tool Interface Engineering,包括工具粒度、命名、参数设计、返回结果、Token 效率以及如何使用 Eval 优化工具。
4.3 NVIDIA — Six Agent Harness Capabilities for Higher Model Performance
发布者: NVIDIA
原文: https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
核心主题: 提出 Typed I/O、Pass-by-reference、Code-as-action、Programmable Agent Loop、Explicit State 和 Model-callable Harness API 六项 Harness 能力。
4.4 OpenAI — Unlocking the Codex harness: how we built the App Server
发布者: OpenAI
原文: https://openai.com/index/unlocking-the-codex-harness/
核心主题: 从 Codex 内部架构解释 Harness 如何管理 Agent Loop、工具执行、Session State,并通过统一 Runtime 服务 CLI、IDE 和其他客户端。
5. Evaluation、Feedback 与 Safety Harness
这一类解决:Agent 做完以后如何判断对错,以及怎样把错误转化为下一轮可以利用的反馈。
5.1 Cursor — Continually improving our agent harness
发布者: Cursor
原文: https://cursor.com/blog/continually-improving-agent-harness
核心主题: 介绍 Cursor 如何利用真实任务、Eval 和模型专项实验不断修改 Agent Harness,使 Harness 与不同模型一起持续演化。
5.2 GitHub — Validating agentic behavior when “correct” isn’t deterministic
发布者: GitHub
核心主题: 研究 Agent 行为非确定性后的验证方法,强调不要验证固定操作路径,而应验证最终结果和必须成立的系统不变量。
5.3 Replit — Defense in Depth: How Replit Secures Every Layer of the Vibe Coding Stack
发布者: Replit
原文: https://replit.com/blog/defense-in-depth-how-replit-secures-every-layer-of-the-vibe-coding-stack
核心主题: 从安全 Harness 角度介绍 Sandbox、静态扫描、模型审查、运行时隔离和发布门等多层 Defense-in-Depth 机制。
6. Multi-Agent 与生产级 Coding Harness
这一类关注:一个 Agent 不够时如何拆任务,以及 Agent 如何真正进入企业的软件开发流水线。
6.1 Anthropic — How we built our multi-agent research system
发布者: Anthropic
原文: https://www.anthropic.com/engineering/multi-agent-research-system
核心主题: 介绍 Anthropic Research 的 Orchestrator–Worker 架构,以及任务拆分、并行 Subagent、上下文隔离、Tool Design 和 Multi-Agent Eval。
6.2 Cursor — Agent swarms and the new model economics
发布者: Cursor
原文: https://cursor.com/blog/agent-swarm-model-economics
核心主题: 研究 Agent Swarm 的 Planner/Worker 分层、任务树、上下文隔离、多模型分工和大规模并行 Agent 执行。
6.3 Stripe — Minions: Stripe’s one-shot, end-to-end coding agents
发布者: Stripe
原文: https://stripe.dev/blog/minions-stripes-one-shot-end-to-end-coding-agents
核心主题: 介绍 Stripe 如何将 Coding Agent 接入真实代码库、开发环境、测试、PR 和人工 Review,展示生产级 Coding Harness 的整体形态。
6.4 Stripe — Minions: Stripe’s one-shot, end-to-end coding agents — Part 2
发布者: Stripe
原文: https://stripe.dev/blog/minions-stripes-one-shot-end-to-end-coding-agents-part-2
核心主题: 深入介绍 Blueprints、确定性 Workflow、Agent 自由探索、CI Feedback 和执行边界如何共同组成企业级 Coding Harness。
7. 24 篇文章对应的 Harness Engineering 知识地图
Agent Harness Engineering
│
├── 1. 总体方法论
│ ├── OpenAI — Harness Engineering
│ ├── Thoughtworks — Guides & Sensors
│ ├── LangChain — Anatomy of Agent Harness
│ ├── Anthropic — Building Effective Agents
│ └── Agentic Harness Engineering — Harness Evolution
│
├── 2. Long-running / Durable
│ ├── Anthropic — Effective Harnesses
│ ├── Anthropic — Long-running App Harness
│ └── Temporal — Outer Harness
│
├── 3. Context / Memory
│ ├── Anthropic — Context Engineering
│ ├── Manus — Production Context Engineering
│ ├── Cursor — Dynamic Context Discovery
│ ├── Letta — Context Window
│ └── Letta — Context Repositories
│
├── 4. Interface / Tools / Runtime
│ ├── SWE-agent — ACI
│ ├── Anthropic — Tool Engineering
│ ├── NVIDIA — Harness Capabilities
│ └── OpenAI — Codex Harness Runtime
│
├── 5. Evaluation / Feedback / Safety
│ ├── Cursor — Harness Evaluation
│ ├── GitHub — Behavioral Validation
│ └── Replit — Security Harness
│
└── 6. Multi-Agent / Production Coding
├── Anthropic — Multi-Agent Research
├── Cursor — Agent Swarms
├── Stripe — Minions Part 1
└── Stripe — Minions Part 2
8. 推荐阅读顺序
如果目标是从零建立对 Harness Engineering 的完整理解,建议:
第一阶段:建立 Harness 心智模型
OpenAI Harness Engineering
↓
Thoughtworks Harness Engineering
↓
LangChain Anatomy of an Agent Harness
第二阶段:理解模型与环境的接口
SWE-agent ACI
↓
Anthropic Tool Engineering
↓
NVIDIA Six Harness Capabilities
第三阶段:理解 Context
Anthropic Context Engineering
↓
Manus Context Engineering
↓
Cursor Dynamic Context Discovery
↓
Letta Context / Memory
第四阶段:理解长期运行
Anthropic Effective Harnesses
↓
Anthropic Long-running App Harness
↓
Temporal Outer Harness
第五阶段:理解 Feedback 与 Eval
Cursor Continually Improving Harness
↓
GitHub Agent Validation
↓
Replit Defense in Depth
第六阶段:理解生产规模化
Stripe Minions
↓
Anthropic Multi-Agent Research
↓
Cursor Agent Swarms
最终:
Agentic Harness Engineering
→ 思考如何让 Harness 本身持续自动演化