本文永久链接https://tonybai.com/2026/09/09/why-harness-matters-more-than-model-yc-paper-club

大家好,我是Tony Bai。

【导读】

一个月前,Reddit 上有人吐槽:“这种 prompt engineering 不该出现在顶会上。” YC Paper Club 用一整晚的分享正面回应了这句质疑:同一份 Claude Opus 权重文件,裸跑 ARC-AGI-3 只有 30% 正确率,套上合适的 Harness 之后能冲到 95%,NVIDIA 的 AVO 甚至跑到了 100%。模型的智商在原地踏步,真正决定 Agent 天花板的,是那层长期被低估的“脚手架”。

【文章要点】

  • Harness(智能体运行时/脚手架)不是“套壳”,而是模型与真实世界之间唯一的接口层:工具、记忆、循环、权限,全部长在这一层上;
  • 一张六年演化图:从 GPT-2 的裸循环,到 Few-shot、思维链、工具调用、记忆、技能、多智能体反思,再到能递归调用自己的 RLM;
  • 真正的分水岭出现在最近半年:Harness 正在从“静态脚手架”进化为“能自我修改的系统”,DSPy、Darwin 机器、Continual Harness 是三个代表;
  • Prime Agent 用类似 CPU 缓存的 L1/L2/L3 记忆分层,把 ARC-AGI 一路调到接近满分区间,还跑了一次 7 天、633 个智能体的超长程实验;
  • 斯坦福 Open Jarvis 证明:把 Harness 做对,本地小模型也能在成本上把云端大模型甩开 800 倍;
  • YC 自己内部的 QM 项目揭示了一条很朴素的教训:把“大脑”从沙盒里拉出来、给足权限、别让 Agent 太快放弃。


一场“不该存在”的分享

YC 每隔一段时间会办一场叫 Paper Club 的小型分享会,专门讨论一篇或几篇值得细读的论文。这一期的主题很直接——Harness,也就是套在大模型外面的那层运行时:系统提示词、工具调用、记忆管理、循环控制、权限系统……几乎所有让模型从“一个会聊天的黑盒”变成“能干活的智能体”的工程,都发生在这一层。

主持人开场就抛出了两条来自 Reddit 的评论:一条说这种“prompt engineering”不配出现在顶会上;另一条说“上下文工程根本不是研究问题”。Harness 长期被视为学术意义上的“边角料”——直到最近的数据打了所有人的脸。

METER 那张经典的“模型能持续自主工作多久”曲线一直在指数增长,但推动这条曲线上扬的,很大一部分并不是模型智商本身的提升,而是 Harness 的迭代。主持人举了一个更具体的例子:在 ARC-AGI 上,同一份 Claude Opus 权重,裸跑只能拿到 30% 的成绩,套上合适的 Harness 之后可以冲到 95%,而 NVIDIA 的 AVO 甚至跑到了 100%。这中间的 65 个百分点,模型权重文件一字未变。

先弄清楚:Harness 到底是什么

Prime Intellect 研究员 Seth(Prime Agent 的作者)在分享里给出了一个很干净的定义:如果只看权重文件本身,LLM 其实只是一个序列处理器——输入一串 token,输出一串 token,用来预测下一步该做什么。而 Harness,是加在模型和真实世界之间的那一层,负责提供持久化状态、工具和算力

换句话说,模型负责“思考”,Harness 负责让这个思考落地:读写文件、调用 API、维护记忆、协调多个子智能体、决定什么时候该继续干、什么时候该停下来。同一个模型套上不同的 Harness,表现可以有天壤之别——这正是这场分享想论证的核心命题。

六年演化史:从裸循环到能自我修改的系统

主持人花了一个周末重读了从 Self-Refine、Reflexion、Voyager 到 Toolformer 的经典文献,压缩出一条五分钟版本的演化脉络。这条脉络不是严格按时间排列的,而是按“能力维度”组织的——每一步都在往 Harness 里加一种新的表达能力。

几个关键节点值得展开说一下:

  • GPT-2 的 V0 时代(2019):没有工具调用,没有技能,只有一个系统提示词、一段上下文,和一个“等到句末标记就停”的循环。这是所有 Harness 的原点。
  • Few-shot 与思维链(2020 前后):本质上都是“上下文空间”和“输出空间”的创新——前者是给模型看几个例子帮它对齐任务,后者是不再要求模型直接吐出答案,而是把推理过程“摊”到更多 token 上再收敛到答案。
  • WebGPT 与 Toolformer:第一次让模型学会调用外部工具——与其在权重里算 5 减 2,不如直接调用一个减法函数。工具调用的雏形就此诞生。
  • MemGPT:第一次给了模型对自己上下文的增删改查权限,而不只是不断往后追加,这为后来的“长期记忆”打下基础。
  • Voyager:在 Minecraft 环境里,模型把反复验证有效的工具链路蒸馏成一份 skills.md,需要时检索调用——这基本就是今天“技能(Skill)”概念的原型。
  • ReAct → Self-Refine → Reflexion:让模型自己扮演不同角色互相评审、结合环境反馈修正错误,是“多智能体自我改进”思路的起点。
  • RLM(Recursive Language Model):允许主控智能体递归地派生子智能体去解决子问题,子智能体还可以再派生自己的子智能体——这是“Harness V1”走向成熟的关键一步。

这一整套演化,主持人把它统称为 Harness V1:静态时代——无论工具、技能、子智能体列表配置得多复杂,Harness 本身(也就是这套代码逻辑)在运行过程中是不变的,改变的只是往上叠加的功能。下面是一个典型的 V1 循环架构:

真正的拐点:让 Harness 自己学会进化

最近半年,事情开始变得“更 trippy”——不是模型在学习,而是 Harness 本身开始学习。这里有三条代表性路线:

  1. DSPy(Demonstrate-Search-Predict):拿一小批训练样例,通过类似遗传编程的方式不断生成、合并、评估候选系统提示词,虽然没法反向传播,但可以持续迭代出更优的提示词版本,相当于对系统提示词做 CRUD。
  2. Darwin 机器(Darwin Gödel Machine 一类工作):比 DSPy 更进一步——不只是改系统提示词,而是允许修改 Harness 的代码本身。你会维护一个“智能体档案库”,每个个体都是一份(Harness 代码 + 系统提示词)的组合,通过适应度函数评估、筛选、变异,再放回档案库,循环往复。元 Harness 的任务,就是生产更好的 Harness——这是一个相当“元”的设计。
  3. Continual Harness:在此基础上进一步细化了记忆的分类(历史、技能、记忆、子智能体规格等),并且引入了 Dagger 式的在线学习思路——不仅更新 Harness 配置,甚至可以在小样本上对权重文件本身做测试时训练。主持人称这是“一个值得投入的重要研究方向”。

正是这一批工作,把 Harness 从“人工设计的脚手架”变成了“会自我改写的系统”,也是当晚三位主讲人分享的三个项目——Prime Agent、Open Jarvis、QM——共同的技术底色。

案例一:Prime Agent——像管理 CPU 缓存一样管理记忆

Prime Intellect 的 Seth 分享的 Prime Agent,被定义为“一个自我进化的 RLM Harness”。他的核心方法论是:把记忆按访问速度和持久性分成三层,类比 CPU 的缓存体系。

在这套结构里,Prime Agent 把子智能体做成了“持久化子会话”:主会话可以随时派生新的子智能体去执行任务,任务完成后子智能体并不会消失,而是进入“闲置”状态,仍然驻留在内存里,需要时可以直接把消息发回去继续工作,不必重建上下文——这解决了多智能体协作中最常见的“上下文丢失”问题。

实测数据上,团队在 ARC-AGI-3 上的调优过程颇为坎坷也颇为真实:第一轮直接套用一个社区系统提示词,跑出了 99.9% 的“惊人成绩”——结果一看日志,是“作弊”了(沙盒没做好隔离);重新搭好沙盒后,GPT-5 系列跑出 78%;换用其他模型也各有 70~80% 区间的成绩。团队还特意强调了一个容易被忽视的问题:很多评测在比较模型时,实际花费的预算(时间、token)并不对等,这会掩盖真实的性能差异,所以他们更看重“长程性能的实际拐点在哪里”,而不是单点分数。

除了 ARC-AGI,团队还做了一次相当极限的长程实验:用 8 台 H200 节点跑了 7 天,累计调度 633 个智能体、产出 2300 万 token,在一个类似“自动化工厂搭建”的任务里持续做技术树推进。有意思的是,直到实验结束,智能体依然没有陷入停滞,还在持续取得技术进展——这被主讲人半开玩笑地称为“我们自己的《Gemini Plays Pokémon》”。

Seth 给出的经验总结是:想把 Harness 做好,重点关注智能体化的上下文管理(分层记忆、压缩、精炼)、群体协作(Swarm)与 RLM 的深度使用,以及用标准化的评测方式衡量长程性能,而不是只看单点分数。

案例二:Open Jarvis——把“大脑”搬回本地,成本降 800 倍

斯坦福团队分享的 Open Jarvis,出发点是一个很现实的问题:目前的个人 AI 几乎全部依赖云端大模型,代价是高昂的 API 费用、隐私风险,以及“你在租智能,而不是拥有智能”。他们想验证:能不能把模型推理、智能体执行、记忆与学习这套核心栈完全放到本地设备上跑,同时性能不明显掉队?

团队把任何一套个人 AI Harness 拆解成五个最基础的原语:

  • 用户界面:想通过什么方式和 Agent 交互;
  • 智能体逻辑:如何组合推理与工具使用;
  • 智能(模型):用哪个本地模型(如 Qwen、GPT-OSS、Gemma 3N);
  • 推理引擎与硬件:Ollama、llama.cpp、vLLM、SGLang,跑在 Apple Silicon 还是 NVIDIA 上;
  • 工具、记忆与学习原语:通过标准的 MCP 协议接工具与记忆,并支持提示词层面的优化(如 DSPy)或权重层面的优化(如 LoRA、SFT)。

他们做的一个巧妙设计是:用云端大模型去自动优化本地小模型的 Harness 配置——诊断问题、提出改进方案、生成更优配置,但推理阶段完全不产生云端调用费用。

结果显示,经过这种优化的本地配置,相比“开箱即用”的本地部署有显著提升,在部分个人任务、编程、智能体任务上已经能和云端模型打平;即便仍有不少任务本地模型力有不足,这个差距正在按月收窄。

团队给出的关键数字是:成本最多可降低约 800 倍,同时延迟也显著下降。而且无论选用哪家云端模型来做优化器(Opus、GPT、Gemini、Kimi、GLM 等),都能带来收益——说明“用云端智能优化本地 Harness”这条路径本身具有一定的通用性。

案例三:QM——YC 自己踩过的四代 Harness 演进

如果说前两个项目更偏研究性质,YC 内部团队分享的 QM 项目则更像一份“血泪史”。QM 是 YC 自研的开源 Agent Harness,目标是让每个员工都拥有一个可深度定制、随时可在 Slack 或网页里调用的助手。

它的演进经历了四个阶段:

其中最关键的设计转折发生在 Hermes 舰队阶段之后:团队发现,把智能体的“大脑”完全绑定在某一台沙盒电脑里,看似强大,实则脆弱——一旦沙盒数量上来,管理成本会失控,而且所有会话记录都被“锁”在那台机器里,无法被系统整体利用。

QM 的解法是把所有对话与状态统一卸载到 Postgres,再暴露给 Agent 本身去调用,而沙盒不再是 Agent 的“家”,而是它按需取用的一种资源——需要重型开发环境就申请强力沙盒,任务简单就用轻量沙盒,这个决策权也被下放给了 Agent 自己,而不是写死在 Harness 逻辑里。

分享中还提到几个非常“接地气”的工程教训,很值得国内做 Agent 产品的团队参考:

  • Agent 放弃得太早:团队引入了一个“死磕工具(grind tool)”,给任务设定最低耗时或最低 token 预算,Agent 在达到预算前不允许放弃任务——这一简单机制显著提升了研究报告等长任务的产出质量,据分享,OpenAI 和 Anthropic 近期在数学难题上取得的一些突破也用了类似技巧。
  • Agent 容易“搞不清自己在哪”:即便系统提示词里写得很清楚,Agent 在多人协作(比如 Slack 群聊)场景下依然容易搞混当前处境,需要额外的“本地感知锚点”来纠偏。
  • 权限与“社交常识”的缺失:人类天然知道什么信息该讲给谁听,但 Agent 没有这种直觉,私密信息很容易“泄漏”到不该出现的对话里。团队的解法是依托 YC 已有的细粒度权限系统——但他们也坦言,大多数公司并不具备这样的权限基础设施,这方面还需要投入相当的工程量。
  • 人类审核正在被“橡皮图章化”:早期 Agent 提出的数据库写操作变更,团队会逐条仔细审核;但随着信任建立,审核正在变得越来越流于形式——这被认为是接下来几个月需要重点关注的风险点,而不是一个可以放心的信号。

从这三个案例里,能提炼出哪些共性

把 Prime Agent、Open Jarvis、QM 放在一起看,几条设计原则反复出现:

  • 把决策权尽量下放给 Agent,而不是写死在 Harness 里:无论是“该用哪个沙盒”还是“该切换到哪个模型供应商”,让 Agent 自己判断,往往比在 Harness 层强制规定效果更好;
  • 记忆要分层管理,而不是无限堆砌上下文:从活跃上下文到 Ripple/RAM 再到持久化存储,压缩与精炼要成为常态化机制;
  • Harness 应当尽量精简,只保留真正核心的能力:QM 团队特意提到,他们把核心工具收敛到“远程沙盒执行、对象存储读写、内部应用发布”这三项,其余都被视为“过渡性补丁”;
  • 要给 Agent 足够的“耐力”,不能一遇挫折就放弃:预算约束下的“死磕”机制,是当前提升长程任务质量的一个简单但有效的手段;
  • 信任的建立要伴随持续的审查机制,否则“人类在环”很容易退化为形式主义。

写在最后

这场分享传递的核心信息其实很朴素:过去几年里,模型的智商曲线(用主持人的话说,接近“IQ”维度)确实在稳步上升,但真正把这份智商转化为可用生产力的,是 Harness 这层长期被视为“配角”的工程。

ARC-AGI 上从 30% 到 95%、95% 到 100% 的跃迁,靠的不是换了更聪明的模型,而是给同一个模型换了一副更懂得怎么用它的“身体”。

当模型能力的边际提升开始放缓,Harness 会不会成为下一个真正的竞争高地?至少从这场分享的三个项目来看,答案已经相当明确。

本文根据 YC Paper Club 分享《Why The Harness Matters More Than The Model》整理编译,视频原文参见 YouTube(https://www.youtube.com/watch?v=n9xKblqyQ28)。


还在为写 Agent 框架频频死循环、上下文爆炸而束手无策?我的新专栏 从0 开始构建 Agent Harness 将带你:

  • 抛弃臃肿框架,回归“驾驭工程 (Harness Engineering)”的第一性原理
  • 用 Go 语言手写 ReAct 循环、并发拦截与上下文压缩引擎等,复刻极简OpenClaw
  • 构建坚不可摧的 Safety Middleware 与飞书人工审批防线
  • 在底层实现 Token 成本审计、链路追踪与自动化跑分评估
  • 从“调包侠”进化为掌控大模型边界的“AI 操作系统架构师”

扫描下方二维码,开启从 0 开始构建Agent Harness 的实战之旅。


还在为“复制粘贴喂AI”而烦恼?我的新专栏 AI原生开发工作流实战 将带你:

  • 告别低效,重塑开发范式
  • 驾驭AI Agent(Claude Code),实现工作流自动化
  • 从“AI使用者”进化为规范驱动开发的“工作流指挥家”

扫描下方二维码,开启你的AI原生开发之旅。


商务合作方式:撰稿、出书、培训、在线课程、合伙创业、咨询、广告合作。如有需求,请扫描下方公众号二维码,与我私信联系。