学 AI 产品 · 专业 AI 产品经理播客第 6 章 · T6 Harness 与自我改进 · EP 03
第 6 章 · EP 03

让 Harness 改进自己 · 立三条长跑规矩

时长 14:52音色 云健 · 男声

同步字幕

章节导航(点击跳转)

0:00开场0:53
0:53不改善解,改善改善器1:53
2:46Self-Harness:给自己做绩效复盘1:56
4:43为什么进化搜索适合 Harness1:14
5:57AlphaEvolve 与 DGM1:47
7:45七道关,以及一个比喻2:01
9:46自动研究还差在哪1:26
11:13三条长跑规矩,今天就能立1:58
13:11可带走的原则1:39
解读全文

让 Harness 改进自己 · 进化搜索 · 自我改进的七道关 · 三条长跑规矩

本集对应课程:PART 5 · Harness 与自我改进 ·《让 Harness 改进自己》《进化搜索:让最强 Harness 存活》《未来挑战:自我改进的七道关》《立三条长跑规矩》
音频与本文配套,本文为文字版深度解读,可独立阅读。

一句话速览

STOP 递归改善器 + Self-Harness 的 propose-evaluate-accept 循环;进化搜索在庞大 Harness 设计空间中让最强者存活;七道关未过;三条长跑规矩今天就能立。


能力地图

层次方法改善对象关键机制
元层STOP(Zelikman et al. 2023)改善器本身(文本/代码)递归脚手架改进:I_t = I_{t-1}(û, I_{t-1}; M)
运行时层Self-Harness(Zhang et al. 2026)Agent 的运行时编排(system prompt / 工具调度 / 验证规则)Weakness Mining → Harness Proposal → Validation
种群层Promptbreeder / GEPAtask-specific prompt变异、元进化、反思 + 进化算子
代码层AlphaEvolve(Novikov et al. 2025)候选程序池中的程序LLM 生成 diffs → 评估 → 适者保留
自我层DGM(Zhang et al. 2025)Agent 自己的 harness 代码选父代 → 反思 → 变异 → 评估 → 回池
联合层SIA(Hebbar et al. 2026)harness + 模型权重Meta / Task / Feedback 三 Agent 同循环
落地层三条长跑规矩你的 Agent 的上下文治理压缩阈值 / 永不删除清单 / 落盘笔记

一、STOP:不改善解,改善「改善器」

核心思想

STOP(Zelikman et al. 2023)是递归脚手架改进的早期范例。它不直接改善一个解 s,而是不断改善产生更好解的那个改善器 I 本身。

种子改善器 I₀ 接受三个输入:初始解 s、效用函数 u、黑盒语言模型 M,返回改善后的解 s'。

关键洞察:改善器本身也是文本(一段 prompt 或代码),因此可以把同样的改善逻辑作用在改善器自身上。

递归更新公式(人话版)


I_t = I_{t-1}(û, I_{t-1}; M)

别被符号吓到,它只有一句话:让今天的自己去升级昨天的自己。就像你用 3.0 版的学习方法总结出 4.0 版的学习方法。

自动发现的策略

改善后的改善器自动发现了遗传算法、分解改进、多臂 Prompt Bandit、模拟退火、Beam Search 等经典优化策略,无需人类预设。

提示1:递归 ≠ 必然改善

模型表现
GPT-4能持续改善
GPT-3.5 / Mixtral反而退化

递归结构只给出改善的可能性,不保证收敛。弱模型在元级操作中缺乏足够的编程直觉,反而会放大噪声。

推论:自我改进系统的安全性,必须建立在对基座能力的准确评估之上。不是所有模型都配跑这套循环。

二、Self-Harness:Agent 给自己做绩效复盘

三阶段循环(Zhang et al. 2026)。与 STOP 不同,它直接操作 Agent 的运行时编排系统。

阶段 1:Weakness Mining(找弱点)

把失败轨迹聚类为 verifier-grounded 失败模式。每条失败记录需包含三样东西:

  1. 终端验证器级原因
  2. 相关 Agent 行为的因果状态
  3. 轨迹暴露的抽象 Agent 机制
三样都有,才算一条能用的失败模式。

阶段 2:Harness Proposal(提修改方案)

模型获得四样东西:可编辑面、失败模式摘要、通过行为记录、已尝试编辑的历史。优先选择可寻址的重复错误模式。

阶段 3:Proposal Validation(验证)

用 held-in 和 held-out 数据集验证候选编辑。只接受没有回归的编辑,确保改进不以牺牲已有能力为代价。

实验验证

在 Terminal-Bench-2 上对 MiniMax M2.5、Qwen3.5-35B-A3B、GLM-5 进行实验。Self-Harness 为每个模型学到了模型特定的 harness 指令。

同一个框架对不同基座产生了不同的优化路径 → Harness 改进确实是上下文敏感的,不存在一套通吃的最优配置。

提示2:安全边界必须在改进循环之外

如果程序被允许编辑 OS 系统层面的配置,抽象边界就会被打破。

可编辑面需要合理设计:权限控制和安全层必须在改进循环之外,由人类或不可篡改的监管机制保障。没有边界的自我改进是失控的自我改进。

三、为什么进化搜索适合 Harness 优化

三个契合条件

  1. 搜索空间庞大且形状奇特 —— 自然语言 prompt、代码逻辑、工具配置,组合爆炸且高度离散
  2. 梯度不可用,但评估容易 —— 无法对 prompt 文本求导,但可以直接在基准测试上跑出分数
  3. 多样性有价值 —— 不同任务可能需要不同风格的 Harness,进化天然维护种群多样性
能打分、不能求解的问题,正是「养一群、留最强」最擅长的领域。

第三条常被忽略:我们最终要的不是某一个最强解,而是一批能应对不同场景的解。


四、AlphaEvolve 与 DGM

AlphaEvolve(Novikov et al. 2025)

维护候选程序池,用冻结的 LLM 生成代码 diffs 来改进程序,反复评估子程序并保留表现最好的。谷歌用它发现了比人类已知更快的矩阵乘法算法。

值得学的设计细节:

细节说明
进化标记用显式标记圈出可改进区域,不是整个文件随便改
Meta-prompt指令和上下文本身也参与共同进化,不会固定不变
消融实验证明进化流程、上下文 prompt、meta-prompt、全文件进化、更强 LLM 各自有独立贡献

DGM(Zhang et al. 2025)

比 AlphaEvolve 更激进:进化的对象是 Agent 自己的 harness 代码。

流程:初始化 → 按性能概率选父代(概率与子代数量成反比,鼓励探索)→ 反思评估日志 + 提议 → 变异 harness 代码 → 评估 → 性能足够高才回池 → 重复。

实验(基于 Claude 3.5 Sonnet):

基准起点终点提升
SWE-bench Verified20%50%+30 pp
Polyglot14.2%30.7%+16.5 pp

全程无需人类介入。

适用范围与局限

适用不适用
候选解可自动评估评估速度慢(每次需数小时)
Fitness 易量化评估标准模糊或主观
矩阵乘法加速 / GPU kernel 优化 / 算法竞赛 / 数据中心调度主要基于启发式判断 / 计算预算有限 / 需要人类审核环节
计算效率(每代多少次评估)与进化效果(每代提升多少)的平衡,仍是开放问题。

SIA(Hebbar et al. 2026):联合优化 harness + 模型权重

Meta-Agent 提出新 harness → Task-Specific Agent 执行 → Feedback-Agent 决定下一步更新 harness 还是模型权重。

方向有趣,但证据暂时性:训练稳定性与 Goodhart 效应(优化代理指标导致真实目标退化)仍是开放挑战。


五、自我改进的七道关(挑最要命的几道)

#关卡核心问题比喻
1弱且模糊的评估器编程有单元测试、数学有证明,但研究声明没有快速精确的验证器。研究品味、新颖性、长期价值极难衡量健身有体重秤,代码有测试,但「这篇论文有没有价值」没有秤可称
2上下文与记忆生命周期记忆需求随自主性爆炸式增长;当前上下文工程大多停留在软件系统层,应成为智能的核心部分不能管理自己记忆的 Agent,无法完成跨天跨周的复杂任务
3多样性坍缩进化与 RL 天然倾向利用已知高奖励模式,种群坍缩为同一方案的微小变体时创新停止全班都抄第一名的作业,短期分数好看,再没人想新解法
4奖励黑客优化单元测试→过拟合;优化评判模型→reward hacking;优化榜单→利用漏洞出卷人和改卷人绝不能是学生自己
5长期成功优化目标太短期,很少捕获可维护性、所有权边界、迁移成本、向后兼容性只追求测试通过的 Agent 可能在技术债里埋定时炸弹

提示3:评估器与权限控制必须在进化循环之外

奖励黑客是自我改进循环中最危险的反模式之一。唯一解法:评估器和权限控制由独立机制维护,不参与被优化的过程。

人类的角色:在栈中向上移动,继续留在循环之中——设定目标、判断方向、守住底线。完全自主的 AI 不是最终目标,人机协作的质量才是。


六、能写论文 ≠ 能做科学

系统可以写出看似合理的论文,却可能包含虚假引用、实现漂移或薄弱的实验结果。

Trehan & Chopra (2026) 系统测试了 LLM 从想法到论文的全流程,发现六种反复出现的失败模式(结构性瓶颈,非偶发 Bug):

  1. 训练数据默认值偏好 —— 倾向使用旧库、过时命令、标准模板,错过最优方案
  2. 执行压力下的实现漂移 —— 遇到复杂度墙就转向更简单的替代方案,偏离原始设计
  3. 记忆与上下文退化 —— 长期项目中逐渐丢失关键细节,前后文不一致
  4. 过度乐观 —— 宣称实验「显著优于基线」,实际结果充满噪声
  5. 领域智能不足 —— 缺乏隐性技艺知识:论文不会写、但实验室里人人都知道的东西
  6. 科学品味薄弱 —— 实验可以执行,但无法判断「这个问题值不值得问」
最后一条尤其值得琢磨:科学品味恰恰最难写成评估指标,而它恰恰决定了整个循环的方向对不对。

七、三条长跑规矩(今天就能立)

失忆是一条能画出来的曲线

上下文占用一轮一轮往上爬,爬满之后系统只能悄悄扔东西——扔的往往是最早的消息,也就是你一开始交代的最重要的规矩。

不做任何管理,连续对话 20 轮,第 14 轮就撞上阈值。之后每一轮都在悄悄丢最早的消息,用户感受就是「它把我最开始说的话忘了」。

三条规矩对应三种失忆

规矩管什么具体要求
压缩阈值「爆掉才处理」占用到线就压,别等报错
永不删除清单「压缩压过头」用户原话、定好的需求、安全约束——这些进了摘要就找不回来,必须钉死
落盘笔记「跨会话失忆」重要结论写进文件,下次开工先读文件
第三条份量最重:这是文件系统持久记忆,也是 Harness 自我改进的起点。它连自己上次学到什么都记不住,就谈不上改进自己。

动手清单

  1. 找到它开始失忆的那一轮(15 分钟,所有人)—— 翻出最长的一次对话,找到第一次忘掉前面交代过的事在第几轮。说不出说明对话还不够长——那也是个有用的结论:你的场景暂时用不到压缩,先别过度设计。
  2. 写下你的三条长跑规矩(1 小时,Agent 要跑长任务)—— 三条都要有具体的数字或清单;「永不删除清单」里至少包含:用户原话的关键约束、M0 定下的需求定义。别写「重要内容」这种废话。
  3. 跑通一次「落盘再读回」(半天,要跨会话干活)—— 干完一件事把结论写进固定文件(工作笔记),关掉会话开个全新的,第一句就让它读文件继续干。新会话能无缝接上,M4 就立住了。

八、审查清单

  • 你想优化的东西,能不能快速、客观地打分?打不了分就别上自动改进循环。
  • 评估器和权限控制,是在改进循环之外由独立机制维护的吗?
  • 你的基座模型够强吗?有没有验证过递归是真改善还是放大噪声?
  • 你有 held-out 数据集吗?改进有没有做过回归检查?
  • 种群多样性有没有专门的保护机制(多样性奖励、档案保持)?
  • 优化目标里有没有可维护性、迁移成本、向后兼容性这类长期指标?
  • 压缩阈值设了吗?是「到线就压」还是「报错才压」?
  • 「永不删除清单」写具体了吗?还是写成了「重要内容」?
  • 跨会话靠什么接上?跑通过一次「落盘再读回」吗?
  • 人在循环里的位置是向上移动了,还是被移出了?

九、约束说明

  1. 论文口径:STOP(Zelikman et al. 2023)、Self-Harness(Zhang et al. 2026)、Promptbreeder(Fernando et al. 2023)、GEPA(Agrawal et al. 2025)、AlphaEvolve(Novikov et al. 2025)、DGM(Zhang et al. 2025)、SIA(Hebbar et al. 2026)、失败模式研究(Trehan & Chopra 2026)。文中只转述其公开结论,不延伸推断,具体数据以原论文为准。
  2. DGM 实验条件:SWE-bench Verified 与 Polyglot 的提升数据基于 Claude 3.5 Sonnet,换基座不可直接外推。
  3. SIA 的证据强度:原文标注为「方向有趣,但证据暂时性」,训练稳定性与 Goodhart 效应仍是开放挑战,本文不作乐观解读。
  4. 「第 14 轮撞阈值」的性质:来自课程的上下文占用曲线演示,为教学化示意,非任何真实系统的实测。真实续航取决于上下文长度、消息大小与压缩策略。
  5. 「能写论文 ≠ 能做科学」:指当前自动研究系统的结构性瓶颈,不否定该方向的价值。
  6. 本集不含题库内容:课程中的动手清单已改写为正文讲解,不在集页另行出题。

十、可带走的原则

  1. 先问能不能打分,再决定用什么方法。 搜索空间庞大、梯度不可用、但评估容易 → 进化最务实;评估慢或主观 → 任何自动循环都是在噪声里瞎跑。
  2. 评估器与权限控制必须在改进循环之外。 这是奖励黑客的唯一解法,也是自我改进系统的安全底线。
  3. 递归不等于必然改善。 基座不够强时递归只放大噪声——上循环前先诚实评估模型能力。
  4. 先立长跑规矩,再谈自我改进。 压缩阈值、永不删除清单、落盘笔记,三条今天就能写进配置且立刻见效。
  5. 人在栈里向上移动,不是退出循环。 完全自主不是终点,人机协作的质量才是。

*来源:xueai.miyang.cn(小山学堂 · 洛小山《学 AI 产品,从入门到精通》)*