01找 · 读
命题
领先的自改进 / agentic 系统几乎不把「整栈」放进同一次进化。它们显式或隐式隔离三件事:
- Candidate(被优化物) — 应用实现、算法程序、skill/prompt/agent-config 等;一次只动其中一类表面,而不是 generator + evaluator + 产品同时改。
- Optimizer(提议者) — planner / generator / meta-agent / evolver / Bayesian search 等,负责提出变更。
- Eval & control plane(评测与控制面) — dataset、metric、holdout、golden SQL、promotion gate、在线北向指标;决定谁留下、谁回滚。
隔离的工程动机很直接:自评价偏松(Anthropic 长跑 harness)、过拟合搜索集(ADAS / GEPA / Meta-Agent holdout)、以及「有评分无落点」的假闭环(Warp)。三者一坍缩,就容易变成 self-reporting 或 reward hacking。
flowchart LR Opt[Optimizer<br/>proposer / evolver] Cand[Candidate<br/>app / algo / skill / prompt] Eval[Eval and control<br/>dataset / gate / holdout] Opt -->|propose change| Cand Cand -->|run / score| Eval Eval -->|accept / reject / promote| Cand Eval -.->|offline tune only| Opt
虚线强调:改 Optimizer / harness 本身通常发生在离线、人审、另一条环上,而不是与 Candidate 同一次 run 共进化。
02找 · 读
Lane 分类
| Lane | Candidate | 典型 Optimizer | 典型 Eval / control |
|---|---|---|---|
| (A) 产品 / App 迭代 | 正在构建的应用(UI/API/DB)或数据 Agent 版本 | planner + generator;工程迭代 | Playwright/QA 阈值;golden SQL;Keep Rate |
| (B) 算法演化 | 算法程序 / kernel / 调度启发式 | LLM ensemble + evolutionary DB | 自动 metric;硬件/正确性验证 |
| (C) Skill / Prompt / Agent-config 演化 | SKILL.md、指令、demos、harness 组件文件 | Improver / MIPROv2 / GEPA / Meta Agent Search | valset、Skill Lift、holdout accept |
| (D) 危险共进化 | 角色边界消失:同一主体既写答案又写评分器,或同时改 candidate 与 gate | 「整栈自改」叙事 | 无独立 holdout / 无回滚 |
(D) 不是「不能有 meta 环」,而是:改 gate 的环必须与被 gate 的环分时、分权、分数据集。ADAS 论文把「meta agent 自身也可被 ADAS 改进」列为 higher-order 未来工作,而不是默认同环共进化。
03找 · 读
案例表:Candidate vs Optimizer vs Eval/control
| 系统 | Candidate | Optimizer | Eval & control |
|---|---|---|---|
| Anthropic long-running apps harness | 应用代码(sprint 产物) | Planner + Generator | Evaluator(Playwright 测 UI/API/DB)+ 准则硬阈值;sprint contract;harness 离线简化 |
| AlphaEvolve | 算法 / 程序 | Gemini Flash+Pro + 进化 prompt sampler / programs DB | Automated evaluators;上线前 verification |
| OpenAI in-house Data Agent | Agent 能力版本(工具/上下文/workflow/memory) | 工程迭代(Codex、工具收敛、enrichment) | 固定问答 + golden SQL + Evals grader;生产 canary;纠错进 memory |
| DSPy MIPROv2 | 各 predictor 的 instruction + few-shot demos | Bootstrap + instruction proposer + Bayesian search | metric + valset;minibatch 探索,周期性 full-val 晋升最佳组合 |
| ADAS Meta Agent Search | 新 agent 的 forward 代码 |
Meta agent(读 archive 编程) | Validation 评分;held-out test 报告;跨域/跨模型 transfer |
| GEPA | 复合系统各模块 prompt(权重冻结) | Reflective mutation + Pareto 选候选(+ Merge) | μ / μ_f;D_feedback vs D_pareto;held-out test |
| Cursor Keep Rate harness | Harness 变体(prompt/tool 形态等) | 工程假设 + 周级 Automation / Cloud Agents | CursorBench 离线 + 在线 A/B;Keep Rate;tool-error 基线 |
| Warp self-improvement | Factory 定义中的 Skills 等 | Improver / self-improvement agent | Scorer rubric + 人 Review PR;diff 落回 VCS |
| ACES Skill Lift | Skill / capability package | (作者侧迭代;评估框架本身) | 配对 live trials:有/无 skill → Skill Lift |
| continual / meta-agent harness | Harness 表面(prompts/tools/hooks…) | Proposer | Search split 评估;holdout 改进才接受;optional final-test |
04找 · 读
Promotion / holdout / 在线失败回流
共性模式:
- Search / train 与 holdout / test 分家 — ADAS(val 搜、held-out 报);GEPA(
D_feedback/D_pareto+ test);meta-agent README(--holdout/--accept-on-holdout/--final-test);MIPROv2(minibatch → full valset 晋升)。 - 硬阈值 / 合同 — Anthropic evaluator 任一准则低于阈值则 sprint fail;OpenAI golden SQL + grader;Warp 人 merge 才生效。
- 在线北向指标 — Cursor Keep Rate + 语义满意度,不只 latency/token;OpenAI 生产 canary + memory 吸收纠错。
- 配对 / 反事实 — ACES:同任务同 harness 有无 skill 的 Skill Lift,避免「写得漂亮但无 lift」。
- Harness-Delta — 已有 KB 纪律:涨分拆过拟合 / 额外 compute / 真泛化(见 Eval Engineering、Harness Engineering)。
05找 · 读
对 Grok Bot / second_brain / harness 的启示(短)
- 明确本轮 Candidate:知识库写入(articles/research/sources)、skill、还是 harness 配置?不要一次 PR 同时改「写稿 agent」与「审稿 rubric」且无独立对照。
- Optimizer 与 Eval 分权:生成用一条 agent;晋升用另一套门(链接可追溯、层语言规则、golden 案例、人审)。
AGENTS.md的层边界本身就是 control plane。 - Holdout 思维:新 skill / 新自动化流程先在小样本 search 上试,再用未参与提案的任务集或 Keep-Rate 类在线信号验收。
- 失败回流:生产/对话纠错应进 eval set 或 memory,而不是只改 prompt 散文(对齐 OpenAI Data Agent + Warp outer loop)。
- 危险共进化信号:若同一 run 里模型既改 candidate 又改评分提示,且无 holdout——停,拆环。
开放问题:何时允许「慢环」改 proposer skill(meta-agent 文档中的 skill evolution)而不污染 task harness;几何平均 / capability gate(AAR)如何迁到 KB 质量门。