Agent 系统正从「把模型接上工具」转向四条可独立验收的闭环:技能如何生长、经验如何复用、能力如何训练与测量、长期执行如何真正停下来。这四条线共同指向同一个工程原则:不可把最终任务分数当作唯一接口;中间状态、结构、证据与授权都必须成为一等对象。
01找 · 读
一、技能演化:同时解决覆盖、可靠性与可搜索性
Designer-RSI:把真实流量变成受回归门控的 procedural memory
Designer-RSI让冻结模型通过 230 多个设计工具完成长程任务,只演化外部自然语言技能库。它把演化拆成两轴:widening 从反复出现但未覆盖的子任务中增补新技能,deepening 对照同一技能的成功与失败轨迹修订旧技能。候选变更必须通过 matched replay gate:至少修复一个失败,同时不能在已观察成功样例上回退。
五轮、1,406 个真实 brief、1,869 条自动评分轨迹后,技能库从 76 增至 139;Claude-Sonnet-4 在 GenEval2 的执行成功率从 72.7% 升至 99.3%。更重要的是,单独 widening 或 deepening 对无技能基线的胜率只有 49.4% / 48.6%,组合后达到 58.5%(p=0.025):扩大覆盖与提高可靠性不是替代关系。
对实践
技能生命周期至少要分成「缺口池→候选→回放门禁→稳定版」四段。新技能先解决 coverage,旧技能靠 success/failure contrast 修复;上线条件应是相对 incumbent 的无回退证据,而不是候选自己的绝对分数。
GraphSkillEvo:把长清单改成可变异、可交叉的执行图
GraphSkillEvo指出,无结构自然语言技能同时妨碍执行与优化:模型不知道当前该读哪一段,优化器也在大量同义表述中搜索。它把单个技能表示为「global guidance + 执行节点 + 条件化有向路径」,再用 population-based mutation / crossover 搜索技能结构。
五类 agent benchmark 上,相对 SkillOpt,平均准确率在 GPT-5.4-nano 上提高 4.01pp、GPT-5.4 上提高 1.76pp;小模型与 SpreadsheetBench、ALFWorld 等程序性任务获益更大。消融也表明收益不是单纯来自更多候选:去掉图结构、mutation 或 crossover 都明显下降。
对实践
当 SKILL.md 开始出现重复步骤和大量 if/then 段落时,不要继续堆 prose。把可复用步骤抽成稳定 node id,把「何时走哪条路径」放到 edge/route;验证器检查引用完整性,优化器只在节点、边和少量 global rules 上做 patch。
02找 · 读
二、经验复用:保留依赖,而不是把轨迹压成一团摘要
MACE:memory composition 与 presentation 必须联合学习
MACE把多 agent 协作经验表示为 MemGoG:每个 functional memory unit 保存条件、动作、产物之间的内部依赖,unit 之间再以 support / conflict / repair 等关系连接。运行时在预算内组装 working graph,并按 agent 当前角色与阶段呈现为 instruction 或 checklist。
关键发现是「取什么」与「怎么给」不可分开计分:相同内容换成 guide 或 checklist 后,最佳组合会反转;联合更新 composition-format pairing 优于分别打分。八个 benchmark 上,MACE 平均 81.11%,强于最强基线 SAGE 的 78.97%;去掉 agent-memory coupling 或 MemGoG 的跌幅最大。
对实践
记忆检索日志不能只留 memory id 与最终 reward。至少记录:调用者角色、阶段、选中的 unit/relations、呈现格式、局部产物、下游影响与团队结果。调度器优化的对象应是 (memory bundle, recipient, format, timing),不是孤立的 top-k 文档。
DENSE:不用终局标签,也能从局部进展提炼 shortcut tree
DENSE处理大量生产轨迹缺少 task-specific verifier 的现实。它从轨迹里的局部进展、恢复动作和未完成义务构造 nested shortcut tree:完成分支被压缩,未解分支被展开,不同层级的问题通过 recovery evidence 对齐。REFIT 协议让接收模型在环境与上下文重置后,基于同一初始轨迹的反馈重新尝试。
Terminal-Bench 2.1 上,DENSE 对四个接收模型的 strict pass rate 相对初始执行提高 7.12–15.64pp,同时重跑时观测 token 减少 19.0–43.6%。它说明可复用经验不必等待一个完美终局 oracle,但必须绑定可检查的局部证据与剩余义务。
对实践
失败轨迹不要只压成「经验教训」。写成三栏:validated progress、recovery evidence、open obligations;复用时先走已验证 shortcut,再把预算留给未完成分支。这样既避免重复探索,也不把半成品误写成成功模板。
03找 · 读
三、Coding agent:训练环境、回归集与 correctness oracle 要分层
CodeMidas:代码本身可以生成 RL 环境
CodeMidas不依赖 issue/commit,而从已有实现反推行为规格、生成基于原代码执行的测试,再用多轮 solution rollout 验证与过滤任务。最终得到 3,185 个开源仓库、23 种语言、15 个领域中的 5,545 个训练任务。用 GRPO 训练 MiMo-V2.5 后,DeepSWE +11.7%、ProgramBench +17%、Terminal-Bench 2.1 +8.5%。
对实践
内部代码库也能成为 environment factory:从稳定模块抽 behavioral contract,保留原实现作为 test oracle,隔离生成器与求解器,并用重复 rollout 淘汰含糊任务。训练集扩容前先看 verifier 的区分力,而不是只看任务数量。
SWE-Proof:tests 通过不等于 issue 被正确解决
SWE-Proof用 Benchproofer 将真实仓库 issue 转成机器检查的形式化规格,并构造 500 个 SWE-Proof 问题。两个 frontier model 中,通过测试的 patch 仍有约四分之一到一半能被形式验证找到反例;给 Opus 4.8 正确形式规格后,resolution 从 85% 升至 95%。但让模型自己写规格并没有超过无辅助基线,只有 62% 的自写规格通过审计,主要失败是 specification 不 faithful。
对实践
回归层级应是 unit/integration tests → mutation/adversarial tests → contract/spec proof。不是每个 patch 都要上 formal proof,但权限、账务、迁移等高后果路径要把「规格忠实度」单独评估;不要让同一个 agent 同时定义需求、实现和签发正确性证明。
Efficient Benchmarking in Production:生产回归不必每次全跑
Efficient Benchmarking in Production分析一个服务数万月活用户的 analytics agent 的 574 次历史 benchmark run。多维 2PL adaptive testing 只执行 200 题(完整集 38.5%)即可把整体分数 MAE 控制在 1.03pp;团队最终仍部署 difficulty-stratified fixed subsets,因为它更简单,并能迁移到五个其他 agent family,短至一天的校准窗仍稳定。
对实践
把评估拆成三层:每次提交跑固定分层 smoke subset;主干定时跑 adaptive/representative subset;发布前或漂移告警后跑 full suite。省下来的预算优先增加多 seed、失败复现和高后果 case,而不是单纯降低评估成本。
04找 · 读
四、长期执行控制:撤销授权不是发一个 cancel
Authorization Revocation:证明旧授权路径已经静默
Authorization Revocation for Long-Running AI Agents指出,长期 agent 的影响会穿过 credential、delegated task、queue、callback、reservation 和 provider-side operation 延续。进程退出或 token revoke 既关不掉已排队的 carrier,也无法保护由其他独立授权支持的共享工作。
论文定义 root-scoped authorization quiescence:对某个已退休 root-epoch,系统必须为所有登记的旧授权路径给出 cut/fence 证据,证明 fence 之后受保护 sink 不再接受旧 root 支持的效果;如果当前存在独立且充分的新授权,可以精确 rebind,而不是粗暴清空所有共享任务。缺失或冲突证据必须保持 indeterminate,不能默认成功。
对实践
无人值守 agent 的 stop protocol 需要:root epoch、delegation lineage、provider frontier、sink fence、late-effect test 与可验证 certificate。UI 上的“已取消”只能在 quiescence 证明完成后显示;否则应明确是“停止继续扩张,仍在等待旧路径收敛”。
05找 · 读
系统图:四条闭环如何咬合
flowchart LR traffic[真实流量与执行轨迹] --> gap[覆盖缺口 / 失败证据] gap --> skill[技能 widening + deepening] skill --> gate[matched replay gate] gate --> runtime[生产 agent runtime] runtime --> mem[functional memory graph] mem --> compose[bundle × recipient × format] compose --> runtime runtime --> dense[shortcut tree: progress / recovery / obligations] dense --> runtime code[代码与历史任务] --> env[RL environments + verifiers] env --> train[agent training] train --> eval[分层 benchmark + formal proof] eval --> runtime runtime --> auth[root epoch / delegation lineage] auth --> fence[sink fence + quiescence certificate] fence --> runtime
06找 · 读
落地判断
- 技能库会增长:先上 versioned skill、缺口池和 replay gate,再谈自动演化。
- 多 agent 会复用经验:把依赖关系与 presentation choice 一起记录,别只做向量 top-k。
- coding agent 要持续训练:把源代码转成可执行环境,但将 task generation、solver 与 verifier 隔离。
- 评估成本开始失控:采用固定分层小集 + 自适应中集 + 全量发布集,并给高后果路径更强 oracle。
- 任务可能跨小时或异步外溢:在开放更大 autonomy 前实现 root-scoped revoke 与 late-effect test。