窗口 ~2026-09-08→09-10(Asia/Shanghai),覆盖漏做的 09-09。对照 SB-20260908(EvoHarnessBench / HoH / TROVE / CUA / Multi-Harness RL / Persistent Skills)与 SB-20260907(HarnessEvolve / CONTINUITY / Trace2Tower)。
CapScope(arXiv:2609.08371)
源:coding agent 工具常带 ambient authority(能命名资源就能作用);间接 prompt injection 把指令藏进仓库文件或工具输出。CapScope 在读不可信内容前,从可信输入推导 task-wide authority ceiling;给每个 agent 独立 typed capabilities,存在模型上下文之外;每次 tool call 按签发该调用的 agent校验。注入可诱使请求动作,但缺 capability 则拦截。Pi agent 修复工作流(5 任务 × 5 注入面 × 4 授权条件 × 3 次,300 runs):ambient / global-policy 下注入效应 33–47/75,CapScope 3/75;修复完成率 68/75(基线 68–72/75)。对照 isolation triad:授权边界应落在 harness 层,而非指望模型「识别恶意文本」。
SkillAdam(arXiv:2609.08944)
源:skill 自演化常因启发式修订而不稳。SkillAdam 把 Adam 一/二阶矩迁移到离散 skill 文档:optimization memory 累积问题与既往解法(方向稳定);volatility-driven edit budget 按近期 case 改善波动控制修订幅度(更新自适应)。七基准上更稳、更少迭代、更低成本。对照 Persistent Skills 的 revision churn 与 SkillGLoW:有记忆的优化器 比「每轮覆盖写」更接近可审计技能库。
Co-Evolving Harnesses and Models(arXiv:2609.09134)
源:先用弱模型演化 harness,强专家往往用得更好;但把专家完整轨迹在已演化 harness 下模仿到弱模型会回退(七企业任务上 Qwen3-Coder / Gemma 4 掉 4–30 点),同一流程在未演化 harness 下反而有用。分析:模仿提高 scaffold 使用,但破坏 model–harness fit——弱模型学会专家规划风格却执行不动。需要 on-policy correction 让弱模型在自身 harness 轨迹上追赶。对照 Multi-Harness RL 与 HarnessEvolve:演化顺序与训练信号必须匹配「谁的 harness」。
ExecCritic(arXiv:2609.09133)
源:执行反馈只有在测试抓住 issue 行为时才有用;同一轨迹既写 patch 又写测试会共谋造假自信。ExecCritic:Test agent 独立生成仓库原生测试 → fail-closed harness 资格审查并冻结 → Repair agent 只改源码不改测试;两角色分训(Learn to Test / Test to Improve)。SWE-bench Verified 上测试质量决定反馈是否帮得上。对照 HoH「实现时测试 ≠ 独立评估」与 evidence engineering:验证物必须与实现隔离。
Procedural Graphs(arXiv:2609.09153)
源:把程序性知识组织成 (procedure, relation, procedure) 图(对标知识图谱的 what-is)。每步定位活跃节点,guidance model 把邻域子图译成步骤级情境指引(偏置但不独裁)。图自演化:refiner 对比失败/成功轨迹改拓扑与属性,仅提交在 held-out 上不降的编辑。对照 TROVE 的结果条件转移图与 graph engineering:执行结构本身可成为可编辑 harness 组件。
Scanning the Harness(arXiv:2609.07360)
源:date-honest(09-07)。3171 公开仓(2660 多组件 setup + 511 skill 集合)。三类安全缺陷经独立复现 + 双模型裁决后仍成立:MCP 无版本钉扎 9.8%;scoped 外观下预批准任意执行(如 Bash(python:*))3.1%;skill 预批准 shell 3.8%。合计 16.0% setup 有安全缺陷。无 lockfile、无装时检查、无能力词汇表。对照 CapScope:供应链缺陷说明「共享 harness 组件」默认 ambient;需要钉扎、能力声明与安装闸门。
RobustSGPO(arXiv:2609.09646)
源:09-09。SGPO 用执行反馈改 harness,但未规定编辑范围与操作。RobustSGPO:声明请求编辑 → 构造并检查 patch → 从 incumbent 或保留快照续搜。AgentX brainstorming(120 任务 / 95 runs / 7350 candidates):周期 $1\to2\to3$ 权限调度优于固定最大权限;30 held-out 完成率 60%→80%,测试质量 3.77→4.14(2e7 token 预算)。类别保留减轻源任务退化。对照 HarnessEvolve 双门与 EvoHarnessBench forgetting:搜索空间控制与 retention 是同一枚硬币。
交叉读法(给 articles 就地折入用)
| 主题 | 落点建议 |
|---|---|
| capability 授权 / ambient authority | harness-engineering + isolation triad;harness-paradigm-and-governance |
| skill 优化记忆 / 编辑预算 | agent-skills-engineering |
| model–harness fit / on-policy | self-improvement-loops-and-agent-evolution |
| Test↔Repair 隔离 / fail-closed | evidence-engineering;eval-engineering |
| procedural graph 自演化 | graph-engineering |
| harness 供应链缺陷 | harness governance + agent-skills 装机闸门 |
| SGPO 搜索空间 / retention | harness-engineering Sensors + Harness-Delta |