Ecdysis(arXiv:2609.11677)
源:09-10。Harness 自演化的核心瓶颈不是「再搜一轮」,而是失败归因:单次失败可能是模型 idiosyncrasy,也可能是 harness 系统性缺陷;对每条失败串行改 harness 会做 model-specific accommodation,损害跨模型泛化。Ecdysis:batch 级跨实例失败聚合(优先覆盖 ≥2 任务的失败组)+ FDCR(Analyst/Critic/Engineer → Moderator 出修改规格 → coding agent 落地)。相对 Self-Evolution 训练最高约 1.84× 加速,推理准确率相对提升约 18.56%;手工统计 accommodation 比例 t 从 SE 的 60% 降到 45.5%。1/4 诊断性训练失败可逼近全量。对照 HarnessEvolve / Co-Evolving / Scanning:把「该不该改 harness」升为一等决策。
COBRA-Skills(arXiv:2609.11682)
源:09-10。Skill 优化预算紧:执行评估贵、反复轨迹分析贵。COBRA 把候选 skill 当 contextual arm:embedding + 神经奖励预测 + LinearUCB 探索,选评后再按日程做 regeneration / rollout mutation / crossover。六基准 × 三目标模型:相对无 skill +13.1/+26.9/+22.5 pp;相对 SkillOpt 总成本降 55–58%,每基准仅 50 条优化样例。Claude Code / Codex 外挂 harness 仍领先;自教(目标模型当 teacher)几乎不掉点且成本约半;34/36 跨模型 skill 迁移为正。对照 SkillAlign(暴露接口)/ SkillAdam(编辑预算)/ SkillOpt:COBRA 回答「有限评估预算下先评谁、何时演化种群」。
OpenAI Agents API(托管 Codex harness)
源:09-10 public beta。产品化主张:OpenAI 管 session / orchestration / compaction / recovery;应用侧管 tools 与 environment(none / openai_hosted / self_hosted)。四概念:Agent / Environment / Session / Events。Harness 能力清单含 sandbox、skills(capability_directories)、MCP、mid-turn steer、subagents、resume。数据:美区 residency;非 ZDR(自托管环境也不变)。对照此前 openai harness engineering 文与 vLLM AgentX:一边是「自建 serving+harness」,一边是「把 harness 当 API 卖」。
Craft:Rethinking skills / prompts for GPT-6 Astra
源:09-11 Eric Provencher。更强模型下,去年堆的 skill / AGENTS.md / prompt 会过度约束。要点:描述尽量短且触发条件精确;progressive disclosure(根文档当 router);少写 itinerary 式菜谱;AGENTS.md 按任务上下文指向文档,勿每次预读全仓;决策边界语言要对齐模型(Astra 更对齐,过强「先问」可能早停);持久性——显式定义 done,否则 Astra 更 tentative。对照 SkillAlign compact exposure 与昨日 Agent Manager craft:官方把「清理指令税」写成发布配套动作。
Coordination Backbone(multi-agent orchestration)
源:09-11。主张:propose ≠ commit——agent 产出结构化结果(artifacts / evidence / typed outcome / proposed next),引擎按 transition policy 校验后才落状态。Agent catalog 按 capability 路由而非硬编码边;工作单元合同(intent/IO/权限/证据/门禁)是可观测前提;明确 completed / waiting-human / recoverable / terminal / transient;会话史不是权威状态——durable state + idempotent dispatch。对照 Procedural Graphs / graph-engineering:图可涌现,但协调脊梁必须稳定。
交叉读法(给 articles 就地折入用)
| 主题 | 落点建议 |
|---|---|
| 失败归因 vs model accommodation | harness-engineering;self-improvement-loops-and-agent-evolution |
| bandit 预算下的 skill 演化 | agent-skills-engineering |
| 托管 harness / session API | harness-engineering;对照 llm-inference-engineering |
| skill/AGENTS.md 指令税 | agent-skills-engineering;personal-development-in-the-ai-age |
| propose/commit + durable orchestration | graph-engineering;evidence-engineering |