second brain research
← 全部阅读

← 2026-09-12 日阅读

2026-09-12

Ecdysis / COBRA-Skills / Agents API / Astra skills craft / Coordination Backbone

harness-evolutionagent-skillsmanaged-harnessmulti-agent-orchestrationlearning-and-craft

窗口 ~2026-09-10→09-12(Asia/Shanghai)。去重 SB-20260911 tip 4d2a71b…(Google behavioral evals / AgentAudit / SkillAlign / vLLM AgentX / Agent Manager craft)与 nightly tip 594d715f(SoL-Pi / awesome-rsi 用户 ingest,不重挖)。本窗无独立 models-and-infra 新主源(AgentX 已收);Agents API 以「托管 harness 产品化」落 agentic。

Ecdysis(arXiv:2609.11677)

:09-10。Harness 自演化的核心瓶颈不是「再搜一轮」,而是失败归因:单次失败可能是模型 idiosyncrasy,也可能是 harness 系统性缺陷;对每条失败串行改 harness 会做 model-specific accommodation,损害跨模型泛化。Ecdysis:batch 级跨实例失败聚合(优先覆盖 ≥2 任务的失败组)+ FDCR(Analyst/Critic/Engineer → Moderator 出修改规格 → coding agent 落地)。相对 Self-Evolution 训练最高约 1.84× 加速,推理准确率相对提升约 18.56%;手工统计 accommodation 比例 t 从 SE 的 60% 降到 45.5%。1/4 诊断性训练失败可逼近全量。对照 HarnessEvolve / Co-Evolving / Scanning:把「该不该改 harness」升为一等决策。

COBRA-Skills(arXiv:2609.11682)

:09-10。Skill 优化预算紧:执行评估贵、反复轨迹分析贵。COBRA 把候选 skill 当 contextual arm:embedding + 神经奖励预测 + LinearUCB 探索,选评后再按日程做 regeneration / rollout mutation / crossover。六基准 × 三目标模型:相对无 skill +13.1/+26.9/+22.5 pp;相对 SkillOpt 总成本降 55–58%,每基准仅 50 条优化样例。Claude Code / Codex 外挂 harness 仍领先;自教(目标模型当 teacher)几乎不掉点且成本约半;34/36 跨模型 skill 迁移为正。对照 SkillAlign(暴露接口)/ SkillAdam(编辑预算)/ SkillOpt:COBRA 回答「有限评估预算下先评谁、何时演化种群」。

OpenAI Agents API(托管 Codex harness)

:09-10 public beta。产品化主张:OpenAI 管 session / orchestration / compaction / recovery;应用侧管 tools 与 environment(none / openai_hosted / self_hosted)。四概念:Agent / Environment / Session / Events。Harness 能力清单含 sandbox、skills(capability_directories)、MCP、mid-turn steer、subagents、resume。数据:美区 residency;非 ZDR(自托管环境也不变)。对照此前 openai harness engineering 文与 vLLM AgentX:一边是「自建 serving+harness」,一边是「把 harness 当 API 卖」。

Craft:Rethinking skills / prompts for GPT-6 Astra

:09-11 Eric Provencher。更强模型下,去年堆的 skill / AGENTS.md / prompt 会过度约束。要点:描述尽量短且触发条件精确;progressive disclosure(根文档当 router);少写 itinerary 式菜谱;AGENTS.md 按任务上下文指向文档,勿每次预读全仓;决策边界语言要对齐模型(Astra 更对齐,过强「先问」可能早停);持久性——显式定义 done,否则 Astra 更 tentative。对照 SkillAlign compact exposure 与昨日 Agent Manager craft:官方把「清理指令税」写成发布配套动作。

Coordination Backbone(multi-agent orchestration)

:09-11。主张:propose ≠ commit——agent 产出结构化结果(artifacts / evidence / typed outcome / proposed next),引擎按 transition policy 校验后才落状态。Agent catalog 按 capability 路由而非硬编码边;工作单元合同(intent/IO/权限/证据/门禁)是可观测前提;明确 completed / waiting-human / recoverable / terminal / transient;会话史不是权威状态——durable state + idempotent dispatch。对照 Procedural Graphs / graph-engineering:图可涌现,但协调脊梁必须稳定。

交叉读法(给 articles 就地折入用)

主题 落点建议
失败归因 vs model accommodation harness-engineeringself-improvement-loops-and-agent-evolution
bandit 预算下的 skill 演化 agent-skills-engineering
托管 harness / session API harness-engineering;对照 llm-inference-engineering
skill/AGENTS.md 指令税 agent-skills-engineeringpersonal-development-in-the-ai-age
propose/commit + durable orchestration graph-engineeringevidence-engineering