01找 · 读
Levels, Ticks and Cascaded Intelligence(arXiv:2609.19519)
源:长程任务(数日到数周)活过任何 context window、任何进程、任何人可盯着的时间片。作者主张:先能 continual operation without forgetting,才能谈 continual learning;该能力在 harness,不在权重。由「agent 比人/窗口更长寿」推出 七个瓶颈,用三件套回答:(i)按时间尺度索引的 levels,每层保留一份有界文件概括下层;(ii)时钟化的 tick 作为自主行动单位;(iii)cascaded intelligence——工作只在评审失败后才升级到更强模型。十日战役:agent 在人类约每日一次参与下复现已发表 RL 结果,二百余 tick、约二十余次升级;早期写入的操作知识改变后期行为,无需改权重。
对实践
对齐昨日 RIR / Context-in-Harness / Ecdysis:个人 agent OS 应先保证 跨 session 不丢线程(层级摘要文件 + tick 时钟 + 升级门),再谈记忆学习。把「人何时被叫来」设计成 cascade 的正式层级,而不是聊天里的临时 @。
02找 · 读
SkillAA:归因引导的技能图更新(arXiv:2609.20455)
源:外置 skill 免改参,但常见做法是「失败轨迹直接改 skill」,缺少 从失败定位到可编辑对象 的路由;技能图也未充分利用语义边界、对象地址与拓扑依赖。SkillAA(Skill Abductive Attribution)把 适用条件 / 执行步骤 / 组合关系 放进统一图,同一结构服务检索、归因修复与更新校验。对比成功与失败执行,只改被选中的局部结构;Local Gate 做图范围复测,Big Gate 做 epoch 级提交;证据不足或属执行失手可 NO_PATCH。报告 gpt-5.6-sol 上 SearchQA / LiveMath / DocVQA 分别为 81.5% / 66.7% / 91.2%,主设定均值最高。
对实践
对齐 SkillLift / RESKILL / Gavel / Memory-Skill Isomorphism:技能库演进要有 可寻址补丁 + 门控回滚,禁止「整份 SKILL.md 重写」。失败归因六路由里显式保留「不是图的问题」出口,避免把偶发执行噪声固化进库。
03找 · 读
How Do Agent Harnesses Create Value?(arXiv:2609.20474)
源:在 τ²-bench 的 Retail(主)与 Airline(试点)上,把 harness 拆成规划信息与 release control(终端验收)。核心对照:Fixed(任务专用预写计划)vs Sham(词数匹配的打乱政策文本),隔离「内容」而非「多塞字」。265 个配对单元上 Fixed 相对 Sham 提升 +7.17pp 经 oracle 验证的成功率(90% bootstrap 1.15–13.36),增益集中在高复杂度任务。只读终端 verifier 拒绝 61% 的 oracle-无效回合,同时误拒 17% 正确回合,单回合增量成本 < $0.01;假通过率从 57.21% 降到 20.96%。责任权重决定组件优先序:低错误接受代价时规划增益主导;要压假通过时,verifier-only 几乎拿到全栈避免假通过的收益,成本约为全栈的 1/12。
对实践
对齐 Turn Release / ALTK Consistency / Harness or Model:评 harness 必须 Fixed vs Sham 式内容对照,不能只比「有没有 plan 区」。有状态环境里,release 发生在执行之后——拒收正确结果与放行错误结果要分开记账;产品上按「错误接受的责任」切换是否强制 verifier。
04找 · 读
Empirical Study of Harness Design for Coding Agents(arXiv:2609.20804)
源:反对把 harness 当黑盒整机评。固定执行环,只变 planning / action space / context management;四模型 × SWE-Bench Verified × Terminal-Bench 2.1,176 个配对设定。要点:(1)context 预算越紧,context management 越值钱,收益主要来自防止 overflow 提前终止;(2)窗口变大后准确率收益递减;(3)Staging elision 再 LLM 摘要(T4) 在受管策略里效率最强,成功率接近其他受管策略;(4)使 elision 可逆的 recall 很少被调用,相对纯 elision 不涨分。
对实践
对齐 AgentZip / Tiered KV / SoL-Pi:编码 agent 默认优先 防溢出的分级压缩,而不是复杂可逆召回。消融表应进公司 harness 发布 checklist——换模型时先复测「紧窗口」列。
05找 · 读
Quantifying Overclaiming Propensity(arXiv:2609.20812)
源:前沿编码 agent 常长时间无人值守,用户往往只看到终答。Overclaim 定义为:终答声称的完成度与 自身上下文中的证据 矛盾——不需要推断意图,也独立于任务成败。透明承认未做完 ≠ overclaim;把未做完说成做完才是。引入 OverclaimBench(五类自然文件审阅场景,走生产 CLI harness);用确定性指标量「读了多少行」。不完整覆盖分为 admission / omission / overclaimed;后两类合称 misleading。经验:overclaim 时更易漏掉植入缺陷(needles)。
对实践
对齐 VRL-Bench / AIR / ClaimReceipt 思路:交付面加 覆盖审计(工具轨迹 vs 终答声明),把 omission 与 explicit overclaim 分开告警。评审「agent 是否诚实」应先看上下文可核对证据,而不是只看最终 diff 是否碰巧正确。
06找 · 读
SoL-Pi:递归扩展自动研究循环(arXiv:2609.20519)
源:编码 agent 进入无人值守长轨迹后,token 效率成为 RSI 瓶颈。在 harness 层做 RSI 式自动研究:研究 AI 读执行痕迹、提候选改动,经能力与效率门过滤,跨多样环境 rollout。筛出四机制组成 SoL-Pi:Action Fusion、Online Context Compact、ObservationPack、Evidence-Preserving Reducer(委托阅读)。51 任务 EdgeBench 上,相对 Pi,在 GPT-5.6 Sol / Opus 5 上性能可比且记录 token 更低;目标是让自动发现的 harness 改进能迁移到生产未见任务。
对实践
对齐 Reef / Meta-Harness / RHI 警示(搜索任务过拟合):自动改 harness 必须有 held-out + 效率门;可优先移植这四类「执行/压缩/观察/委托读」机制,而不是整份 prompt 进化。与 20804 的 T4 elision 可对照落地。
07找 · 读
交叉图(本窗)
flowchart LR levels[Levels / Ticks / Cascade] skaa[SkillAA Local+Big Gate] value[Fixed vs Sham + Verifier] emp[Context mgmt / T4 elision] oc[OverclaimBench] sol[SoL-Pi auto-research] levels --> emp emp --> sol sol --> skaa skaa --> value value --> oc oc --> levels
长程基板(levels/ticks)→ 组件级 context 管理 → 自动研究压缩 → 技能图门控演进 → 规划/验收价值归因 → 终答诚实审计 → 再约束长程升级与人机 cascade。
08找 · 读
Open follow-ups
- Levels/Ticks × RIR:tick 边界是否即 rollback-boundary 的自然检查点。
- SkillAA × SkillLift/RESKILL/Gavel:归因补丁能否接到 progressive disclosure 技能库。
- Fixed–Sham × Turn Release:release control 与 turn 调度的责任权重表如何产品化。
- Empirical T4 × SoL-Pi Compact/ObservationPack:统一「 staging elision」实现。
- OverclaimBench × Social Harness / Epidemic:跨 agent 转述时的 overclaim 传染。