01找 · 读
Chronicle:把事故录像切成可 CI 的回归(arXiv:2609.20625)
源:LLM agent 失败难复现——推理非 bit-stable、工具读可变状态、多步轨迹重跑几乎不重复。现有 record-and-replay 多用于追踪/打分,不能把一次事故变成「对代码改动的回归测试」。Chronicle 在非确定性边界记录不可变 envelope,并提供核心操作 cut-point replay:子集边界回放录像、互补子集用新代码实跑,把录制事故转成 CI 回归。6 条录制失败 + 模拟模型边界:录制开销中位 23 µs/crossing(相对假设 300 ms 模型调用约 0.008%)、全量回放 0 次模型调用且 20 次 bit-stable;相对开关录像的真实 Qwen 延迟差落在噪声内。
对实践
对齐 DeltaSelect / CHASE / Empirical Harness:生产 harness 要有 事故→回归 管道,而不是只靠重跑 flaky e2e。对工具边界(文件系统、时钟、网络、模型 I/O)做 envelope;改 skill / 路由 / 权限后,对已知事故集做 cut-point replay,而不是「再跑一遍看运气」。
02找 · 读
AdaRepair-Mem:仓库级修复的记忆要按覆盖与阶段取(arXiv:2609.20130)
源:仓库级 APR 的记忆检索有三坑——跨仓 episodic 极不均衡、记忆越多不单调涨分、阶段错位(复现经验多、补丁/精炼经验少)。提出 AdaRepair-Mem:Coverage-Aware Retrieval(同仓不足则跨仓/按修复类型回退)、Quality-Aware Selection、Stage-Aware Routing(复现 / 定位 / 生成 / 精炼 / 验证)。SWE-Bench 上低记忆仓增益更明显(例:flask BaseMemo 41.2%→52.3%,+11.1pp;django 高记忆仓 +2.7pp);全文主张「关键是取对的记忆,不是堆更多记忆」。
对实践
对齐 Missing Complement / RAFT / LifeFuse-Mem:agent 记忆库按 阶段分区 + 覆盖回退,别全局 top-k。低资源仓显式允许跨仓/跨类型回退;注入前按当前 repair phase 路由,避免把「复现笔记」塞进「打补丁」回合。
03找 · 读
Correct Now, Insufficient Later:当前答对 ≠ 压缩仍充分(arXiv:2609.20045)
源:记忆可以答对当前查询,却丢掉未来更新所需的区分。用 paired-history audit:两段历史当前答案相同、共享未来更新、但随后答案应不同。24 对历史 × 6 机制 × 12 记忆条件 × 2 后端。确定性 frontier selector:DeepSeek 96/96、GLM 82/96 严格 reveal;结构化 writer 62 成功(1 未决)与 56/96。记录级审计区分「保留状态是否够用 / 是否交付 / schema 是否合规」。结论:要通过「未来更新是否仍可辨」审压缩,而不是只看当前 QA。
对实践
对齐 SoL-Pi / AgentZip / Missing Complement:上下文压缩验收加 paired update probe——同一当前答案、分歧后续更新。compaction / memory write 的回归集要含「tombstone / 最新条 / frontier」对照;当前答对不能当合并绿灯。
04找 · 读
UnifiedPlayers:规划·执行·评估要共演化(arXiv:2609.20089)
源:自演化 agent 常把轨迹生成与评估拆开——静态 verifier 跟不上新失败模式,自洽信号又可能放大共有错误。UnifiedPlayers 用 Planning / Execution(含 Python 工具多轮)/ Evaluation 三玩家共合作,以可执行 verifier 为共享反馈;角色专用奖励缓解「一方改数据、另一方训练目标漂移」的协调难题。两骨干上平均最优;通用域五基准平均约 46.x 档,并报 learned verifier ~84% 量级能力。要点:评估器本身要进训练闭环,而不是外挂死脚本。
对实践
对齐 CHASE / Overclaim / Empirical:自动造轨迹时,同步训可执行 verifier,并给 plan/exec/eval 分角色奖励。静态单测套件当底线;对新兴失败模式要能从 Evaluation Player 生长新检查,而不是只靠自洽投票。
05找 · 读
Ownership:过程决定「这还算我的活」(arXiv:2609.20658)
源:探索性质性调查——每人描述一高/一低 ownership 的近期 AI 协作任务。所有感取决于协作过程:只审批 AI 建议时容易弃权;主导、迭代、重写时保留 ownership。亦可「拥有愿景但不亲手执行」仍感高 ownership;失去个人声音与不理解输出都会侵蚀所有感。样本人口约 n≈60+(年龄/地区表)。对学习与工艺:产品应暴露过程痕迹(编辑、拒绝、决策),而不是只交终稿。
对实践
对齐 Deskilling / When AI Augments Work:学习型与交付型 skill 默认要求 可读改写轨迹(diff、拒绝点、决策摘要);教练流优先「先草案→人改」而非「一键采纳」。组织度量勿只看吞吐,加「作者是否仍能解释/重写输出」。
06找 · 读
On-Demand Attention:模型其实知道何时该全局召回(arXiv:2609.20734)
源:长上下文 agent 解码若逐步全量读历史,浪费大。发现预训练解码状态在全局读之前已能预测「这次全量注意力有无收益」。ODA(On-Demand Attention):local-first,轻量 recall head 按需触发全局注意力;只训 recall head,预训练权重与完整 KV 可保留。vLLM GPU 条件执行把少读变成吞吐。控制实验(128K in / 1K out、12.5% global-call):主解码算力约 -76% FLOPs,单请求吞吐约 1.98×;Qwen/Gemma(含 hybrid)上选择性召回可补回局部注意力损失。
对实践
对齐 DeepSeek-V4.1 KV / Tiered KV / AgentKV:服务端选型除「KV 字节/token」外,看是否支持 条件全局读。Harness 侧长轨迹不要假设每步全历史同等重要;日志里标「本步是否 recall」,便于与 ODA 类运行时对齐。
07找 · 读
Chalupa:harness = loop + tools + memory + gates(2026-09-19)
源:实务博文把 harness 收成四件——loop / tools / memory / gates。v1 可以是脚本+operation.md+log.md;强调 DONE 可检查、工具超时与结构化错误、先只读门控。NxtOS 路径:intake→生成 bundle→validate/render/reconcile/drift;用 ACP 换引擎前先跑 mediation probe(有的引擎会不经确认写盘外文件)。NLM 记忆:会话开始召回、存事实不存整段 transcript、记忆与 bundle 对账;硬化清单含 DONE、probe、eval gate、密钥引用、CI、日志、一页人读产物。
对实践
对齐 How Harnesses Create Value / Empirical / Levels-Ticks:新建内部 agent 先写 四件套清单,再挑模型。上线无人值守前强制 mediation probe + eval gate;记忆层默认「启动召回 + 事实化写入 + 定期与 AGENTS/bundle 对账」。
08找 · 读
交叉图(本窗)
flowchart LR chron[Chronicle cut-point CI] ada[AdaRepair-Mem stage memory] suf[Correct-Now sufficiency audit] uni[UnifiedPlayers plan/exec/eval] own[Ownership process] oda[ODA on-demand attn] chal[Chalupa loop/memory/gates] chal --> chron chal --> ada suf --> ada chron --> uni uni --> chron oda --> chal own --> chal
把 harness 四件套落地 → 事故可 cut-point 回归 → 记忆按阶段/覆盖取用并以未来更新审压缩 → 规划执行评估共演化 → 推理侧按需全局召回托住长程 → 人机面保留过程所有感。
09找 · 读
Open follow-ups
- Chronicle envelopes × DeltaSelect 小集:事故回归是否可并入开发 A/B 冻结集。
- AdaRepair stage routing × RAFT 时间线条目 / Missing Complement 缺口组。
- Sufficiency paired-history × SoL-Pi ObservationPack / AgentZip compaction 门禁。
- UnifiedPlayers learned verifier × CHASE 协议反事实 / OverclaimBench。
- ODA recall head × DeepSeek-V4.1 CSA2 / Tiered KV 产品表。
- Ownership 过程痕迹 × Deskilling 元认知反馈写入教练 skill。
- Chalupa mediation probe × 组织 ACP/引擎升级清单。