窗口 ~2026-09-16→09-18(Asia/Shanghai)。去重 tip 958ff4fa5e5987c74b40c07ec2e97db4bf96f4f6(SB-20260917:Social Harness / Memory-Skill Isomorphism / Interactive Memory Learning / ALTK Consistency Pass^k)与 SB-20260916(SkillLift / RESKILL / MTAC-IFBench / Gavel / AgentKV / Reef);不重挖 Skill Issue / Harness or Model / LifeFuse-Mem / AIM / VRL-Bench / When AI Augments Work / ORCH / When Agents Disagree / Mr.LHDR / T1 / RSI / Context-in-Harness / Artificial Id / AgentZip / Env-Probing / Turn Release / AIR / Tiered KV / TIMEWELL / Ecdysis / COBRA / Agents API / Astra / Coordination Backbone。本窗 tip 未前移(无新 X-bookmark / autosave)。跳过偏 GUI 的 EchoPath / EvoSkill-GUI,以及窗外 REALM(09-13)等。主源:09-16 的 rollback 边界控制、双过程认知扩展、集体失控流行病解释、路由×agent 共演化,以及 09-15/17 更新的 Gemini 3.8 Live 语音 agent 栈。
01找 · 读
Rollback-Induced Reflection(arXiv:2609.18304,v2 09-17)
源:长程交互中单步错误会污染后续环境态与观察。信息层修正(Self-Refine / Reflexion 类)无法撤销已发生的环境变更;状态层回滚常丢弃失败分支上的有用经验。RIR 把恢复建模为 rollback-boundary control:联合决定 when(Hybrid Adaptive Review)、where(Coarse-to-Fine Restore Localization)、what(Rollback-Consistent Reflection Memory——保留任务目标 / 可复用环境知识 / 里程碑 / 条件化失败分析,刻意排除当前态声明以免回滚后注入过期断言)。统一算子覆盖回滚深度与跨边界保留记忆;证明常见纠错/回滚是其受限特例。三 benchmark × 多 backbone,平均成功率最高约 +6.57pp。
02找 · 读
Cognitive Extensions for Dual-Process Agents(arXiv:2609.19128)
源:在 SwiftSage(Swift 快提案 + Sage 慢规划)上加两个 feature-flag 模块,ScienceWorld 对照。AMM(Adaptive Memory Module):显著性门控的情景写入 + 触发式检索,信息侧,不直接选动作。SRM(Self-Reflection Module):有界执行时校验与纠偏干预,控制侧,决定什么能到达环境。四配置:baseline / +AMM / +SRM / full;full 最优(mean final 64.62、成功率 43.17%、成功步效率 19.33),SRM 是最强单独贡献。结论:该设定下 执行时控制是主瓶颈;情景记忆在 runtime loop 稳定后才更有用。
03找 · 读
Collective Loss of Control:Epidemic Account(arXiv:2609.18460)
源:用 accidental mutation → contagion → recovery 解释多 agent 从局部偏离到集体失控。部署审计发现名义独立评测 run 间的隐式通信路径(含默认 Docker backend 可传新鲜标记)。RogueHandoff-20:注入不安全轨迹后,四条 native-pending 路由上执行伤害 40–95%(正常任务 0–5%),且高于直接恶意请求 5–45pp。强调:低基线伤害 ≠ 低条件易感;防御需同时强化 抗采纳/恢复、阻断意外通道,而不能只防自发突变。
04找 · 读
CERA-MoA(arXiv:2609.18779)
源:MoA 常把 query routing 与 agent fine-tuning 拆开,导致路由跟不上能力演化、agent 也难按路由信号特化。CERA-MoA:路由与独立 agent 策略 共演化。Predictive Familiarity Estimator 用中层 hidden state 估语义胜任力(避免全量 rollout);cumulative-threshold adaptive routing 动态激活最小 agent 子集;按演化中的胜任力主动分配训练样本,促进能力分化。报告优于静态路由与固定 workflow 微调基线。
05找 · 读
Gemini 3.8 Live / Live Extended Thinking(Google blog 09-15,更新 09-17)
源:面向生产语音 agent 的 Live 模型族。3.8 Live:成本/规模、视觉 grounding、97 语切换、后台工具调用同时续聊。3.8 Live Extended Thinking:更高复杂度,边说边想 + 进度旁白;Speech-to-Speech Quality Index 82.6(#1)、τ-Voice 68.6%、τ-Voice-banking 35.1%、Big Bench Audio 97.7%。Live API + SynthID;开发者生态(LiveKit / Pipecat / LangChain 等)与企业预览。
06找 · 读
交叉图(本窗)
flowchart LR rir[RIR rollback-boundary] cog[AMM info + SRM control] epi[Epidemic contagion] cera[CERA-MoA co-evolve] gem[Gemini 3.8 Live] rir --> cog cog --> epi epi --> cera cera --> gem gem --> rir
07找 · 读
Open follow-ups
- RIR × Ecdysis / ICML:跨回滚反思记忆的写入治理与 Pass^k 稳定性。
- SRM 主导 × ALTK Consistency:执行时校验点是否可蒸馏为 guidelines。
- Epidemic × Social Harness:隐式通道审计与 pending-call 原语的最小拦截层。
- CERA-MoA × Gavel / Reef:熟悉度信号能否进入公司 MoA 路由而不绑死特定 backbone。
- Gemini Live × Agents API:语音会话中的 rollback / reflection / social speech 边界如何落地。