Skill Issue(arXiv:2609.12742)
源:09-11。论点:coding agent 越来越多从仓库内 SKILL.md 读 procedural knowledge;已有工作用 benchmark 自动合成 skill 文档,但真实空仓没有 benchmark,且人造任务太弱——强 agent 无文档也能饱和。做法:从仓库 已合并 PR 挖更难任务(在冻结 base commit 上 revert),以「同 agent 有文档 vs 无文档」的提升作为文档分数。三仓 Kotlin:GEPA 文档平均 +4.9pp,SkillOpt 几乎不动(+0.1pp);单仓任务量不足以把 GEPA 增益与 agent 运行方差分开。维护者主观阅读认为文档含「只有做过项目才知道」的知识——分数与可读性脱钩。
对 second_brain / Grok Bot org:skill 优化目标函数要换——合成 toy task 会虚高;应优先用真实 PR/事故/回归任务做 with/without skill 对照,并显式报告方差与样本量。与 COBRA-Skills / SkillAlign / Astra instruction tax 同轴:可复用单元是 skill,但 评测任务硬度 决定优化是否有信息量。
Harness or Model?(arXiv:2609.11987)
源:09-08(Mon recent 可见;此前 dig 未收)。论点:agentic coding = model + harness;业界默认「厂商原生 harness 配对更好」。在私有、防污染的 256 任务套件上做 同模型配对对照:Opus 4.8 上 claude-agent-sdk vs deepagents;GPT-5.5 上 openai-codex SDK vs deepagents。平均上 两侧 harness 无显著优势(Opus −1.25pp / GPT +1.25pp,CI 跨零)。分层却相反:原生 harness 在 61 个仓库任务落后 9.0pp,在 19 个 contest 任务领先 23.7pp(事后划分,需设计性复现)。正确性与完成度分离:81 次触墙时钟取消中有 22 次其实已产出可过 patch。中性 harness 每解任务成本约 1.2–1.6×(用量语义修订后账单排序仍未定)。
LifeFuse-Mem(arXiv:2609.12436)
源:09-11。设定:写 episode 带 lifecycle 元数据,读时做 phase-aware readout——区分「应跨交互持续影响」与「仅当前上下文有效」的信息。临时信息覆盖持久知识会导致长期 agent 行为漂移。LifeFuse-Mem 用 lifecycle-aware 神经记忆与状态融合,对抗 temporary overwriting。
AIM(arXiv:2609.12320)
源:09-11。现有 agentic memory 多停在单用户;AIM(Agentic Interoperable Memory)面向 multi-agent × multi-user:动态把信息分为 private(单用户不可外泄)与 public(可跨用户共享),在索引层做访问控制,使私有记忆永不进入其他用户检索,同时共享公共知识提升下游回答。
对 Grok Bot / 公司脑:共享记忆 ≠ 无边界记忆。Coordination Backbone / company brain 的「权限问题」文已提示——AIM 给出可操作的 private/public 分类 + index ACL。与 Artificial Id(对齐边界)可对照:身份/租户边界应落在 memory 索引,而非仅 prompt 约定。
VRL-Bench(arXiv:2609.12404)
源:09-11。Reflexion 等 verbal RL 把失败试验写成文本指导后续尝试。VRL-Bench 在 有限 trial 预算 下公平评测 trial-and-error:MiniWoB / WebShop 上多种 verbal-memory 方法相对无记忆重试有时升有时降;replay 显示 reflection 可降低成功率——经验利用 vs 继续探索 的权衡。提出 VEX² 作为 verbal experience 更新变体。
When Does AI Augment Work?(arXiv:2609.12482)
源:09-11。批评仅用自动化能力/采用率衡量 AI 职场价值;主张把分析从原子任务扩到 未来 workflow 级人机协作。给出 AI augmentation 六条件:耐久净价值、有意义的人类控制、问责与恢复、以及通过学习/职业路径/工作意义实现的长期人类发展。
对 learning-and-craft / 个人 agentic OS:与 Agent Manager craft、TIMEWELL、When Agents Disagree 同读——增强 ≠ 替代任务列表;组织 dig 与 briefing 本身应满足「控制、问责、学习路径」条件,避免只堆自动化吞吐。
交叉图(本窗)
flowchart LR skillDoc[Skill Issue<br/>SKILL.md vs PR tasks] harnessEval[Harness or Model<br/>same-model contrasts] memLife[LifeFuse-Mem<br/>lifecycle fusion] memAIM[AIM<br/>private/public ACL] vrl[VRL-Bench<br/>finite-trial verbal RL] work[When AI Augments Work<br/>workflow 6 conditions] skillDoc --> harnessEval memLife --> memAIM vrl --> skillDoc work --> harnessEval
Open follow-ups
- Skill Issue 的 PR-revert 任务矿 × COBRA / SkillAlign 优化器:换目标函数后 bandit/进化是否仍稳。
- Harness or Model 的 repo vs contest 分层 × Turn Release / AgentX:分层是否来自工具面与超时策略。
- LifeFuse lifecycle 标签 × Governing Evolving Memory / Env-Probing:统一 schema。
- AIM index ACL × Coordination propose/commit / company-brain permissions。
- VRL-Bench 预算协议 × AIR 事故登记:失败反思入库门槛。
- Augmentation 六条件 × 个人/组织 agent OS 检查清单(控制、恢复、学习路径)。