second brain reading
← 全部阅读
2026-09-15

Skill Issue / Harness or Model / LifeFuse-Mem / AIM / VRL-Bench / When AI Augments Work

不要把「原生 harness」当默认增益;评测必须同模型、同任务、报分层与完成/正确分离。与 HarnessDev / Beyond Prompts / Google behavioral evals 同轴——harness 效果是 条件化的,不是普适乘数。

skillsharnessevalmemorymulti-userverbal-rl

Skill Issue(arXiv:2609.12742)

:09-11。论点:coding agent 越来越多从仓库内 SKILL.md 读 procedural knowledge;已有工作用 benchmark 自动合成 skill 文档,但真实空仓没有 benchmark,且人造任务太弱——强 agent 无文档也能饱和。做法:从仓库 已合并 PR 挖更难任务(在冻结 base commit 上 revert),以「同 agent 有文档 vs 无文档」的提升作为文档分数。三仓 Kotlin:GEPA 文档平均 +4.9pp,SkillOpt 几乎不动(+0.1pp);单仓任务量不足以把 GEPA 增益与 agent 运行方差分开。维护者主观阅读认为文档含「只有做过项目才知道」的知识——分数与可读性脱钩

对 second_brain / Grok Bot org:skill 优化目标函数要换——合成 toy task 会虚高;应优先用真实 PR/事故/回归任务做 with/without skill 对照,并显式报告方差与样本量。与 COBRA-Skills / SkillAlign / Astra instruction tax 同轴:可复用单元是 skill,但 评测任务硬度 决定优化是否有信息量。

Harness or Model?(arXiv:2609.11987)

:09-08(Mon recent 可见;此前 dig 未收)。论点:agentic coding = model + harness;业界默认「厂商原生 harness 配对更好」。在私有、防污染的 256 任务套件上做 同模型配对对照:Opus 4.8 上 claude-agent-sdk vs deepagents;GPT-5.5 上 openai-codex SDK vs deepagents。平均上 两侧 harness 无显著优势(Opus −1.25pp / GPT +1.25pp,CI 跨零)。分层却相反:原生 harness 在 61 个仓库任务落后 9.0pp,在 19 个 contest 任务领先 23.7pp(事后划分,需设计性复现)。正确性与完成度分离:81 次触墙时钟取消中有 22 次其实已产出可过 patch。中性 harness 每解任务成本约 1.2–1.6×(用量语义修订后账单排序仍未定)。

LifeFuse-Mem(arXiv:2609.12436)

:09-11。设定:写 episode 带 lifecycle 元数据,读时做 phase-aware readout——区分「应跨交互持续影响」与「仅当前上下文有效」的信息。临时信息覆盖持久知识会导致长期 agent 行为漂移。LifeFuse-Mem 用 lifecycle-aware 神经记忆与状态融合,对抗 temporary overwriting。

AIM(arXiv:2609.12320)

:09-11。现有 agentic memory 多停在单用户;AIM(Agentic Interoperable Memory)面向 multi-agent × multi-user:动态把信息分为 private(单用户不可外泄)与 public(可跨用户共享),在索引层做访问控制,使私有记忆永不进入其他用户检索,同时共享公共知识提升下游回答。

对 Grok Bot / 公司脑:共享记忆 ≠ 无边界记忆。Coordination Backbone / company brain 的「权限问题」文已提示——AIM 给出可操作的 private/public 分类 + index ACL。与 Artificial Id(对齐边界)可对照:身份/租户边界应落在 memory 索引,而非仅 prompt 约定。

VRL-Bench(arXiv:2609.12404)

:09-11。Reflexion 等 verbal RL 把失败试验写成文本指导后续尝试。VRL-Bench 在 有限 trial 预算 下公平评测 trial-and-error:MiniWoB / WebShop 上多种 verbal-memory 方法相对无记忆重试有时升有时降;replay 显示 reflection 可降低成功率——经验利用 vs 继续探索 的权衡。提出 VEX² 作为 verbal experience 更新变体。

When Does AI Augment Work?(arXiv:2609.12482)

:09-11。批评仅用自动化能力/采用率衡量 AI 职场价值;主张把分析从原子任务扩到 未来 workflow 级人机协作。给出 AI augmentation 六条件:耐久净价值、有意义的人类控制、问责与恢复、以及通过学习/职业路径/工作意义实现的长期人类发展。

对 learning-and-craft / 个人 agentic OS:与 Agent Manager craft、TIMEWELL、When Agents Disagree 同读——增强 ≠ 替代任务列表;组织 dig 与 briefing 本身应满足「控制、问责、学习路径」条件,避免只堆自动化吞吐。

交叉图(本窗)

flowchart LR
  skillDoc[Skill Issue<br/>SKILL.md vs PR tasks]
  harnessEval[Harness or Model<br/>same-model contrasts]
  memLife[LifeFuse-Mem<br/>lifecycle fusion]
  memAIM[AIM<br/>private/public ACL]
  vrl[VRL-Bench<br/>finite-trial verbal RL]
  work[When AI Augments Work<br/>workflow 6 conditions]
  skillDoc --> harnessEval
  memLife --> memAIM
  vrl --> skillDoc
  work --> harnessEval

Open follow-ups

  • Skill Issue 的 PR-revert 任务矿 × COBRA / SkillAlign 优化器:换目标函数后 bandit/进化是否仍稳。
  • Harness or Model 的 repo vs contest 分层 × Turn Release / AgentX:分层是否来自工具面与超时策略。
  • LifeFuse lifecycle 标签 × Governing Evolving Memory / Env-Probing:统一 schema。
  • AIM index ACL × Coordination propose/commit / company-brain permissions。
  • VRL-Bench 预算协议 × AIR 事故登记:失败反思入库门槛。
  • Augmentation 六条件 × 个人/组织 agent OS 检查清单(控制、恢复、学习路径)。
当日 dig 工作日志(去重 / ingest / ops)

2026-09-15: dig — Skill Issue / Harness or Model / LifeFuse-Mem / AIM / VRL-Bench / When AI Augments Work

  • 窗口:~2026-09-13 → 2026-09-15(Asia/Shanghai)。去重 SB-20260914 tip bd161b276d4419fd95a0e53ff9038bd266f3effc(ORCH / When Agents Disagree / Mr.LHDR / T1 / RSI / Context-in-Harness)与 nightly tip 476390c8ea90776bb954826aa8151a516428c5c1(X-bookmark / LeanDB 等 autosave);不重挖 Artificial Id / AgentZip / Env-Probing / Turn Release / AIR / Tiered KV / TIMEWELL / Ecdysis / COBRA / Agents API / Astra / Coordination Backbone。本窗无独立 models-and-infra 新主源(DeepSeek-V4.1-Flash 二次文已有 bookmark ingest)。
  • Ingest(原文,未翻译)
  • Research consolidate(中文)
  • Articles:大文件就地折入延后(agent-skills / harness-engineering / eval / memory / personal-development);本 dig 以 research + digest 为权威。
  • Open follow-ups: Skill Issue PR-task 目标函数 × COBRA/SkillAlign;Harness or Model 分层 × Turn Release/AgentX;LifeFuse lifecycle × Governing Evolving Memory;AIM ACL × Coordination/company-brain permissions;VRL-Bench 预算 × AIR 入库门槛;Augmentation 六条件 × agent OS 检查清单。
  • brain/log.md 未改(digest 为当日权威)。