second brain reading
← 全部阅读
2026-09-16

SkillLift / RESKILL / MTAC-IFBench / Router Within / AgentKV / Reef

与昨日 Skill Issue(换目标函数/任务硬度)互补——Skill Issue 问「优化什么任务」;SkillLift 问「如何在 oracle 预算下搜索」。skill 演化应 摊销 rollout 成本,用 dense rubric 作中间监督,而不是每步全量评测。

skillsskill-evolutionroutinginstruction-followingkv-cacheinference-infra

SkillLift(arXiv:2609.15396)

:09-14。论点:持久 skill(可复用 procedural prompt)的自演化,若每次候选都靠完整 agent rollout 当 oracle,监督瓶颈会把搜索锁死在「失败补丁」式局部改动。关键 insight:排序比绝对分数回归更平滑——判断「哪个 skill 更好」比预测精确分数需要更少的 oracle。SkillLift 用 bilevel:内环冻结 rubric 作廉价 surrogate 引导 skill 修订(零 oracle);外环少量 oracle rollout,用秩相关重新对齐 rubric。报告相对前沿 evolving 方法 少 40–70% token 成本 且更优。

RESKILL(arXiv:2609.15684)

:09-14(EMNLP 2026)。论点:失败后的 skill 修复常是不透明 one-shot reflection——模型生成补丁,却不显式维护「失败解释 ↔ 候选修复」关系,也不把失败 retest 带入后续编辑。RESKILL 维护跨轮 显式 repair state:失败假设 ↔ 候选 skill patch,按 coverage attribution 选局部修复,环境 retest,再把结果喂回下一轮。ALFWorld / TextCraft、三模型尺度、固定 repair 预算下,六组设置均最强:相对 direct repair +3.7pp,相对 hypothesis-conditioned +3.3pp。结论:仅做归因不够;归因必须与修复选择、持久 retest 条件更新耦合。

MTAC-IFBench(arXiv:2609.14992)

:09-14。缺口:现有 coding agent 评测重最终功能正确,或把 instruction-following 限在单轮 chat/简单生成;多轮 agentic coding 过程约束 欠评。MTAC-IFBench:多轮渐进式软件开发指令,约束覆盖 6 主类 / 18 次类;平均 7.04 轮、91.33 约束/实例;每约束与功能需求有 checklist,脚本 + judge agent 核验。发现现有 code agent 多轮指令遵循明显不足,随会话变长快速退化

The Router Within / Gavel(arXiv:2609.15982)

:09-14。论点:skill 收益取决于选对 skill;预载全部 metadata 分散注意力并限制库规模;外部检索又把选择移出 agent 能力。冻结 LLM 前向过程里已有路由信号,两张线性 map 即可读出,上下文无需 skill 正文。Gavel:Glance 用 mid-layer 状态对安装时构建的 per-skill bank 打分;Verdict 恢复 shortlist 的前向,读 likelihood + yes/no,与 Glance 做 product-of-experts。一次训练可零样本迁移;Qwen3-32B 上相对 progressive disclosure / retrieve-and-rerank(外加 1.2B–16B 参数)最高 +13.4(书面)/ +21.9(中途需要 skill)。bash-agent 上同 32B 触发正确 skill 的频率可超过 Codex 中更大 frontier 模型。

AgentKV(arXiv:2609.14872)

:09-14。设定:agentic serving 的 token 量远超 chatbot,KV 容量与 decode 带宽双压。多数 eviction 用「最近 token」代表未来 query,假设注意力局部平稳;agent 生成违反该假设——未来 query 是 think / act / tool / others 的混合,主角度分析显示相位占据不同 query 子空间,recency 代表系统性低估后续相位需要的 key。AGENTKV 每相位维护小 query buffer,对并集打分;并在持久多轮 serving 路径携带压缩 KV、在线 compact。两模型 × 六域 × 三预算:平均任务分相对 R-KV +5.5、相对 Tri-attention +5.3;相对 full-KV SGLang 输出吞吐最高约 1.80×。

Reef(HF blog 2026-09-15)

:开源 https://github.com/Human-Agent-Society/reef。主张:在 RSI 闭环完全落地前,先把 continual self-improvement 做成系统问题。两条破假设:(1) inference 不再是管线终点——轨迹/反馈是学习原料;(2) 演化对象不只有权重——prompt / memory / skills / tools / orchestration 同属 harness。Reef 要端到端拥有 experience / agent / updates:stateful inference(OpenAI 兼容 + receipt + feedback)、Cordis 做 harness 演化、异步训练(Slime 改编)+ NCCL 热更新权重、Git LFS 工件 + CAS 发布链与评测门控。用 modular learning recipes 表达在线 RL / TTT / skill·harness evolution 等。

交叉图(本窗)

flowchart LR
  skillLift[SkillLift<br/>rubric bilevel]
  reskill[RESKILL<br/>attribution+retest]
  mtac[MTAC-IFBench<br/>multi-turn IF]
  gavel[Gavel<br/>native skill routing]
  agentkv[AgentKV<br/>phase-aware KV]
  reef[Reef<br/>stateful inference+evolve]
  skillLift --> reskill
  gavel --> skillLift
  mtac --> gavel
  agentkv --> reef
  reskill --> reef

Open follow-ups

  • SkillLift rubric 外环 × Skill Issue PR-task 目标函数:换硬度后 bilevel 是否仍省 oracle。
  • RESKILL repair state × VRL-Bench / AIR:失败反思入库 schema。
  • MTAC-IFBench 轮次衰减 × Turn Release / Harness or Model:过程 IF 是否应进 harness 对照指标。
  • Gavel native routing × progressive disclosure / Astra instruction tax:大库路由基准。
  • AgentKV phase buffer × Tiered KV / AgentZip:统一 agent serving KV 剖面。
  • Reef recipes × Continual Harness / Ecdysis / last-AI-RSI:组织可落地的 experience→eval→release 最小切片。
当日 dig 工作日志(去重 / ingest / ops)

2026-09-16: dig — SkillLift / RESKILL / MTAC-IFBench / Router Within / AgentKV / Reef

  • 窗口:~2026-09-14 → 2026-09-16(Asia/Shanghai)。去重 SB-20260915 tip 677ac6b8a60986a77686b149c5340e1fef1f0697(Skill Issue / Harness or Model / LifeFuse-Mem / AIM / VRL-Bench / When AI Augments Work)与 nightly tip 3881866ee54c330a3cba2d9d84ad5975f479660b(X-bookmark / autosave:a-harness-for-every-task、rethink-ai-agent-fundamentals、posthog engineers、MIT-6.042、start-ugly-write-evals、pstack、graph-engineering-for-normal-people、astra games 等);不重挖 ORCH / When Agents Disagree / Mr.LHDR / T1 / RSI / Context-in-Harness / Artificial Id / AgentZip / Env-Probing / Turn Release / AIR / Tiered KV / TIMEWELL / Ecdysis / COBRA / Agents API / Astra / Coordination Backbone。跳过 HarnessVLN(embodied)与窗外 LIMBO(09-12)。
  • Ingest(原文,未翻译)
  • Research consolidate(中文)
  • Articles:大文件就地折入延后(agent-skills / harness-engineering / eval / models-infra);本 dig 以 research + digest 为权威。
  • Open follow-ups: SkillLift × Skill Issue 目标函数;RESKILL × VRL/AIR;MTAC-IF × Turn Release;Gavel × progressive disclosure;AgentKV × Tiered KV;Reef × Continual Harness/Ecdysis。
  • brain/log.md 未改(digest 为当日权威)。