SkillLift(arXiv:2609.15396)
源:09-14。论点:持久 skill(可复用 procedural prompt)的自演化,若每次候选都靠完整 agent rollout 当 oracle,监督瓶颈会把搜索锁死在「失败补丁」式局部改动。关键 insight:排序比绝对分数回归更平滑——判断「哪个 skill 更好」比预测精确分数需要更少的 oracle。SkillLift 用 bilevel:内环冻结 rubric 作廉价 surrogate 引导 skill 修订(零 oracle);外环少量 oracle rollout,用秩相关重新对齐 rubric。报告相对前沿 evolving 方法 少 40–70% token 成本 且更优。
RESKILL(arXiv:2609.15684)
源:09-14(EMNLP 2026)。论点:失败后的 skill 修复常是不透明 one-shot reflection——模型生成补丁,却不显式维护「失败解释 ↔ 候选修复」关系,也不把失败 retest 带入后续编辑。RESKILL 维护跨轮 显式 repair state:失败假设 ↔ 候选 skill patch,按 coverage attribution 选局部修复,环境 retest,再把结果喂回下一轮。ALFWorld / TextCraft、三模型尺度、固定 repair 预算下,六组设置均最强:相对 direct repair +3.7pp,相对 hypothesis-conditioned +3.3pp。结论:仅做归因不够;归因必须与修复选择、持久 retest 条件更新耦合。
MTAC-IFBench(arXiv:2609.14992)
源:09-14。缺口:现有 coding agent 评测重最终功能正确,或把 instruction-following 限在单轮 chat/简单生成;多轮 agentic coding 过程约束 欠评。MTAC-IFBench:多轮渐进式软件开发指令,约束覆盖 6 主类 / 18 次类;平均 7.04 轮、91.33 约束/实例;每约束与功能需求有 checklist,脚本 + judge agent 核验。发现现有 code agent 多轮指令遵循明显不足,随会话变长快速退化。
The Router Within / Gavel(arXiv:2609.15982)
源:09-14。论点:skill 收益取决于选对 skill;预载全部 metadata 分散注意力并限制库规模;外部检索又把选择移出 agent 能力。冻结 LLM 前向过程里已有路由信号,两张线性 map 即可读出,上下文无需 skill 正文。Gavel:Glance 用 mid-layer 状态对安装时构建的 per-skill bank 打分;Verdict 恢复 shortlist 的前向,读 likelihood + yes/no,与 Glance 做 product-of-experts。一次训练可零样本迁移;Qwen3-32B 上相对 progressive disclosure / retrieve-and-rerank(外加 1.2B–16B 参数)最高 +13.4(书面)/ +21.9(中途需要 skill)。bash-agent 上同 32B 触发正确 skill 的频率可超过 Codex 中更大 frontier 模型。
AgentKV(arXiv:2609.14872)
源:09-14。设定:agentic serving 的 token 量远超 chatbot,KV 容量与 decode 带宽双压。多数 eviction 用「最近 token」代表未来 query,假设注意力局部平稳;agent 生成违反该假设——未来 query 是 think / act / tool / others 的混合,主角度分析显示相位占据不同 query 子空间,recency 代表系统性低估后续相位需要的 key。AGENTKV 每相位维护小 query buffer,对并集打分;并在持久多轮 serving 路径携带压缩 KV、在线 compact。两模型 × 六域 × 三预算:平均任务分相对 R-KV +5.5、相对 Tri-attention +5.3;相对 full-KV SGLang 输出吞吐最高约 1.80×。
Reef(HF blog 2026-09-15)
源:开源 https://github.com/Human-Agent-Society/reef。主张:在 RSI 闭环完全落地前,先把 continual self-improvement 做成系统问题。两条破假设:(1) inference 不再是管线终点——轨迹/反馈是学习原料;(2) 演化对象不只有权重——prompt / memory / skills / tools / orchestration 同属 harness。Reef 要端到端拥有 experience / agent / updates:stateful inference(OpenAI 兼容 + receipt + feedback)、Cordis 做 harness 演化、异步训练(Slime 改编)+ NCCL 热更新权重、Git LFS 工件 + CAS 发布链与评测门控。用 modular learning recipes 表达在线 RL / TTT / skill·harness evolution 等。
交叉图(本窗)
flowchart LR skillLift[SkillLift<br/>rubric bilevel] reskill[RESKILL<br/>attribution+retest] mtac[MTAC-IFBench<br/>multi-turn IF] gavel[Gavel<br/>native skill routing] agentkv[AgentKV<br/>phase-aware KV] reef[Reef<br/>stateful inference+evolve] skillLift --> reskill gavel --> skillLift mtac --> gavel agentkv --> reef reskill --> reef
Open follow-ups
- SkillLift rubric 外环 × Skill Issue PR-task 目标函数:换硬度后 bilevel 是否仍省 oracle。
- RESKILL repair state × VRL-Bench / AIR:失败反思入库 schema。
- MTAC-IFBench 轮次衰减 × Turn Release / Harness or Model:过程 IF 是否应进 harness 对照指标。
- Gavel native routing × progressive disclosure / Astra instruction tax:大库路由基准。
- AgentKV phase buffer × Tiered KV / AgentZip:统一 agent serving KV 剖面。
- Reef recipes × Continual Harness / Ecdysis / last-AI-RSI:组织可落地的 experience→eval→release 最小切片。