second brain
research
← 全部阅读
目录

← 2026-09-20 日阅读

2026-09-20 约 5 分钟

When More Is Less / DeltaSelect / Missing Complement / Bad Genius·CHASE / RAFT / DeepSeek-V4.1-Flash / Deskilling

multi-agentsaigedeltaselectcoding-agentsevalretrievalserbenchchase

窗口 ~2026-09-18→09-20(Asia/Shanghai)。去重 tip 04b7d055ae97028ecea1fb30bee9ad71eff1effb(SB-20260919:Levels/Ticks Cascaded / SkillAA / How Harnesses Create Value / Empirical Harness Design / Overclaiming Propensity / SoL-Pi)与 SB-20260918(RIR / Cognitive Extensions AMM+SRM / Collective Loss-of-Control Epidemic / CERA-MoA / Gemini 3.8 Live)、SB-20260917(Social Harness / Memory-Skill Isomorphism / Interactive Memory Learning / ALTK Consistency Pass^k)、SB-20260916(SkillLift / RESKILL / MTAC-IFBench / Gavel / AgentKV / Reef);不重挖 Skill Issue / Harness or Model / LifeFuse-Mem / AIM / VRL-Bench / When AI Augments Work / ORCH / When Agents Disagree / Mr.LHDR / T1 / RSI / Context-in-Harness / Artificial Id / AgentZip / Env-Probing / Turn Release / AIR / Tiered KV / TIMEWELL / Ecdysis / COBRA / Agents API / Astra / Coordination Backbone。本窗 tip 未前移(无新 X-bookmark / autosave)。周末无新 arXiv 公告日;主源取 Fri 18 Sep 公告批次中 SB-19 未收的高信号项。跳过 Contagion(交易域)、Obstacle-Aware / 机器人操控、以及偏视频/临床等域外稿。

01找 · 读

When More Is Less:多 agent 何时真有用(arXiv:2609.19759)

:单 agent harness(Claude Code / Codex / DeepSeek Harness)已能端到端长程执行,通用 multi-agent 框架常停在玩具基准与边际增益。作者用依赖 DAG 形式化轨迹:子任务由 bridge edges 切开;理想条件下沿 bridge 分区可降 context 成本。结论:多 agent 的系统性收益集中在稀疏依赖的长程任务;紧耦合顺序工作流上,单 agent harness 仍更优。提出 SAIGE(Semantic-Aware Incremental Graph Evolution):按需生成节点、用内容检索立边,增量长出子任务树,而非事先静态拓扑。实验与消融:扩大 agent 池或加深递归并不稳定提分——「更多 agent ≠ 更智能」。

对实践

对齐昨日 Levels/Ticks、Empirical Harness、When Agents Disagree:先画任务的依赖密度。稀疏可并行段才派生子 agent;主路径保持单 harness 顺序执行。编排预算应花在 bridge 预测质量,而不是角色数量。

02找 · 读

DeltaSelect:编码 agent 的便宜 A/B(arXiv:2609.19607)

:全量基准贵、单次噪声大,且 benchmark harness ≠ 生产 harness。DeepSWE 重采样:仅 19.5% 任务(22/113)在一跑下与全基准的第五百分位 Pearson ≥0.50。DeltaSelect:按第五百分位相关排序 → 用线性回归把 F2P 校准到全分量纲 → 在美元预算内选固定任务集并冻结。用途是 同一系统的 baseline vs candidate 开发迭代,不是排行榜。案例:13 次评估总花费 $27.86;采纳版比初版便宜 58.1%($1.75 vs $4.18,p=0.008),校准分更高。Terminal-Bench 上同模型换 harness 可动 5.1pp / 2.8pp——选定任务必须在目标 harness 上建 baseline。

对实践

对齐 Empirical Harness / Harness Value / OverclaimBench:日常改 skill / 指令 / 推理档位,用 冻结小集 + 目标 harness baseline,别每次跑满 SWE。发布前再回全量;开发中的分数不要外推成「模型排序」。

03找 · 读

Missing Complement:状态条件的最小充分证据(arXiv:2609.20050)

:编码 agent 中途已读过排序器最爱的片段;相关是单条,充分是集合——预算可被同一事实的变体填满,决策仍缺关键。提出 state-conditioned minimal sufficient evidence recovery:给定已捕获状态,找回下一决策仍缺的紧凑证据组合。SERBench:45 仓、500 held-out 状态。MSS-Complement 三阶段语义调用:提议充分集 → 搜缺口 → 在 6,144 token 内返回 4–8 个完整源单元。五条目完整率 73.0%(八条 80.6%)对 Qwen3 embedding+rerank 的 61.4%/72.4%;仅相似度对照 66.6%——增益在集合策略。去掉一个必需证据组,修复定位精度掉 12.3 / 11.1 点。

对实践

对齐 AgentZip / Empirical T4 / SoL-Pi Compact:检索目标从「像 issue」改为「补当前决策缺口」。上下文装配 checklist:已观察集合、必需证据组覆盖、禁止同组重复占预算。

04找 · 读

Bad Genius / CHASE:对抗协议级捷径的 harness 进化(arXiv:2609.18366)

:自动 harness 优化反复用发布基准 (B_{rel}) 反馈;任务 holdout 只换语义题,协议不变,「坏天才」Proposer 可把 benchmark-wide shortcut 写进 harness(如总是先搜某通道)。CHASE:每轮 Proposer 更新后,Challenger 搜索可执行、语义保持的协议变换以最大化 gain destruction;有效防火墙 + 确认集写入有限反事实档案。形式化捷径中性基准 (B_0) 并给有限档案统计保证。Syn-Ledger / OfficeQA:保留发布基准增益的同时,显著降低有效协议变更下的增益崩塌。

对实践

对齐 SoL-Pi / Meta-Harness / Overclaim:自动改 harness 不能只看 held-out 任务分。加 协议变异门(重排证据通道、改工具别名/目录布局)测增益是否还在;确认的反事实进回归套件。

05找 · 读

RAFT:排障 agent 的有状态 RAG(arXiv:2609.20754)

:企业排障依赖历史相似工单,但既有 RAG 把案例当静态文档,忽略多阶段状态。RAFT 把已结案抽象为时间线条目的有向链,按 当前活动案例状态 在条目级检索,同时服务「下一步」与「整段解决轨迹」。指出四类失败:噪声非结构化、碎片无法拼成连贯案例、无状态意识、缺轨迹级指引。

对实践

对齐 AIM / LifeFuse-Mem / Cognitive Extensions:工单记忆按 阶段时间线 索引,查询绑定当前调查状态,而不是整单 embedding 一次召回。Agent 侧保留关系推理,索引侧只保证「相似阶段 + 可执行指引」。

06找 · 读

DeepSeek-V4.1-Flash:把 KV 压到极限(arXiv:2609.19969)

:长程 agent 使负载更偏 input-heavy;prefill 与 KV 的 HBM/SSD/带宽成部署瓶颈。552B MoE,上下文至 1MCED 使 decode 激活 16B、prefill 仅 8B。CSA2 跨层 KV 复用 + FP4 KV:全局 KV 890 bytes/token,约 V4-Flash 的 1/4SWA Bounded Replay 使持久 KV 约 1/8。45T 多模态预训练 + 大规模 agent 任务合成的 SFT/RL/OPD;权重在 Hugging Face。

对实践

对齐 Tiered KV / AgentKV / Empirical context 预算:选服务端时同时看 全局 KV/token持久 KV 两档;agent 场景优先 prefill 便宜的 CED 类设计。本地 harness 的压缩策略(T4 elision)与模型侧 CSA2 是互补层,不要互相替代。

07找 · 读

Designing Against Deskilling:元认知反馈减卸载(arXiv:2609.20143)

:认知卸载到 LLM 会挤掉练习机会。预注册 N=704、2×2 + 无 AI 对照;分数运算练习后无辅助测验。干预:(1)元认知反馈明示卸载对技能的含义;(2)努力型奖励激励少用完整答案。结果:元认知反馈降低答案卸载(OR=0.47)并提升测验表现(OR=1.51);奖励无显著效应。主张:不限制 AI 可用性,改改用户如何决定卸载多少。

对实践

对齐 When AI Augments Work / 个人 agent OS:学习/教练型 skill 默认「先给思路,完整答案需显式请求」+ 回合间元认知提示;别只靠拒答 guardrail。积分激励可作次要实验,不要当主杠杆。

08找 · 读

交叉图(本窗)

flowchart LR
  more[When More Is Less / SAIGE]
  delta[DeltaSelect A/B]
  miss[Missing Complement]
  chase[CHASE / Bad Genius]
  raft[RAFT stateful RAG]
  ds[DeepSeek V4.1 KV]
  desk[Deskilling feedback]
  more --> delta
  delta --> chase
  miss --> raft
  ds --> more
  desk --> delta
  chase --> miss

任务结构决定是否 multi-agent → 便宜 A/B 在目标 harness 上迭代 → CHASE 防协议捷径 → 检索按决策缺口补证据 / 排障按状态时间线 → 模型侧 KV 压缩托住长程 → 人机学习面用元认知减 deskilling。

09找 · 读

Open follow-ups

  • SAIGE bridge 预测 × Levels/Ticks:稀疏子图是否对应可升级的 tick 边界。
  • DeltaSelect × Empirical Harness 176 设定:小集任务是否要按 context-mgmt tier 分层抽样。
  • MSS-Complement × SoL-Pi ObservationPack / Evidence-Preserving Reducer。
  • CHASE × OverclaimBench:协议反事实能否暴露「终答诚实」类捷径。
  • RAFT 时间线 × AIM / Interactive Memory Learning。
  • V4.1-Flash CSA2 × Tiered KV / AgentKV 产品选型表。
  • Deskilling 元认知 × 组织内 coding agent 培训流。