second brain
research
← 全部阅读
目录

← 2026-09-14 日阅读

2026-09-14 约 4 分钟

ORCH / When Agents Disagree / Mr.LHDR / T1 / RSI / Context-in-Harness

multi-agentorganizationcollective-decisionlong-horizonterminal-agentrsicontext-engineeringharness

窗口 ~2026-09-12→09-14(Asia/Shanghai)。去重 SB-20260913 tip f38c8efc…(Artificial Id / AgentZip / Env-Probing / Turn Release / AIR / Tiered KV / TIMEWELL)与 nightly 同 tip;不重挖 Ecdysis / COBRA / Agents API / Astra / Coordination Backbone。本窗主源:Fri 09-11 announce 未收的多 agent 组织/决策/长程评测/终端 RL/RSI,以及 09-13 harness 内 context 工程综述。跳过窗外 betterclaw AGENTS.md(09-08)与 OR 向 MAPLE。

01找 · 读

ORCH(arXiv:2609.11737)

:09-10。论点:集体智能不只取决于个体能力,还取决于如何组织;现有 embodied multi-agent 常用固定组织,与任务所需协调类型错配。ORCH 把组织理论操作化:对可并发工作用 pooled interdependence,对有前置依赖的工作用 sequential interdependence,构造任务特定层级。25 个野火响应任务(侦察/救援/运输/资源/围控/灭火),最多 50 异构 agent、8 个 LLM。相对四个代表性 embodied 基线:人工 ORCH 平均最终分 +63.97%、执行效率 +74.29%;LLM 自动生成组织分别为 +43.63% / +52.53%。优势跨任务与模型保持;集体表现不随模型规模单调。长程任务上,层级组织让专用小组内并发与阶段间有序切换并存。对照昨日 Coordination Backbone 的 propose≠commit:这里把「组织图」本身当作可设计/可生成的一等对象。

02找 · 读

When Agents Disagree(arXiv:2609.11709)

:09-10。多智能体冲突时,聚合机制决定多样性是互补还是共错放大。投票/选举规则/LLM judge 都在 forward reasoning(证据→标签)路径上,错误高度共线。提出用 Bayes 反向构造共享 reverse posterior 作 label-free anchor;以 Jensen–Shannon 衡量 cross-path consistency,驱动 MinJS(硬选)、FwdJS(软重加权)、LogLin(log-linear 融合)。DDXPlus × 五 backbone:MinJS 全面优于随机选;FwdJS 通常优于最强选举基线;LogLin 总体最强,增益在「agent 不同意」子集最大。关键洞见:standalone 准确率弱的 reverse posterior,往往是更好的 anchor——预测力 ≠ 锚定效用。有标签时可做轻量两阶段校准。对照 Coordination / AIR:这里补的是「冲突后如何选/融」的机制词汇。

03找 · 读

Mr.LHDR(arXiv:2609.11318)

:09-10。现有 deep research 评测偏中程探索,难测依赖链长、多模态证据的持续研究。Mr.LHDR:102 题、1231 checklist 步;Linear 71.6% / Multi-branch 28.4%;几乎每题带上传图像资产。强调 OA(结局对)≠ 过程完整:正确终答常掩盖缺失必要结论;DACS 低于 CS 暴露「结论缺前置」。同模型消融:给图像把 DACS 从 21.6%→34.2%(+12.6pp)。对照 AgentAudit / CapScope / Scanning:把「过程 checklist + 依赖图」推进到开放网页多模态长程研究。

04找 · 读

T1(arXiv:2609.11042)

:09-10。122B MoE 终端 agent,真实 shell + 云 sandbox,单任务可达 300+ tool-call turn;奖励来自任务自带 verifier。配方:(1) 激进 warm-start + dense process reward(按通过 assertion 数);(2) TITO(精确 sampled token id + turn 边界 drift repair)与 R3 rollout routing replay(记录并回放每层 MoE expert 选择);(3) 与 Terminal-Bench 2.1 隔离的 OOD 训练语料。TITO+R3 把 train–infer logprob 差从 0.021→0.013,loss 区零 token drift。Terminal-Bench 2.1:基座 43.8%→T1 64.0%(同 harness 下超 GPT-5.4 54.8%、DeepSeek-V4-Flash 56.9%,近 Opus 4.7 66.1%);Long-Horizon Terminal Bench 27.9%,超 GPT-5.4 / GLM-5.1。对照 AgentZip sandbox 内存与 Turn Release:这里是「终端长程 RL 配方」轴。

05找 · 读

The Last AI Built by Humans / RSI(arXiv:2609.11873)

:09-10。用 Headroom-Closed Index (HCI) 诊断现有 LLM「还能不能靠当前改进回路拉开差距」;给出 RSI 路线图:从改进答案 → 改进改进过程本身。梳理 A-Evolve、AFlow、AgentSquare、技能蒸馏、失败/成功分析与 admission/rollback 等机制,强调真正 RSI 要把经验变成对未来改进程序的持久变更,而非单次任务补丁。对照 awesome-rsi / Continual Harness / Ecdysis:提供「何为 genuine RSI」的判别框架,而非又一个单点算法。

06找 · 读

Context Engineering Inside the Harness(Techora,2026-09-13)

:09-13。浅层 agent 在长任务上败于 context overflow 与 goal loss;修复层是 harness。四机制与落地阈值:(1) Budgeting/offloading——Deep Agents:工具结果 >20k token 落盘;窗口 85% 时截断旧 write/edit;(2) Compaction——Claude Code 压缩后重读最多 5 个最近修改文件、重注 skill≤5k/合计≤25k;Deep Agents 结构化 summary(intent/artifacts/next steps);OpenAI Responses / Claude Platform 已有服务端 compact API;(3) Todo-state——Manus 式 recitation;Deep Agents v0.7 起 Todo 改为 opt-in(评测显示非免费增益);(4) Cross-session memory——ETH Zurich:LLM 生成的 AGENTS.md 类文件可抬高推理成本 20–23% 而不稳提成功率 → 与 TIMEWELL「≤200 行 + Skills 按需」同向。对照 Progressive Disclosure / AgentZip / Env-Probing:把生产阈值钉到同一四件套。

07找 · 读

交叉与开放问题

  • ORCH 组织图 × Coordination propose/commit:组织是静态先验还是运行时可改拓扑?
  • Reverse-anchor 聚合 × AIR / AgentAudit:事故复盘能否用 cross-path consistency 做机制覆盖?
  • Mr.LHDR 过程分 × CapScope/Scanning:checklist 依赖图能否进入 harness-level eval gate?
  • T1 TITO/R3 × Turn Release / AgentX:训练时 token/expert 对齐与 serving 时 turn 放行是两条稳定性轴。
  • RSI HCI × Ecdysis / Continual Harness:何时该进化 harness 而非继续 RL 模型?
  • Context-in-Harness 阈值 × TIMEWELL / Astra instruction tax:预算与压缩后重注入的「指令税」上限。

Articles 大文件就地折入延后(harness-engineering / graph-engineering / eval / self-improvement / personal-development);本 dig 以 research + digest 为权威。