second brain
research
← 全部阅读
目录

← 2026-09-28 日阅读

2026-09-28 约 8 分钟

Harness 控制面:成本路由 × 行为指纹 × Skill ACL × 陈旧态守卫 × 推理遗忘 × 工程治理度量 × 声明复现 × 偏差引导技能自演化

agentic-engineeringharnesscostfingerprintingskillsaccess-controlstate-racescompression

昨日 dig 把「规格持笔、内核强制、审批绑闭包、保留先计量、写带幂等键、Jev 看边际、证据跨两层、记忆按族用」写成控制面口诀。今日窗口(~2026-09-26→28,Asia/Shanghai)周末无新 arXiv announce;主源仍来自周五批次中尚未入库、且与 agentic-engineering / models-and-infra / learning-and-craft 交叉的高信号项。焦点从「谁有权签字」转向 企业已买下的 harness 本身:它定费率与用量、掩盖模型身份、决定技能如何送达、在基础设施竞态下如何提交、何时可丢历史推理、用什么度量「工程治理变好了」、声明能否被复现、失败轨迹如何局部进化技能。

本仓 tip 已有 SpecHarness / AgentKernel / Approval Laundering / DoW / LIMBO / Decision Hijacking / ACE / Scope-Before-Persist(SB-20260927),以及 Trace Tamper / Hard Stop / HEXIS 等(SB-20260926)。tip 另含 X-bookmark Karpathy Agents→Loops→Harness 讲座摘要——作语境,不重入 dig。下文只展开今日 primary sources。

01找 · 读

一、控制 harness,才控制账单

Control the Harness, Control the Cost指出:企业席位从数百扩到上万时,多数并不自建 coding-agent harness,而是采购 Claude Code / Codex 等。Harness 决定哪个模型回答、读什么、prompt cache 怎么用、哪些 subagent 启动——从而同时选定价目表上的费率与按该费率购买的用量。默认未调优的专有 harness,等于把这些选择和账单一并继承。

作者用 Jev 做带校准概率的分类器,按自带 taxonomy 给每个 prompt 打标签;因一轮用户对话在同一模型的 prompt cache 上展开为多次请求,路由器只在「不必重建 cache」的边界移动工作:会话起点、side lane、subagent 启动。从价目表推导中途切换何时回本,并给出 crossover:在长、工具密集会话上,最高价模型可能比下一档更便宜(约 10,000 真实会话重定价确认)。在 10,000 席位仿真(行为取自公开数据集)上,按 Anthropic 2026-09-21 标价,路由器可回收模型支出的 14–21%(年约 $3.3M–$5.0M)。论文同时映射二十套 harness 风险、量化对单一厂商模型的依赖,并提出企业可从内部先跑起来的控制面与「是否自有 harness」的阶梯决策。

对实践

  1. 成本看板拆成 费率选择 × 用量驱动:只盯 token 单价会漏掉「harness 默认选了哪档、何时开 subagent、cache 是否被打断」。
  2. 路由尽量贴在 cache 边界(会话起点 / side lane / subagent),别在长会话中途硬切模型。
  3. 与昨日 Persistent Billable State 并列:一个管工具回传再入账,一个管 harness 路由与 cache——账单边界要覆盖整条控制面。

02找 · 读

二、换模型等于换安全策略:行为指纹

Who Is Behind the Harness?论证:coding-agent harness 下,替换背后的模型会改变安全相关决策(是否校验改动、失败后如何恢复)。既有指纹多依赖文本或 token 分布,但在 agent 里这些信号被系统指令、控制器、工具与执行反馈中介,迁移性差。

LIDAR(LLM Identification from Decisions and Actions at Runtime)是主动黑盒指纹:三组 coding probe 分别暴露 编辑后校验、瞬时失败恢复、规格–测试冲突解决。轨迹用实例级 + 分布级特征表示,与干净参考比较。无需权重 / logits / 厂商内部接口。在七族 36 模型、两套 harness 上 Top-1 / MRR 优于四类既有指纹与 API 审计基线;消融确认两级特征与全部 probe 对均有贡献。

对实践

  1. 采购与灰度:换模型 = 换行为分布;上线前用固定 probe 套件对照「是否验证、如何恢复、冲突时选谁」。
  2. 安全审计不要只比对最终 diff 文本;保留 工具轨迹级指纹,接昨日 ACE / Trace Tamper 的外置证据链。
  3. 多 harness 并存时,指纹应跨 harness 可复现,否则「同模型不同壳」会误判。

03找 · 读

三、技能送达即授权:Progressive Skill Discovery

Progressive Skill Discovery as Access Control把企业痛点说清楚:一次暴露全部内部工具 → 上下文膨胀、选型变差、策略只写在 prompt 里变成概率建议。多 agent 按域委派又分散审计、难跨会话保证合规。

skilder 把能力打成 role:技能 + 工具 + 指令 + 边界。Agent 从最小 role 目录起步,学会任务所需 role 后,经单一 MCP server 接收该 role 的技能、指令与工具;工具只在已学会的 skill 内送达,同一服务器确定性强制作用域。13 任务 × 六模型 × 10 run:一旦完成 discovery 并发出受治理调用,模拟授权层上 零未授权工具调用 / 零参数违规(如超支)。聚合通过率另计 discovery 协议与回复质量,不算授权失败。中途可跨 role 动态获取能力,保留解题灵活性。

对实践

  1. 工具面默认 最小 role 起步 + 按需发现,别一次 MCP 挂满内部 API。
  2. 「学会了某 skill」应成为 硬授权事件(日志可审计),不是 prompt 里多写一句 allowlist。
  3. 与昨日 Scope-Before-Persist / HEXIS 同构:记忆按族、技能按 role、工具按 skill——三层作用域对齐。

04找 · 读

四、陈旧 ≠ 不安全:提交守卫要语义契约

Stale Does Not Mean Unsafe针对工具 agent 变更调度器 / 流水线 / 对象存储 / ACL 时的 read–commit 竞态:外部状态变了,并不总让提交变不安全。论文区分 invalidating races(破坏已声明安全谓词)与 predicate-preserving / irrelevant races,问运行时守卫区分精度。

确定性仿真分离 visible vs authoritative state,在四域 16 任务注入五类非原子故障;冻结提案在无 LLM 裁判下反事实重放。三种提交粒度(全局 epoch、读集版本、语义 commit predicate)+ 多层校验 + 模型侧门控。结果:三守卫都能消灭不安全提交,但可用性差极大——基于 freshness 的守卫无谓挡住 92–95% 良性竞态,最多丢掉 43% 安全任务完成;完整谓词守卫挡住 0。精度依赖契约:删掉一条声明条款,对应故障族立刻变成不安全提交(最高 7.9%)。模型侧信号替不了:口头置信 ECE≈0.37,动作一致≈随机门,告诫 prompt 几乎不改直接不安全率;freshness 挡回后 agent 常从「刷新但仍不完整」的读再不安全提交。遥测降级时隐藏并发变更可观测干净,给选择性策略设上界。结论:精确强制需要语义契约,不是 freshness 启发式或模型自评。

对实践

  1. Commit guard 默认写 语义谓词(哪些不变式必须仍成立),别只比「版本号变没变」。
  2. Freshness 守卫适合粗熔断,不适合高吞吐基础设施变更;误杀会驱动「刷新后再盲提」。
  3. 与昨日 Approval Laundering / LIMBO 互补:一个管效应闭包,一个管竞态谓词,一个管幂等键——提交路径三条线都要。

05找 · 读

五、何时可忘推理:ICLR 交互感知压缩

When Can Agents Forget Their Reasoning?指出长地平线 agent 不断堆积推理史,即使早期决策已执行并被观察。静态 CoT 压缩不同:删历史推理会改未来动作与交互轨迹。ICLR(Interaction Aware Compression for Long Horizon Reasoning)免训练在线:用冻结 proxy entropy 给推理块排序,同时保留动作、工具调用与观察。

WorkBuddyBench 260 任务:平均奖励 0.699→0.718,输入 / 输出 / cache read token 分别降 25.5% / 14.4% / 33.3%。消融显示 trajectory amplification:局部删推理可非线性改变后续总算力。探测与轨迹分析提示:当任务相关派生状态已可靠外置到代码 / 文件 / 工具输出 / 环境反馈后,历史推理更可替换——推理是动态工作态,不是永久交互史。

对实践

  1. 压缩策略:外置状态优先,推理可丢;先确认文件 / 工具结果已承载结论,再砍 CoT。
  2. 评压缩别只看 token;看 后续轨迹是否漂移(奖励、工具步数、重试)。
  3. 与昨日 CliffCompaction / StateComp / DoW 账单边界联动:该留的是可计费且必要的状态,不是全部思维链。

06找 · 读

六、补丁通过 ≠ 治理变好:SWE-Prometheus

SWE-Prometheus把仓库级评测从「给定 issue → 功能补丁」扩到 改进工程治理:固定快照 + 开放目标,要求识别风险、排序干预、验证结果。六维治理经配对证据、干净环境探针、行为门与两位独立教师对同一证据打分。60 仓;十模型共享 22 仓公开子集上 Normalized Governance Improvement 均值 0.0568–0.5760,行为破坏率 0%–23%。仓库盲模板在冻结十仓上均值 NGI 0.272,但增益集中在 Tests & CI / Quality Gates / Documentation,对 Reproducible Environment 与 Dependency & Security 零仓改进——区分「加治理工件」与「可执行改进」。no-op 中位 NGI 0、σ=0.073;两教师对 no-op 同证据 60 维中 57 完全一致。结论:治理评测应同时报告 改进量、行为保持、证据质量、覆盖面。

对实践

  1. Agent 「加 CI / 写文档」不等于治理完成;要有 干净环境探针 证明环境可复现、依赖可审计。
  2. 看板四元组:NGI × breakage × evidence quality × coverage;只报一个会偏。
  3. 与 SpecHarness / Verified Commissioning 对齐:治理目标也要 admissible evidence,不能靠 agent 自报。

07找 · 读

七、声明能否被复现:RECLAIM

RECLAIM面向研究 agent:复现 ML 论文覆盖安装、调试、跑实验。基准含 100 篇 NeurIPS 2025,可按年重建。每篇预先固定:要复现的结果、成功定义、GPU-hour 预算。难度由作者发布物决定——Run(有代码/数据/权重)、Retrain(无权重)、Reimplement(无代码)。独立语言模型从日志与输出打分,不采信 agent 自报。四 agent 每篇各跑一次:各档最佳仅 41% / 27% / 15%;失败尝试平均只用预算 29%(多数提前停)。最常见错误:写了方法却从不对照论文数字核对(400 run 中 63 次)。

对实践

  1. 研究 agent 成功判据:外部 grader + 固定声明 + 预算,禁止「我认为复现了」。
  2. 发布物分级(Run/Retrain/Reimplement)应写进任务卡;无代码档默认更难,别混报。
  3. 失败常因早停与未核对数字——harness 应强制「对照论文表/图数值」门,再允许宣告成功。

08找 · 读

八、走错不等于整段作废:Deviation-Guided Skill 自演化

A Wrong Turn Does Not Ruin the Journey反对把失败轨迹整段对齐到某条固定成功轨迹:工具任务常有多条合法路径;失败轨迹前缀往往已收集有用证据,真正出错在后缀。SkillPivot 用执行有效性、目标进展、动作多样性定位 有用前缀 → 错误后缀 的偏差点;更强教师从同一前缀与同一交互史继续,产出成功替代后缀。对比学生失败后缀与教师成功后缀,生成 局部 skill 更新,保留已有效指引。ToolQA / LogicBench / WildClawBench 上持续优于竞品,改进多模型,产出紧凑可迁移更新。

对实践

  1. Skill 进化定位 偏差点,别对整段失败做粗反思或强制模仿单一金轨迹。
  2. 保留有用前缀作 teacher 续写条件;更新应可 diff、可回滚(接 Growing Harness / SpecHarness 义务账本)。
  3. 与 skilder role 边界配合:局部更新仍须落在已授权 skill/role 内,避免「进化」绕过 ACL。

09找 · 读

综合:企业 harness 控制面八条口诀

口诀 来源 一句话
路由贴 cache 边界 Cost / Harness 控 harness 才控费率×用量
行为即身份 LIDAR 换模型先跑 probe 指纹
学会才送达 skilder skill 发现 = 硬授权
陈旧看谓词 Stale≠Unsafe freshness 误杀;契约护提交
外置后可忘 ICLR 推理是工作态不是永久史
治理看探针 SWE-Prometheus 工件≠可执行改进
声明要复现 RECLAIM 外部 grader + 预算 + 对数
偏差点进化 SkillPivot 保前缀、改后缀、局部更新
flowchart TB
  subgraph control [Harness control plane]
    route[Cost router at cache boundaries]
    finger[LIDAR behavior fingerprint]
    acl[skilder role-scoped skills]
  end
  subgraph commit [Commit and memory]
    pred[Semantic commit predicate]
    iclr[ICLR forget reasoning]
  end
  subgraph prove [Prove improvement]
    prom[SWE-Prometheus NGI]
    reclaim[RECLAIM claim grader]
    pivot[SkillPivot deviation updates]
  end
  route --> acl
  finger --> route
  acl --> pred
  pred --> iclr
  iclr --> prom
  prom --> reclaim
  reclaim --> pivot
  pivot --> acl

Open follow-ups:Cost router × 昨日 DoW / Serving Stack;LIDAR × ACE / Trace Tamper;skilder × Scope-Before-Persist / HEXIS;Stale≠Unsafe × Approval Laundering / LIMBO;ICLR × CliffCompaction / StateComp;SWE-Prometheus × SpecHarness / Verified Commissioning;RECLAIM × Assurance Spine receipts;SkillPivot × Growing Harness / tip Karpathy loops。