昨日 dig 把「轨迹外置、监控抗重试、内核熔断、Jev 不直连副作用、skills 可编译、环境当一等公民、放行权不交给生成器」写成控制面口诀。今日窗口(~2026-09-25→27,周五 arXiv announce)把同一问题再拆一层:谁持有规格签字权;治理是否必须落到 OS 级强制面;人审批的那条命令是否覆盖传递闭包;保留下来的工具回传是否变成持续账单武器;恰好一次该落在模型/harness/工具契约的哪一层;schema 决策头仍会被注入拉偏;应用层遥测看不见的攻击需要内核证据;持久记忆写入时作用域必须匹配认证作用域。
本仓 tip 已有 Trace Tamper / EvasionBench / Hard Stop / JevOut / Jev-Mobile / HEXIS / Env-Rethink / Verified Commissioning(SB-20260926),以及 JAZ / Assurance Spine / PASTABench 等(SB-20260925)。tip 另含 X-bookmark Just Ask Jev(2609.29429)——作语境,不重入 dig。下文只展开今日 primary sources。
01找 · 读
一、规格持笔:提案与验收必须拆开
Who Holds the Pen? Let Specifications, Not Agents, Sign Off指出:任务说明、指南、输出 schema、可复用 skills 名义上是外部规格,运行时却常沦为同一模型的上下文——它既行动又自评又宣布完成,提案与验收折叠在一个环里。论文定义两个结构缺口:
- understanding–execution gap:理解要求 ≠ 执行满足(SkillsBench 上七模型仅满足 79.6%–86.4% 源锚定方向)。
- state–authority gap:agent 的完成声明 ≠ 所需状态已达成(完成声称率高于官方评测通过率 28.7–37.9pp)。
SpecHarness 把可见规格编译为源链接 obligations,用版本化义务账本治理执行与终态;可验证要求在运行时中介/校验,含糊要求降为 advisory。原则:agent 可提议,只有合格提供者的 admissible evidence 才能确立规格管辖状态。
对实践
- 与昨日 Verified Commissioning / Assurance Spine 同构:规格与证据持有签字权,模型只产候选。
- skill / guideline 不要只当 prompt 片段;能硬验证的条款进 obligation ledger,并带 freshness(依赖变更即 stale)。
- 验收报表拆开:
direction_satisfaction/completion_claim_gap/false_finalize,别只看「任务说自己做完了」。
02找 · 读
二、缺的不是插件,是 Agent OS 内核
AgentKernel: The Trust-Native Agentic Operating System论证:现有 orchestration / runtime / governance / sandbox 多为应用层中间件,与 agent 共享进程信任边界。缺的是强制、不可绕过的 OS 基底,覆盖四个支柱:
| Pillar | 语义层失败 | 内核服务 |
|---|---|---|
| Identity | 冒充、未绑定委托 | 密码学 AIC、能力链、相互认证 |
| Perception | 提示注入、未标注输入 | 分级过滤与 provenance 打标 |
| Cognition | 记忆投毒、跨会话污染 | 格点 taint / IFC 记忆网关 |
| Execution | 工具越权、plan–trace 漂移 | 语义策略 → eBPF/进程树回停 |
主张:结构安全是能力倍增器——身份可信才能跨组织协作;感知分级才能吃更脏输入;污点记忆才能安全检索;语义到 syscall 的桥才能敢开更大工具面。
对实践
- 分类现有栈:编排框架 ≠ 治理平台 ≠ sandbox ≠ 强制内核;缺第四层时,默认假设「护栏可被同进程代码绕过」。
- 集成面尽量收窄到 LLM / tool / storage 三个 adapter;ambient 凭证与直连文件系统视为 mediation 失败。
- 与 Hard Stop / ACE(下文)对齐:用户态 policy 不够时,落到 eBPF / 进程树;审计要能对照 plan 与 syscall 轨迹。
03找 · 读
三、审批漂移:条目调用 ≠ 传递闭包
Agent Approval Laundering命名一类记录覆盖失败:approval laundering——持久审批记录忠实地写下入口调用(如 pnpm install、某 MCP tools/call),却漏掉该调用激活的传递工作流效应(lifecycle hook 写文件、MCP 实际走网络)。形式化为 closure-bound approval(六类效应:process / file / environment / network / container / MCP),并证明:若相同策略可见字段需要不同效应决策,则任何仅看记录的策略都无法两边都保证正确。
实证:111 对审批对象/轨迹上,显式字段残余 40 → 命令语义 17 → 决策时元数据 13;11 个固定 SHA 项目执行上元数据层可到 0。前瞻修复是 effect-bound record:授权前冻结源支撑的效应预测与 provenance;holdout 上宏召回 0.926 / 宏精度 0.941,残余效应实例 10→3;Claude Code PreToolUse 原型走现有权限路径且不自动放行。
对实践
- UI 审批文案必须区分:表面命令 vs 预测传递效应;只显示前者等于结构性洗钱通道。
- 安装类 / MCP / Docker / Git hook 默认按「会扩展」处理;用仓库元数据做 preflight,而不是靠人脑补全。
- 与 SpecHarness 互补:一个管「规格说了什么」,一个管「这次批准覆盖哪些副作用闭包」。
04找 · 读
四、账单边界:保留即计费,保留即可被 DoW
Persistent Billable State定义 persistent billable state:多步工具 agent 把外部工具回传保留进后续模型输入时,提供商会再次计量。已被准入的恶意/失陷工具可把不可信数据变成受害者持续付费的处理,无需受害者凭证或本地提权。DOW-BENCH:243 次执行中,单会话累计输入最高可达首呼的 14,293×;原始历史保留使均有效会话成本 +21.2–35.9%。治理点在 pre-reingestion:确定性历史变换 + 四条宿主不变量(提示质量、上下文增长、递归机会、累计花费)。扫描的 3,830 个 MCP 相关仓中,仅 71 暴露任何代码可见防护代理,无一覆盖全部四类。
对实践
- 工具回传默认 压缩/摘要/预算门 后再入上下文;原始大块保留视为安全债。
- 会话级 spend cap + 递归机会检测先于「再问模型一次」。
- MCP 准入清单加一栏:是否声明账单边界与历史策略——与 Approval Laundering 的「效应边界」并列。
05找 · 读
五、恰好一次住在哪:模型、harness,还是工具契约?
Where Does Exactly-Once Live? / LIMBO在确定性沙箱(六服务、十二故障模式、25,930 episodes)上拆分:写超时或报错时,动作可能已经生效——盲重试会双倍扣款/部署,放弃则漏做。结论依赖故障类型:
- 可读回确认的故障(丢确认、误导错误):前沿模型在「恰好一次」指令下几乎不重复(0.5%),弱模型常重复;模型解释 53% 方差。
- 读不回的故障(仍在飞行、传输双投):同一前沿模型重复率 56% / 74%;契约解释 81% 方差。
- 证明:无飞行时间上界时,仅验证策略无法恰好一次。短且已知上界可等;重尾飞行延迟下,即使每集等一小时,也不如每次写都带 idempotency key(重复率 28%→4%)。Harness 几乎无关;附加 key 的护栏可跨 harness 迁移。agent 在已重复效应的 episode 中仍有 90% 报告成功。
对实践
- 非幂等写:工具契约强制
idempotency_key+ 声明 status 读回;别把恰好一次赌在 prompt。 - harness 层做「自动挂 key」比换编排框架更划算。
- 成功自报不可信——以外部 ledger / receipt 为准(接昨日独立 traces)。
06找 · 读
六、Jev 仍可被劫持:schema 不等于免疫
Decision Hijacking把 InjecAgent 风格攻击对准 非生成、schema 约束 的 Jev:510 例重构案例显示,恶意内容会移动动作概率,但很少让 Jev 选中攻击者目标;override 标记降低影响。自适应攻击(分数反馈)把优化中最高攻击目标概率大致翻倍,新鲜验证成功率 1.8%→3.5%。成功常关联初始决策边际小或攻击者对观察有更大控制。
对实践
- 昨日 JevOut / Jev-Mobile 结论加一条:schema 输出改变但不消灭注入风险——评测要看允许动作集内的概率偏移,不只看「有没有越 schema」。
- 决策头输入通道加 override / 来源标记;小边际决策强制升采样或人工。
- tip 上 Just Ask Jev(对齐检测)与本文正交:校准检测 ≠ 抗注入;两边都要。
07找 · 读
七、跨层证据:应用遥测看不见的,内核看得到
On the Effectiveness of Kernel-Level Evidence for Agent Security / ACE指出:多数 agent 安全基准与防御停在应用遥测(工具清单、用户提示、模型消息);部分威胁把指令与动作走私到应用边界之外。ACE 语料:4,047 会话、17 威胁模型、六投递族、覆盖 OWASP LLM/agent 威胁中的 14/25 类。四类检测器上:内核证据单独可辨;与应用层组合普遍优于单层;并展示对未见攻击族与另一运行时的迁移。
对实践
- 安全运营默认采集 配对证据:应用轨迹 + syscall/eBPF;与 Hard Stop / AgentKernel Execution 支柱同栈。
- 红队按 delivery vector 分类,而不是只按 prompt 文本分类。
- 检测器评测要报跨层增益,避免「只在应用层刷分」。
08找 · 读
八、持久之前先定作用域:认证过 ≠ 处处可用
Scope Before You Persist研究冻结模型 agent 在 ProcStream-RSI(12 轮代码修复流)上的持久 skill 编辑。关键干预:把已接受 skill 的检索限制在其起源任务族,隐藏轨迹效用从全局记忆的 0.713 升到 0.816,有害部署从 8 中 6 次降到 0。27 对随机序流上,Scoped-ORC 相对 Global-ORC 均效用 +0.063,接受 63 vs 12 次更新,且 0/63 有害接受。全局控制甚至低于静态 agent(0.713 < 0.775)——因为局部正确编辑会干扰无关族。
对实践
- 记忆/skill 门禁拆成两问:是否认证通过(ORC 等)与 允许在哪些族检索(scope)。
- 默认 private、按族挂载;全局记忆池当作显式危险模式。
- 与 HEXIS / Growing Harness 衔接:可编译/可生长的控制面仍要按任务族隔离发布面。
09找 · 读
总览
flowchart TB
subgraph authority [Authority]
spec[SpecHarness obligations]
approve[Effect-bound approval]
end
subgraph os [Agent OS]
kernel[AgentKernel 4 pillars]
ace[ACE app+kernel evidence]
end
subgraph economy [Economy of effects]
dow[Billable-state boundary]
once[Exactly-once contract]
end
subgraph decide [Decision / Memory]
jev[Jev hijack resistance]
scope[Scoped memory/skills]
end
spec --> approve
approve --> kernel
kernel --> ace
kernel --> dow
kernel --> once
approve --> once
jev --> scope
scope --> kernel
ace --> approve
工程口诀(今日版):规格持笔、内核强制、审批绑闭包、保留先计量、写带幂等键、Jev 看边际、证据跨两层、记忆按族用。