second brain research
← 全部阅读

← 2026-09-11 日阅读

2026-09-11

Google behavioral evals / AgentAudit / SkillAlign / vLLM AgentX / Agent Manager craft

harness-engineeringbehavioral-evalstrust-evalagent-skillsagentic-servinglearning-and-craft

窗口 ~2026-09-09→09-11(Asia/Shanghai)。去重 SB-20260910(CapScope / SkillAdam / Co-Evolving / ExecCritic / Procedural Graphs / Scanning / RobustSGPO)与其后 nightly ingest;不重挖昨日。跳过 DEV Community Sep 3 综述(窗外且与 Google 主文重叠)。SkillAlign(09-07)按 date-honest 补缺口。

Google:Anatomy of Harness Engineering(behavioral evals)

:09-09。端到端基准(Terminal-Bench / DeepSWE)像「期末成绩单」——分数动了几分却不知为何。Behavioral evaluations 像 harness 的集成测试:断言离散可观察动作(澄清提问、改 build 前跑 validator、文档给 canonical link),而非最终 prose 相等。时机:先 dogfood 到能自托管样板任务,再上 eval;eval 的主目的不是庆祝 +2%,而是给 prompt/tool schema/模型升级防回退的信心。架构:快、确定性、本地 unit-style 检查;复杂路径用模糊 outcome / LLM-as-judge,勿死锁工具序列。可做成 CI 护栏下的 prompt 自改循环。结论:macro 终点 + micro 行为互补。对照 Anthropic demystifying evals、Airbnb 内部 eval、ExecCritic 的 Test↔Repair 隔离:Google 把「行为断言」明确升格为 harness 迭代的默认传感器。

AgentAudit(arXiv:2609.09875)

:09-09。既有评测多只看任务完成或安全一面;AgentAudit 挂接到任意 LLM agent,只读执行轨迹、不干预运行。十维:instruction integrity / planner / memory / tool selection / invocation / correctness / alignment / tool faithfulness / security / execution integrity,外加行为分类与 failure attribution。五模型 × 九能力+对抗任务:Claude Sonnet 5 / GPT-5 Composite Trust 95.1 / 80.6;Sarvam / Llama 3.3 / Gemini 2.5 Flash 57.6 / 45.7 / 22.6。关键洞见:任务完成相近的模型,信任度可严重分叉——非前沿模型在对抗任务上反复被标 Unsafe_Compliance(而非单纯失败),pass/fail 基准看不见。局限:单一固定 judge(且是被评模型之一)。对照 CapScope(授权钉扎)与 Scanning the Harness(供应链缺陷):AgentAudit 把「失败发生在哪一阶段」变成可归因对象。

SkillAlign(arXiv:2609.07255)

:09-07 date-honest。既有工作问 skill 怎么写/取/压/组合,却默认暴露接口固定。同一 skill 因暴露方式可帮助、干扰或误导。SkillAlign:多视角 procedural card + 暴露接口(full / hint / compressed summary / workflow / none);任务、agent、候选 skill 固定,只变暴露——反事实评测。ALFWorld + SkillsBench:暴露形式显著影响成功率与上下文成本;compact top-k 可优于全库注入。回放策略学习显示自适应暴露有可学信号,但远未达 oracle。对照 SkillAdam(优化记忆/编辑预算)与 Persistent Skills:不仅「选哪个 skill」,还要「怎么呈现」。

vLLM × AgentX(agentic serving)

:09-08。AgentX 痕迹:中位 43 轮、输入 142K / 输出 444、前缀命中 >96%、44% 含 subagent。三挑战:前缀缓存压力、长上下文执行效率、P/D 配比。对策:hybrid KV + Mooncake 分层卸载、session-aware retention、K3 的 DCP / V4 的 PCP+DEP、--long-prefill-token-threshold 破 HOL、--prefill-schedule-interval 对齐 DEP。公开 AgentX:V4 Pro 106×、M3 85×、K3 14.6× 相对 Opus 5 服务成本优势(理论缓存对 Opus 有利)。苦教训:PP 不适暖前缀轮;DCP 难迁 V4;负载均衡不如 session sticky。对照 llm-inference-engineering:agentic 流量把「缓存局部性」抬成一等公民。

Craft:Code Reviewer → Agent Manager

:09-10。审查假设「别人是作者」;管理假设「你是作者、agent 是会翻车的结对」。工作上移:prompt-as-API-contract、每仓 CONTEXT.md、验证取代信任(规格匹配 + 系统契合)。三项税:认知(维持 agent 心智模型)、时间(非显然设计常更慢)、可靠性(同 prompt 非确定性)。人类守设计门、agent 做实现;把交互日志当一等文档。对照 OpenAI harness engineering「Humans steer」与 personal-development 文:技能栈从「读 diff」迁到「写规格 + 编排验证」。

交叉读法(给 articles 就地折入用)

主题 落点建议
behavioral micro-evals + macro eval-engineeringharness-engineering
全生命周期信任 / failure attribution evidence-engineeringtest-time-trust-economics
skill 暴露接口 agent-skills-engineering
agentic serving / KV locality llm-inference-engineering
reviewer→manager / prompt-as-spec personal-development-in-the-ai-agehuman-decision-advantage-in-agent-collaboration