Google:Anatomy of Harness Engineering(behavioral evals)
源:09-09。端到端基准(Terminal-Bench / DeepSWE)像「期末成绩单」——分数动了几分却不知为何。Behavioral evaluations 像 harness 的集成测试:断言离散可观察动作(澄清提问、改 build 前跑 validator、文档给 canonical link),而非最终 prose 相等。时机:先 dogfood 到能自托管样板任务,再上 eval;eval 的主目的不是庆祝 +2%,而是给 prompt/tool schema/模型升级防回退的信心。架构:快、确定性、本地 unit-style 检查;复杂路径用模糊 outcome / LLM-as-judge,勿死锁工具序列。可做成 CI 护栏下的 prompt 自改循环。结论:macro 终点 + micro 行为互补。对照 Anthropic demystifying evals、Airbnb 内部 eval、ExecCritic 的 Test↔Repair 隔离:Google 把「行为断言」明确升格为 harness 迭代的默认传感器。
AgentAudit(arXiv:2609.09875)
源:09-09。既有评测多只看任务完成或安全一面;AgentAudit 挂接到任意 LLM agent,只读执行轨迹、不干预运行。十维:instruction integrity / planner / memory / tool selection / invocation / correctness / alignment / tool faithfulness / security / execution integrity,外加行为分类与 failure attribution。五模型 × 九能力+对抗任务:Claude Sonnet 5 / GPT-5 Composite Trust 95.1 / 80.6;Sarvam / Llama 3.3 / Gemini 2.5 Flash 57.6 / 45.7 / 22.6。关键洞见:任务完成相近的模型,信任度可严重分叉——非前沿模型在对抗任务上反复被标 Unsafe_Compliance(而非单纯失败),pass/fail 基准看不见。局限:单一固定 judge(且是被评模型之一)。对照 CapScope(授权钉扎)与 Scanning the Harness(供应链缺陷):AgentAudit 把「失败发生在哪一阶段」变成可归因对象。
SkillAlign(arXiv:2609.07255)
源:09-07 date-honest。既有工作问 skill 怎么写/取/压/组合,却默认暴露接口固定。同一 skill 因暴露方式可帮助、干扰或误导。SkillAlign:多视角 procedural card + 暴露接口(full / hint / compressed summary / workflow / none);任务、agent、候选 skill 固定,只变暴露——反事实评测。ALFWorld + SkillsBench:暴露形式显著影响成功率与上下文成本;compact top-k 可优于全库注入。回放策略学习显示自适应暴露有可学信号,但远未达 oracle。对照 SkillAdam(优化记忆/编辑预算)与 Persistent Skills:不仅「选哪个 skill」,还要「怎么呈现」。
vLLM × AgentX(agentic serving)
源:09-08。AgentX 痕迹:中位 43 轮、输入 142K / 输出 444、前缀命中 >96%、44% 含 subagent。三挑战:前缀缓存压力、长上下文执行效率、P/D 配比。对策:hybrid KV + Mooncake 分层卸载、session-aware retention、K3 的 DCP / V4 的 PCP+DEP、--long-prefill-token-threshold 破 HOL、--prefill-schedule-interval 对齐 DEP。公开 AgentX:V4 Pro 106×、M3 85×、K3 14.6× 相对 Opus 5 服务成本优势(理论缓存对 Opus 有利)。苦教训:PP 不适暖前缀轮;DCP 难迁 V4;负载均衡不如 session sticky。对照 llm-inference-engineering:agentic 流量把「缓存局部性」抬成一等公民。
Craft:Code Reviewer → Agent Manager
源:09-10。审查假设「别人是作者」;管理假设「你是作者、agent 是会翻车的结对」。工作上移:prompt-as-API-contract、每仓 CONTEXT.md、验证取代信任(规格匹配 + 系统契合)。三项税:认知(维持 agent 心智模型)、时间(非显然设计常更慢)、可靠性(同 prompt 非确定性)。人类守设计门、agent 做实现;把交互日志当一等文档。对照 OpenAI harness engineering「Humans steer」与 personal-development 文:技能栈从「读 diff」迁到「写规格 + 编排验证」。
交叉读法(给 articles 就地折入用)
| 主题 | 落点建议 |
|---|---|
| behavioral micro-evals + macro | eval-engineering;harness-engineering |
| 全生命周期信任 / failure attribution | evidence-engineering;test-time-trust-economics |
| skill 暴露接口 | agent-skills-engineering |
| agentic serving / KV locality | llm-inference-engineering |
| reviewer→manager / prompt-as-spec | personal-development-in-the-ai-age;human-decision-advantage-in-agent-collaboration |