second brain
research
← 全部阅读
目录

← 2026-09-24 日阅读

2026-09-24 约 6 分钟

Harness 生长与压缩 × Serving 栈评测 × 失败驱动运行时 × Jev/记忆校准

agentic-engineeringharnesscompactionservingruntimeJevmemoryevaluation

昨日 dig 把「harness 自改进 / memory 任务验收 / 成本可控回归」拆成三条闭环。今日窗口(~2026-09-22→24)的新批次把问题推进一步:不要把控制逻辑继续堆进上下文,也不要把「模型分数」当成 serving 真相。四条可并行落地的工程线是——harness 用失败反馈长成可执行代码、压缩只截不断写、评测把 serving 栈与生产 E2E 算进协议、运行时用失败态策略与 Jev/记忆校准把「已有能力」变成可交付可靠性。

本仓 tip 已有 Pi+Jev 自定义 harness形式化验证 Claude Agent SDK(X-bookmark ingest,非本日 dig keeper);下文把它们当作已入库工程语境,对照今日 primary sources。

01找 · 读

一、Harness:把重复控制从 context 挪进可生长代码,并把压缩做成无漂移信道

Growing Harness:失败引导,让 harness 自己长出控制器

Growing Harness指出:标准 harness 让模型在每个相关任务里反复重建同一套控制决策。作者问:任务反馈能否把** recurring control** 固化成可复用可执行代码,只把 LLM 留给任务语义?方法从 strategy-free scaffold(固定模型与工具接口、不含解题控制器)出发;函数级执行轨迹把失败定位到有界代码面;优化器联合修复一窗失败;success-first held-out gate 回滚伤害旧能力的修复序列。接受的编辑累积进共享 harness,控制结构从反馈中涌现。

结果:在 BrowseComp-Plus / WebArena-Verified、4B–120B 三档部署模型上,六组设定中五组 mean success 最高;相对 Tool-Calling,LLM 调用降 76.0–91.8%,推理成本降 74.4–98.6%。小模型上差距更刺眼:WebArena-Verified 上 Growing Harness 约 45% success,Tool-Calling 在 4B 仅 6.7%。

对实践

夜间/批处理改进环应改写 harness 代码面(路由、gate、工具策略),而不是只往 AGENTS.md 塞更长策略。落地清单:(1)从无策略脚手架起步;(2)失败必须 trace-local 到函数;(3)联合修一窗,不要单点补丁连环叠;(4)held-out gate 优先保旧能力。验收看「同任务 LLM 调用次数与 $/task」是否下降,而不是只看终点 pass。

CliffCompaction:只截断、不改写;永不 compact 一次 compaction

CliffCompaction面向百万 token 级长 horizon:有界上下文下成本可降约 50%,Terminal-Bench 维持或提升;并行 test-time scaling 下 Kimi K2.6 可在更低成本追上/超过若干 frontier。关键设计:只 truncating/dropping,永不 rephrase;每次只对原始内容压,丢弃上一轮 compacted 输出,阻断 context drift。开源 API-proxy 可挂 Claude Code / Codex 等 harness。

对实践

默认 summarizer compaction 应降级为「可选项」,主路径用 faithful drop/truncate + 永不叠压。PreCompact 钩子应落盘事实与决策到 harness-owned store(与 tip 上 Pi+Jev / 记忆基础设施同向),而不是指望摘要保留关键句。验收:重复 compaction 后关键事实是否仍可被确定性注入,而不是「摘要里好像还在」。

02找 · 读

二、Serving 与评测:测栈、测生产正确性,而不是只测「本地绿了」

SWE-Serve:仓库级推理服务工程,暴露 local pass vs production E2E 鸿沟

SWE-Serve从 SGLang 近期生产变更抽出 53 个仓库任务、六类 inference engineering family;含隐藏功能/回归测试,必要时 E2E serving 与校准性能门。最佳配置 mean pass@1 约 75%,但在 19 个有 E2E 覆盖的任务上:通过其他全部测试的补丁里,约 三分之一 被 model-serving E2E 打回(verifier 45.9% vs 剔除 E2E 后 69.4%)。

对实践

内部「agent 改 serving 栈」门禁必须包含 隐藏 E2E serving + 性能门,禁止「单测绿 = 可合并」。报表分两列:local_passe2e_serve_pass;差距就是生产正确性债。

Measuring the Serving Stack:本地 tool-use 分数常是 serving 混淆,不是模型能力

Measuring the Serving Stack表明:coding agent 必须先发出可解析 tool call。Ollama 等本地栈按模板旗标门控 tools=:有的模型返 text call、有的 native tool_calls、Phi-3/Gemma-3 在推理前被拒。若 harness 不把 rejection/retry exhaustion 记成结构化失败,下游会误报 0% fidelity。跨 Ollama / llama.cpp / vLLM / SGLang 同请求行为不同;constrained decoding 消解析失败却可能不终止;turn-pooled vs per-instance 估计可差约 55 点。

对实践

任何本地 tool-use 榜单旁注 serving 栈 × 协议通道 × 失败元数据。清单:拒绝是否结构化入库、text vs native 通道是否混用、跨栈是否同协议、指标是 per-instance 还是 turn-pooled。换栈后必须重测,禁止把 Ollama 分数直接当模型能力。

03找 · 读

三、运行时与 RSI:不改权重,把「偶尔会」变成「稳定交付」

FIRE:失败态 runtime policy,抬的是 pass^2 不是 ceiling

FIRE研究 harness 在失败前状态注入的定向自然语言指令与动作拒绝——不改权重、不改用户 prompt。Terminal-Bench 2.1 全 87 题、每题两试:三档 GPT-5.6 的 pass^2 全升(Sol 64.4%→73.6%,+9.2),而 best-of-two 几乎不动(+1.2)——政策主要把「够得到的解」变成「重复交付」。随机五臂:真实政策 61% vs 无政策 39% / sham 36% / 泛化核查 39–43%。

对实践

生产可靠性层优先做 failure-informed runtime policy(状态触发指令 + 动作拒绝),而不是先微调。从失败轨迹聚类「失败前状态」,写成可审计策略;主指标用 pass^k / 重复成功,不要只盯 pass@1。与 Growing Harness 互补:FIRE 改运行时约束,Growing 把约束编译进代码。

AIDE²:研究 agent 的递归自改进,改自己的代码并过隐藏评测

Recursive self-improvement of AI research agents让研究 agent 改自身代码、在 AI R&D 任务上基准、保留隐藏评测最优变更。8 天自主跑发现 7 次递进(新搜索策略到压缩/管理上下文的记忆机制);增益迁移到四个 held-out(含 OOD 天气);奖励 hacking 从 55% 降到 32%(环未显式优化该项)。

对实践

自改 harness/agent 代码的环必须:隐藏评测门 + held-out 迁移集 + 奖励 hacking 探针。与昨日 RRSI 同构:只抬训练分的候选 reject。接受的改写要可 diff、可回滚、可对照「人写生产 agent」。

04找 · 读

四、Jev 与记忆:快控制面管记忆与有界决策;校准「用多少记忆」

REFLEX + Jev:有界决策走 typed 快层,强模型按需兜底

REFLEX with Jev用 Jev 做快速 typed 决策层,低置信或需生成时再调强模型。冻结 100 题上 95% success,强模型调用少 72.7%。可靠性依赖动作集大小与授权边界附近的近合法替代;当普通路由已经很准时,相对廉价生成级联优势有限。

对实践

把「授权 / 路由 / 工具选择」等有界决策迁出 LLM:Jev(或同类 typed 控制器)+ 置信门槛。对照 tip 上 Pi+Jev 工程文:tool gate、request router、answer verifier 正是该层。先在回放轨迹上估「可 Jev 化比例」,再上线;动作集一大或边界模糊时保留强模型。

Jev-Mem:System-One 控制记忆构造与检索,System-Two 只做难推理

Jev-Mem把记忆路径上的昂贵自回归控制换成 System-One 控制面(分型、关系组织、查询路由、预算、遍历、打分、自适应停止)+ 多关系记忆面;System-Two 仅复杂推理与作答。LoCoMo LLM-as-Judge 0.777(相对最强基线 +11.0%),构造时间 158s(约 6.6× 加速),查询延迟 0.93s(−36.7%)。

对实践

记忆子系统的热路径禁止默认「每次 LLM 决定存什么/取什么」。控制面规则化/可类型化;只在合成答案时花生成预算。与 CliffCompaction 搭配:压缩保真 + 检索预算由 System-One 管。

MemCalib:评的是「用记忆是否恰如其分」,不是有没有召回

MemCalib指出:记忆有效性取决于模型是否给上下文中每条命题恰当影响力。前沿模型常 over-use / under-use。常见后训练(含 GRPO、on-policy self-distillation)呈方向偏斜:一头变好另一头变差。MemCalib-RL 用有序双向反事实信用分配,分离过用/欠用并定位到响应 token。

对实践

记忆门禁加一维:校准误差(过用率 / 欠用率),不要只报 recall 或任务分。微调记忆行为时分轨优化过用与欠用;单方向奖励会牺牲另一侧。与昨日 DolphinBench / VibeMemBench 叠加:任务完成 × 成本 × 恰当使用

05找 · 读

总览

flowchart TB
  subgraph grow [Harness 生长与压缩]
    gh[Growing Harness]
    cliff[CliffCompaction]
  end
  subgraph serve [Serving 评测]
    swe[SWE-Serve E2E]
    stack[Serving Stack confounds]
  end
  subgraph runtime [运行时与 RSI]
    fire[FIRE policies]
    aide[AIDE2 RSI]
  end
  subgraph mem [Jev / 记忆]
    reflex[REFLEX+Jev]
    jmem[Jev-Mem]
    mcal[MemCalib]
  end
  gh --> fire
  cliff --> jmem
  fire --> reflex
  stack --> swe
  jmem --> mcal
  aide --> gh

四条验收口诀:控制进代码、压缩不改写、分数带栈与 E2E、可靠性看重复成功与记忆校准