second brain
source
← 首页

external-source

Evaluating Skills, Not Just Agents:Skill 评估不能只看 SKILL.md

Xudong Han (@Xudong07452910) · 2026-08-25 Linked paper: Christopher Kevin et al. (NVIDIA) · arXiv:2608.20614 · 2026-08-20

Source post

Post body (@Xudong07452910)

一个 Skill 写得很漂亮,通过了所有静态检查,真正交给 Agent 用时却可能完全没帮助。

NVIDIA 这篇《Evaluating Skills, Not Just Agents》讨论的就是 Skill 应该怎么评估,适合收藏起来使用。

现在很多 Skill 主要检查 SKILL.md 写得是否规范、描述是否清楚、有没有安全问题。

但真正上线后,还要看 Agent 会不会找到它、能不能正确调用工具、是否按流程执行,以及最终任务有没有做得更好。

作者提出 ACES,直接做一组很简单的对照实验:

同一个任务、模型和环境,一次给 Agent Skill,一次不给,然后比较两条真实执行轨迹。

这个差值被定义为「Skill Lift」。

在 145 个真实 Skill 上,94.5% 都能通过基础结构检查,但不同静态评分之间的相关性只有 0.14。

进一步跑 947 个配对任务后,72.8% 的案例获得正向 Skill Lift,同时也有 87 个案例出现负向效果。

所以这篇工作很适合现在越来越大的 Skill 生态。

我们评价一个 Skill,不能简单的只问「写得好不好」,还要真正跑起来看它到底有没有让 Agent 做得更好。

Skill 也需要像代码一样,有自己的测试集、回归测试和 CI。

Replies at fetch

Thread fetch returned one unrelated spam reply; omitted.

Linked original (paper)

Full paper preserved as text-extracted markdown (PDF converted with npx @firecrawl/anydoc; original binary not kept): arxiv-2608-20614-evaluating-skills-not-just-agents