NeFut Logo NeFut
EN 管理员登录

[AI学术] SkillEval:解构智能体技能质量的可解释信号

发布于:2026-08-10 22:00 最后更新:2026-08-11 02:05
#AI #Machine Learning #SkillEval

随着智能体技能的广泛应用,评估技能质量变得越来越重要。现有的评估方法通常通过测试技能是否能提高特定下游任务的性能来衡量技能质量。然而,一个可重用的技能可能适用于多种任务场景。下游评估主要反映了技能与评估任务之间的兼容性,仅提供了技能质量的部分视角,并不能确定哪个方面的技能需要改进。我们发现,SKILL.md 文档的通用属性在技能质量中起着重要作用。为了评估这些属性,我们提出 SkillEval,一种用于文档级别技能评估的可解释框架。SkillEval 使用固定和可检查的评分方向来评估每个属性,生成可解释的评分。它进一步测量和减少无关文档特征(如长度和格式)的影响,以便每个评分更具体地捕获其预期的语义属性。具体来说,SkillEval 从模型的隐藏表示空间中的控制正负技能对中学习每个质量属性的可解释方向,并通过将新技能的表示投影到这些固定方向上来评分。我们使用 SkillEval 进行控制质量测试,表明 SkillEval 可靠地区分不同质量的技能。此外,SkillEval 评分也能紧密反映下游任务的性能,提供了技能是否能够帮助智能体完成任务的早期指示。我们进一步探索 SkillEval 用于诊断技能文档的弱点并指导有针对性的修订。修订后的技能提高了目标属性,并在下游任务中获得更高的通过率。 博主点评: SkillEval 框架为智能体技能质量的评估提供了一个新的视角,通过解构技能质量的可解释信号,可以更好地理解和改进技能的性能。

原文链接: https://arxiv.org/abs/2608.06891

[h] 返回首页