摘要
评估应不仅仅测量模型当前的性能,还应告知我们下一次模型迭代需要修复的内容,并提供生成定向后训练数据的方法。大多数评估流程识别弱示例、主题或类别,但它们未明确指出能力失败的根本原因:它们只说明模型的失败位置,而不说明失败原因。
我们引入了CRAFT,一种将任何基于评估标准的数据集转换为模型特定的能力弱点诊断的方法。CRAFT将每个评分标准视为能力探测器:它从每个提示与评估标准对中提取能力描述,将这些描述聚类成一个层次能力树,针对每个节点对目标模型进行评分,并动态选择在各树层次中表现较差的节点,选择在每个失败最明显的粒度上进行处理。然后,选定的弱能力将指导生成定向的监督微调数据。
在固定数据生成、微调和评估设置的情况下,我们将CRAFT与提示级EvalTree聚类和无目标随机生成在四个开源模型、两个专业领域(金融和法律)以及13个与诊断数据不重合的基准进行比较。CRAFT在所有四个模型中,在重复温度解码下,达到了金融领域的最佳平均成绩;在法律领域,它在四个模型中的三个模型中表现最强,并在第四个模型中保持在最佳基准的解码方差范围内。
因此,在评估标准的层面上诊断弱点,而不是提示或类别,能够提供更清晰的模型无法执行的内容,同时在基于该诊断的微调后显著提升模型性能。
博主点评: CRAFT方法通过将评估标准与能力探测结合,打破了传统评估的局限性,为模型的定向微调提供了重要的指导。通过层次化能力树的构建,CRAFT不仅明确了模型的弱项,还为后续的优化提供了有力的数据支持,推动了LLM的发展与应用。