本文提出一种端到端方法,用专家输入结合合成数据生成上下文特定的大语言模型(LLM)基准数据集。传统构建方式在有效性与可扩展性之间存在权衡:专家设计的数据质量高但成本大,纯合成数据规模易扩展但常出现不真实、冗余或超出范围的样本。为弥合此差距,作者设计了一套模式(schema),用于捕获评估任务的目标、范围和上下文等关键信息,并以此指导合成数据的生成。
基于测量有效性的理论,提出四个数据质量准则:覆盖度、 多样性、 内容真实度和 风格真实度。通过这些准则,展示了专家提供的脚手架如何引导合成过程产生更具有效性的基准。
在量化实验中,使用多种基准对比了本方法与纯合成或纯人工构建的方案,结果显示在保持有效性的同时,数据质量指标显著提升。随后,作者与领域专家合作开展了真实案例研究,进一步验证了方法的实用性。
进一步分析了不同模式信息对各质量准则的影响,给出在资源受限情况下应优先收集的关键信息类型的实用建议。
点评