遗传编程及其变体(如文法进化)在符号回归中被广泛用于从多变量数据中推导数学表达式。除了预测精度,研究者还期望模型具备可解释性,即提供输入变量与结果之间的显式方程。然而,进化得到的模型往往结构复杂或与已知科学原理冲突,导致可解释性和合理性难以兼顾。
本研究探讨大型语言模型(LLM)能否在进化计算生成的符号回归模型之上,提升其解释性。我们在先前利用基于文法的遗传编程估算体脂率的工作基础上,使用 LLM 作为后处理工具,对演化得到的表达式进行分析并依据可解释性与医学合理性进行排序。实验选取四个符号表达式,分别交由三种 LLM(每种模型重复三次)进行评估,随后由三位临床医生组成的评审小组对解释和排序结果进行打分。
结果显示,三种 LLM 给出的模型整体排名比单独的项级解释更能获得临床医生的认可,说明比较性的审计信息更具价值。但 LLM 仍会给出生理或数学上可疑的解释,表明其更适合作为在专家监督下的比较审计工具,而非完全自主的验证手段。
本工作是已提交期刊的扩展版本。
点评