在这项研究中,我们探讨了如何将大型语言模型(LLMs)有效地应用于学术监督领域。尽管LLMs能够流畅地回答单次提示,但将其作为领域决策系统的可靠组成部分却更加具有挑战性。为了弥补这一差距,我们提出了“支撑工程”(harness engineering),即围绕LLM核心构建确定性的支撑结构,包括符号过滤器、检索、模式验证的输入输出、LLM作为评判者的循环、人工反馈门、持久状态和审计轨迹。
我们进行了案例研究,比较了一个基础模型(ASA),即没有支撑结构的GPT-5聊天机器人,和一个多模块系统(ASuS),后者将较小的GPT-4o-mini封装在LangGraph支撑结构中,包含符号-语义检索、模式验证的输出、带有重试的LLM评判、人工反馈门、确定性加权风险评分以及每个节点的SQLite审计轨迹。
评估标准针对六个支撑机制维度(基础、可解释性、一致性、过程完整性、认知负荷、约束遵循)进行了调整。通过盲评的十位评审者的混合评估,结合2 x 2模型-支撑消融实验,结果显示,尽管ASuS使用了较小的基础模型,但在每个维度上均超越ASA。ASuS的池均值为4.08,而ASA为1.23,10位评审者中有8位在alpha = 0.05的情况下拒绝原假设;完整数据详见6.4和6.7节。消融实验确认支撑结构的结构性贡献在很大程度上与模型无关。
我们总结了七种反复出现的支撑工程模式,并认为在可靠性、可追溯性和制度一致性比开放式流畅性更重要的情况下,支撑工程挑战了“更大模型更好”的普遍认知。