语言模型常在精心挑选的基准上评估,这些基准往往低估了企业级部署的复杂度。我们提出 HARDEN,一种约束进化搜索方法,能够在保持原始期望输出不变的前提下,将已有评估案例的输入改造为更具挑战性的变体。HARDEN 沿着生成的领域特定复杂度轴进行搜索,同时强制满足可行性约束,包括保持任务语义、真实感以及执行有效性。实验在 FinQA、PubMedQA 与 ContractNLI 三个数据集上,结合三种规模的 Qwen3.5 模型(35B‑A3B、122B‑A10B、397B‑A17B)进行评估。结果显示,HARDEN 相比单次基线在相同可行性检查下,平均降低任务模型准确率 22.7%,最高可达 49.9% 的相对下降。该工作表明,进化搜索能够生成显著更难且仍然有效的评估案例。
点评