摘要
创建冲刺待办事项需要大量努力,因为诸如史诗、用户故事和任务等项目可能会丢失或不一致地指定。我们提出了一种多模态方法,以支持从视觉应用程序原型生成待办事项,这些原型在项目早期阶段可用。
方法
我们评估了三种提示策略在 GPT-4o 上的效果:零-shot 基线、组合链式思维(CCoT)用于视觉-语言推理,以及基于角色的提示。我们研究了七个应用开发项目,涉及两个国家,并采访了开发人员以了解结果。
结果
总体而言,我们观察到基线提示更倾向于召回而非精确度,而 CCoT 更加平衡,史诗和用户故事的平均 F1 分数为 52-66%。生成准确的任务更具挑战性。当添加架构上下文时,精确度的提升最为显著,特别是在后端任务中(精确度提升可达 35%)。开发人员的访谈显示,多达 26%的假阳性仍被视为有用,这反映了待办事项创建的创造性和开放性。
结论
为了捕捉这一点,我们提出了一种新的度量标准,称为修正召回,补充了开发人员评估的真实评估。我们的发现表明,结合架构上下文的混合提示可以帮助从早期原型中生成待办事项,尽管结果因项目类型而异,开发人员的监督仍然是必要的。
博主点评: 本文探讨了如何通过多模态方法利用 AI 生成待办事项,尤其是在项目早期阶段。结合架构上下文的提示策略显著提升了生成的精确度,展示了 AI 在软件开发中的潜力与挑战,值得开发团队关注。