在农业机器人领域,视觉导航的研究已经相当广泛,但大多数现有系统假设在白天条件下进行操作。实际上,夜间部署自主机器人具有显著优势,包括24小时的作物和土壤监测、果实采摘以及夜间害虫检测。然而,现代基于视觉的系统严重依赖于大型、良好注释的图像数据集,而夜间操作场景的数据集获取仍然具有挑战性。
为了解决这个问题,我们提出了一种无监督图像转换框架,该框架能够将白天的植物行RGB图像转换为近红外(NIR)夜间图像,而无需逐像素监督。这使得可以直接重用白天的语义标签来训练夜间感知模型。特别地,通过引入预训练的对比语言-图像预训练(Contrastive Language-Image Pre-training, CLIP)模型,该框架旨在保持昼夜转换过程中的语义一致性。此外,我们引入了可见性掩码,以考虑夜间场景中NIR照明的有限有效范围。
我们与最先进的图像转换基线进行了比较评估,结果表明图像质量更高,同时在夜间视觉导航的下游语义分割任务中表现也有所改善。为了进行评估,我们使用了AgriNight数据集——这是一个新的数据集,包含428张白天和549张夜间图像,这些图像是使用夜视装备的移动机器人在农业田野中收集的,并进行了逐像素的语义标签手动注释。我们将其作为夜间农业视觉导航的第一个基准。此外,我们还进行了实际机器人在夜间进行自主导航的实验。数据和代码可在此获取:GitHub。
博主点评: 该研究显著推动了夜间农业机器人技术的发展,尤其是在无监督学习和图像转换领域。通过引入CLIP模型和可见性掩码,研究者们有效解决了夜间视觉导航的难题,为未来的农业自动化提供了重要的技术支持。值得关注的是,AgriNight数据集为后续研究提供了宝贵的资源。