NeFut Logo NeFut
EN 管理员登录

[AI学术] TasteBench:用于感官预测的多模态基准,从分子到可持续食品

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #DeepSeek

可持续蛋白发现缺乏类似分子对接或密度泛函理论的快速计算代理,导致需要昂贵的人类感官面板来判断新食品的味道是否与动物基准相似,从而成为设计‑构建‑测试循环的瓶颈。

为此我们推出 TasteBench,一个多模态基准并配合隐私保护竞赛,包含两个任务:食品层面的排序任务,基于 21K+ 人类评价,覆盖 215 种植物基食品,24 类产品,形成 935 对同类内部排序对;以及分子层面的味道分类任务,涉及 15K 种风味分子。

为了严谨评估模型表现,我们分析了真实标签的可靠性:面板间一致性低(Krippendorff's $\alpha = .077$),而面板聚合排序的半分割可靠性上限为 $.825$,这定义了模型应达到的性能区间。

我们在四种输入模态上测试基线模型。在面板实际评分的相同对上,最佳模型的配对准确率为 $.661$,已接近中位面板成员的 $.650$;在所有同类内部对上达到 $.683$。

TasteBench 提供了评估基础设施和基线,实现对可持续蛋白发现的计算筛选进展的量化测评。

点评

原文链接: https://arxiv.org/abs/2610.02599

[h] 返回首页