NeFut Logo NeFut
EN 管理员登录

[AI学术] SenWorld:生成上下文丰富评估数据的数字双胞胎仿真

发布于:2026-07-23 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Open Source

在智能手机个人助手的评估中,长时间的个人数据是必不可少的,但获取上下文丰富的评估数据却面临隐私敏感问题。为了解决这一挑战,我们提出了 SenWorld,一个基于物理的、确定性的、事件源驱动的数字双胞胎仿真系统,能够生成带有已知真值的数据。

在 SenWorld 中,虚拟角色在真实地图、天气、节假日和网络数据构建的世界中度过完整的一天;每个可观察信号都在全系统快照中归档;每个评估案例通过指向现有记录的指针来标记,而非后期注释或大型语言模型(LLM)评判。

我们在北京对 16 个虚拟角色进行了评估。生成的数据在类别分布(Jensen–Shannon 散度(JSD)为 0.070)和通信记录的日常节奏(JSD 低于 0.1)上与保留的真实用户基准紧密匹配,尽管生成的记录仍然短于真实记录。

没有脚本化的互动,虚拟角色形成了一个完全互惠的对话子图和差异化的行为谱系。针对 717 个评估案例,生成的数据揭示了生产智能手机助手中的 78 个失败,集中在通话和短消息服务(SMS)记录上,而联系人、日程和闹钟则没有失败。快照指针确认每个失败都是助手端的检索错误,没有涉及 LLM 评判。

总体而言,SenWorld 提供了一条隐私安全、可重现且经过分布检查的评估数据路径,其标签由构造固定。

博主点评: SenWorld 的创新在于其通过数字双胞胎仿真技术,既解决了隐私问题,又提供了可靠的评估数据。这为智能助手的性能优化提供了新的思路,尤其是在数据敏感性日益增加的背景下,具有重要的应用前景。

原文链接: https://arxiv.org/abs/2607.19949

[h] 返回首页