“所见即所得”是许多软件工程师的设计准则,但生成式 AI 在 3D 打印时往往只能输出外观,而不考虑功能,导致杯子无法盛水。为了解决这一问题,MIT CSAIL、Google 与东北大学合作研发了 InstructMesh,它将文本‑图像 3D 生成系统 TRELLIS 与大语言模型 GPT‑4 结合,使用户能够在生成模型后直接用自然语言标记并修改感兴趣的部位。
使用 InstructMesh,研究人员可以让系统生成一副眼镜的蓝图,然后高亮需要改进的区域,例如加粗镜腿或改变镜片形状,系统会在潜在空间中进行几何调整并返回可视化结果。该界面对新手友好,甚至不需要掌握传统的 3D 建模工具。
示例包括:
- 将龙的尾巴做成杯柄的龙形咖啡杯;
- 形似贝壳的蓝色哨子;
- 蝴蝶翅膀展开的眼镜;
- 触手分配液体的章鱼式饮料分配器;
- 看似牛仔布的膝盖护具以匹配患者的牛仔裤;
- 像彩色虾的“刷毛机器人”,内部隐藏电机,可在表面滑动。
在对 Thingiverse 上流行模型的复现实验中,TRELLIS 生成的模型约有 80% 存在结构缺陷。研究团队让没有 3D 设计经验的新人使用 InstructMesh 识别并修复这些缺陷,专家评审显示他们的成功率约为 90%。
InstructMesh 的核心优势在于:
- 通过潜在空间操作实现自然语言描述的几何修改;
- 滑块提供细粒度的尺寸调节,如放大或拉伸特定部件;
- 交互式反馈让用户即时看到修改后的模型,确保“所见即所得”。
作者计划将该系统集成到增强现实平台,用户可以在真实环境中描述需求,系统即时生成并 3D 打印相匹配的物件(例如与钱包颜色一致的手机壳)。未来还可能加入物理仿真,预测模型在跌落或受力时的表现,并使用更新的 TRELLIS.2 进一步细化微小特征。
点评