数据科学代码翻译(DSCT)指在保持功能等价的前提下,将代码在不同数据科学库之间相互转换,以实现生态系统的互操作性。虽然大语言模型(LLM)在数据科学代码生成(DSCG)方面取得了显著进展,但其在 DSCT 上的表现仍缺乏系统评估。为此我们推出 ORCA 基准,包含两个互补设置。ORCA‑MAIN 收录 1,600 条精心挑选的基础任务,覆盖数据查询、数据操作和深度学习三个代表性领域。ORCA‑PROJECT 则提供 200 条完整项目的翻译任务,涉及七类数据科学任务。每个任务配有标注的参考翻译和用于验证功能等价的测试用例,并通过多阶段质量验证流程确保任务正确性和测试用例的鲁棒性。实验表明 DSCT 仍具挑战性,即使是最前沿的 LLM 也表现有限。Claude‑Opus‑4.6 在 ORCA‑MAIN 上的成功率为 56.92%,在 ORCA‑PROJECT 上为 33.67%,显示出显著提升空间。我们还发现翻译方向存在明显偏好:当源代码使用更明确、细粒度的操作时,翻译更容易。基于此提出的意图增强方法先让模型推断源代码意图,再将其作为额外上下文用于翻译,在 ORCA‑MAIN 和 ORCA‑PROJECT 上分别提升了 4.80% 和 5.33% 的绝对成功率。
点评:ORCA 为 DSCT 提供了系统化评估平台,揭示了当前 LLM 在跨库代码迁移中的瓶颈,并通过意图增强展示了提升路径,值得后续研究深入探索。