前沿模型已经把编写定制代码的成本从专业领域的数天甚至数周压缩到一个下午。然而,审查和维护这些代码的成本并未同步下降。每个解决方案之间缺乏关联,理解一个方案往往需要从头阅读其代码库。大型企业通常采用集中治理的方式:最差情况下使用现成产品,最理想时构建图编排框架或低代码平台来实现特定用例的定制。这类方案每次都需要重新开发,且适用范围受限。
企业往往忽视了第三种选择——harness范式,它既不受限于传统工具,也不需要大量定制。近期研究将coding‑agent harness视为企业基础设施而非单纯的编码工具,得到三大结论:
- 在任务层面,harness已经足够,并且在企业工作负载上优于更复杂的架构(参见 arXiv:2604.00073、arXiv:2604.13107)。
- 在代理基准测试中,harness的选择对结果的影响大于模型本身的选择(参见 arXiv:2605.23950)。
- 将上述发现转化为企业落地的主要障碍是治理问题(参见 arXiv:2605.10223、arXiv:2605.18747)。
本文提出一种能够弥合治理鸿沟的架构。核心思想是让单一的未修改 harness 充当骨干,所有部署共享完全相同的代码,审查工作只需阅读其指令文件即可。第4节给出了四个关键机制:
- 凭证作用域工具:每个后端仅使用一个通用请求工具,并通过作用域凭证进行区分,而不是为每个后端手工编写方法。
- 授权逻辑外置:授权逻辑独立于 harness 本身,使同一 artifact 能以 cron 任务、聊天界面或终端工具的形式运行。
- 注册即副作用:代码推送即触发注册,审计工作简化为对文本文件的审查。
- 基于 microcc 的参考实现:本文提供的参考 harness 基于 microcc 框架,实现了上述机制的完整示例。
通过上述设计,企业可以在保持代码统一性的同时,实现灵活的权限管理和审计流程,从而大幅降低维护成本并提升安全性。
博主点评:harness范式为大型组织提供了一条兼顾可扩展性和治理需求的路径,值得在实际项目中进一步验证和推广。