随着大型语言模型代理的迅速发展,尽管在多个领域、能力、任务难度和交互设置上取得了进展,但整体进展依然分散。我们将这一问题框架化为全场景代理扩展,并提出了AgentOmnia框架,该框架协调任务空间定义、数据合成、后训练、评估和改进,适用于面向消费者(ToC)、面向企业(ToB)和面向员工(ToE)的应用。
AgentOmnia结合了双向环境-任务合成与工具依赖、程序结构和解算器基础的管道,构建了5,018个状态环境、255,375个工具和52,361个任务。程序、解算器和验证器提供正确性信号,而监督微调、在线代理强化学习和回滚课程则支持后训练。评估失败转化为产品需求文档(PRDs),以便进行针对性的自我演化。
从Qwen3-30B-A3B-Thinking-2507开始,AgentOmnia将OmniaBench挑战子集的通过率从9.16%提高至37.11%,在OmniaBench、$\tau^2$-Bench、DeepPlanning和VitaBench的宏平均值从22.86%提升至41.69%。在统一协议下,它在评估的代理后训练基线中领先于OmniaBench,并保持最高的四基准宏平均。它在所有四个基准上均超过Qwen3-235B-A3B-Thinking-2507,并在宏平均上超越Qwen3.5-35B-A3B。
这些提升覆盖了三个应用分支、十个能力维度、八个原子难度因素以及90个一级领域中的76个,表明了广泛的改进而非特定类别的提升。一轮研究提供了PRD引导的自我演化的初步证据,激励在更大规模和工业环境中进行验证。
博主点评: AgentOmnia展示了如何通过系统化的方法提升大型语言模型的能力,尤其是在多任务、多领域的应用场景中,其创新的框架使得模型的自我演化成为可能,未来在工业界的应用前景广阔。