现代 AI 智能体在大规模基础模型进步的推动下,有望通过增强我们的知识和能力来提升生产力并改变生活。为实现这一愿景,AI 智能体必须能够有效规划、执行多步推理与行动、应对新颖观察,并从错误中恢复,从而在广泛场景中成功完成复杂任务。
本文介绍了 Magentic-One,一个高性能的开源智能体系统,用于解决此类任务。Magentic-One 采用多智能体架构,其中有一个主导智能体——编排者(Orchestrator),负责规划、跟踪进度,并通过重新规划来从错误中恢复。在任务执行过程中,编排者会指导其他专业智能体按需执行任务,例如操作网页浏览器、导航本地文件,或编写并执行 Python 代码。
研究团队在三个多样化且具有挑战性的智能体基准测试上展示了 Magentic-One 的性能:GAIA、AssistantBench 和 WebArena。在这些基准上,Magentic-One 取得了与现有最优方法统计上相当的性能,且在无需修改核心智能体能力或协作方式的情况下达成,展示出向通用智能体系统迈进的进展。
此外,Magentic-One 的模块化设计允许在不进行额外提示调优或训练的情况下向团队添加或移除智能体,简化了开发流程,并可扩展到未来场景。论文还提供了 AutoGenBench——一个独立的智能体评估工具,具备重复性和隔离性的内置控制,能够以严谨且可控的方式运行智能体基准测试(这一点在智能体行为可能产生副作用时尤为重要)。