Large Language Model Agent: A Survey on Methodology, Applications and Challenges
Large Language Model Agent: A Survey on Methodology, Applications and Challenges
发表时间: 2025-03 · arXiv:2503.21460 (PKU)
原文: https://arxiv.org/abs/2503.21460
Junyu Luo, Weizhi Zhang, Ye Yuan, Yusheng Zhao, Junwei Yang, Yiyang Gu, Bohan Wu, Binqi Chen, Ziyue Qiao, Qingqing Long, Rongcheng Tu, Xiao Luo, Wei Ju, Zhiping Xiao, Yifan Wang, Meng Xiao, Chenwu Liu, Jingyang Yuan, Shichang Zhang, Yiqiao Jin, Fan Zhang, Xian Wu, Hanqing Zhao, Dacheng Tao, Fellow, IEEE, Philip S. Yu, Fellow, IEEE and Ming Zhang
A1 主要贡献
人工智能正随着大型语言模型(LLM)代理的出现进入一个关键时代。这些由LLM驱动的智能实体能够感知环境、为目标进行推理并执行行动,与仅响应用户输入的传统AI系统不同,它们能主动与环境互动。这种转变代表了技术的进步,也是对人机关系的根本性重塑。与传统代理系统相比,基于LLM的代理在知识来源、泛化能力和交互方式上实现了跨代飞跃。这一进步源于LLM前所未有的推理能力、工具操控与环境交互的进步,以及支持长期经验积累的复杂记忆架构的融合。
本研究通过一个统一的分类法,对代理系统进行了新颖的审视,该分类法将代理的构建、协作机制和演化路径联系起来。本文旨在提供一个全面的视角,追溯代理如何被定义、如何独立或集体运作,以及如何随时间演化。
核心研究框架:图1展示了理解LLM代理生态系统的组织框架。其核心是以方法论为中心的方法,通过三个相互关联的维度来审视代理系统的技术基础:构建(如何定义和建造代理)、协作(它们如何互动和协同工作)和演化(它们如何学习和改进)。这一基础辅以实际考量,包括评估方法、开发工具、与安全和伦理相关的现实挑战,以及多样化的应用领域。
图1: LLM代理生态系统概览,分为四个相互关联的维度:❶ 代理方法论,涵盖构建、协作和演化的基础方面;❷ 评估与工具,介绍基准、评估框架和开发工具;❸ 现实世界问题,解决围绕安全、隐私和社会影响的关键问题;❹ 应用,突出LLM代理正在部署的各种领域。我们提供了一个结构化框架,用于理解现代基于LLM的代理系统的完整生命周期。
与以往综述的区别:尽管近年来有几篇综述探讨了AI代理的各个方面,但本研究通过其方法论的重点和对LLM代理架构的全面分析做出了独特的贡献。以往的综述主要集中在特定应用、部署环境、多模态或安全性上,而其他综述则提供了宽泛的概述,但没有详细的方法论分类。与这些工作相比,本综述的突出之处在于:
1. 以方法论为中心的分类法:我们提出了一个系统的分类法,将LLM代理系统解构为其基本的方法论组成部分,包括角色定义、记忆机制、规划能力和行动执行【21, Y. Ma, Z. Song, Y. Zhuang, J. Hao, and I. King, “A survey on vision-language-action models for embodied ai,” arXiv preprint arXiv:2405.14093, 2024】。
2. 构建-协作-演化框架:我们分析了LLM代理的三个相互关联的维度——构建、协作和演化——提供了比以往方法更全面的理解【22, T. Guo, X. Chen, Y. Wang, R. Chang, S. Pei, N. V. Chawla, O. Wiest, and X. Zhang, “Large language model based multiagents: A survey of progress and challenges,” arXiv preprint arXiv:2402.01680, 2024】、【23, T. Masterman, S. Besen, M. Sawtell, and A. Chao, “The landscape of emerging ai agent architectures for reasoning, planning, and tool calling: A survey,” arXiv preprint arXiv:2404.11584, 2024】。这种集成的架构视角强调了单个LLM代理设计与协作系统之间的连续性。
3. 前沿应用和现实世界关注:除了理论概念,我们的工作还审视了LLM代理的前沿工具、通信协议和多样化应用。我们对紧迫的现实世界挑战(包括安全、隐私和伦理)进行了全面分析。
本综述为研究人员和从业者提供了一个更结构化的分类法,以便从不同角度理解、比较和推进LLM代理的研究。
A2 方法细节
本节通过三个相互关联的维度——构建、协作和演化——提出了一个理解基于LLM的代理系统的全面框架。如图2所示,我们首先探讨代理构建(2.1节),它确立了包括配置文件定义、记忆机制、规划能力和行动执行在内的基础组件。然后,我们探索协作范式(2.2节),这些范式通过中心化控制、去中心化合作或混合架构使多个代理能够协同工作。最后,我们研究演化机制(2.3节),这些机制允许代理通过自主优化、多代理共同演化和外部资源整合来随时间改进。这个三维框架为系统地分析LLM代理系统的整个生命周期提供了一种方法。
图2: 大型语言模型代理方法论的分类法。
2.1 代理构建
代理构建是开发基于LLM的自主系统的基础阶段,包括系统地设计实现目标导向行为的核心组件。这个过程优先考虑四个相互依赖的支柱:配置文件定义(2.1.1)、记忆机制(2.1.2)、规划能力(2.1.3)和行动执行(2.1.4)。这些组件共同形成一个递归优化循环,其中记忆为规划提供信息,执行结果更新记忆,上下文反馈完善代理配置文件。构建范式强调模块化的互操作性,同时保持系统范围的连贯性,为后续的协作和演化适应机制提供支持,这些将在后续章节中讨论。
2.1.1 配置文件定义
配置文件定义的作用。配置文件定义通过配置代理的内在属性和行为模式来确立其操作身份【25, G. Li, H. A. A. K. Hammoud, H. Itani, D. Khizbullin, and B. Ghanem, “Camel: Communicative agents for ”mind” exploration of large language model society,” 2023, NeurIPS】、【26, Q. Wu, G. Bansal, J. Zhang, Y. Wu, B. Li, E. Zhu, L. Jiang, X. Zhang, S. Zhang, J. Liu, A. H. Awadallah, R. W. White, D. Burger, and C. Wang, “Autogen: Enabling next-gen llm applications via multiagent conversation,” 2023】。当前的方法论包括两种方法:人工策划的静态配置文件通过手动规范确保领域特定的一致性,而批量生成的动态配置文件则自适应地调整操作参数,以随机产生一批代理初始化。这些机制共同管理代理的决策边界和交互协议,同时保持与预定义目标的一致性。
人工策划的静态配置文件。这种方法通过领域专家的手动规范来建立固定的代理配置文件,嵌入明确的规则和领域特定知识。它确保严格遵守预定义的行为准则和任务要求,从而实现代理之间的标准化通信协议。这在要求高可解释性和法规遵从性的场景中特别有效。此类框架通常采用预定义代理组件之间的协调交互,通过结构化的通信模式实现复杂功能。代表性的实现展示了两种关键范式:像Camel【25, Camel: Communicative agents for ”mind” exploration of large language model society, 2023, NeurIPS】、AutoGen【26, Autogen: Enabling next-gen llm applications via multiagent conversation, 2023】和OpenAgents【40, T. Xie, F. Zhou, Z. Cheng, P. Shi, L. Weng, Y. Liu, T. J. Hua, J. Zhao, Q. Liu, C. Liu et al., “Openagents: An open platform for language agents in the wild,” arXiv preprint arXiv:2310.10634, 2023】等系统通过预定义的对话角色(如用户代理和助手)来协调人-代理协作,通过结构化对话执行任务。同时,像MetaGPT【27, S. Hong, X. Zheng, J. Chen, Y. Cheng, J. Wang, C. Zhang, Z. Wang, S. K. S. Yau, Z. Lin, L. Zhou et al., “Metagpt: Meta programming for a multi-agent collaborative framework,” 2024, ICLR】、ChatDev【28, C. Qian, W. Liu, H. Liu, N. Chen, Y. Dang, J. Li, C. Yang, W. Chen, Y. Su, X. Cong et al., “Chatdev: Communicative agents for software development,” 2024, ACL】和AFlow【29, J. Zhang, J. Xiang, Z. Yu, F. Teng, X.-H. Chen, J. Chen, M. Zhuge, X. Cheng, S. Hong, J. Wang, B. Liu, Y. Luo, and C. Wu, “AFlow: Automating agentic workflow generation,” 2025, ICLR】等框架展示了基于角色的协调模式。ChatDev专注于代码开发,通过协调静态技术角色(如产品经理和程序员)与确定性交互协议,而MetaGPT和AFlow则通过结构化的角色编排将此范式扩展到通用任务解决。
批量生成的动态配置文件。这种范式采用参数化初始化来系统地生成多样的代理配置文件,以模拟人类社会行为。通过在代理创建过程中对人格特质、知识背景或价值体系注入受控的变异(例如,通过基于模板的提示或潜在空间采样),该框架产生能够展现复杂社会动态的异构群体。这种由参数驱动的多样性对于在从社会行为研究到涌现群体智能模拟等应用中模拟现实的人-代理交互至关重要。这在人类行为模拟系统【30, J. S. Park, J. O’Brien, C. J. Cai, M. R. Morris, P. Liang, and M. S. Bernstein, “Generative agents: Interactive simulacra of human behavior,” 2023, UIST】和模拟用户数据收集【31, L. Wang, J. Zhang, H. Yang, Z.-Y. Chen, J. Tang, Z. Zhang, X. Chen, Y. Lin, H. Sun, R. Song et al., “User behavior simulation with large language model-based agents,” ACM Transactions on Information Systems, vol. 43, no. 2, pp. 1–37, 2025】中得到了证明,其中不同的配置文件配置直接塑造了集体交互模式。此外,DSPy【32, O. Khattab, A. Singhvi, P. Maheshwari, Z. Zhang, K. Santhanam, S. Vardhamanan, S. Haq, A. Sharma, T. T. Joshi, H. Moazam, H. Miller, M. Zaharia, and C. Potts, “Dspy: Compiling declarative language model calls into self-improving pipelines,” 2024, ICLR】可以进一步优化代理配置文件初始化的参数。
2.1.2 记忆机制
记忆机制的功能。记忆机制赋予代理跨时间维度存储、组织和检索信息的能力。短期记忆维护用于即时任务执行的瞬时上下文数据,而长期记忆则保存用于持久参考的结构化经验知识。整合知识检索机制进一步通过检索增强生成(RAG)技术【43, P. Lewis, E. Perez, A. Piktus, F. Petroni, V. Karpukhin, N. Goyal, H. Kuttler, M. Lewis, W.-t. Yih, T. Rockt ¨ aschel ¨ et al., “Retrievalaugmented generation for knowledge-intensive nlp tasks,” NeurIPS, vol. 33, pp. 9459–9474, 2020】优化了信息的可访问性。
短期记忆。短期记忆保留代理内部的对话历史和环境反馈,以支持上下文敏感的任务执行。该机制广泛应用于ReAct【33, S. Yao, J. Zhao, D. Yu, N. Du, I. Shafran, K. Narasimhan, and Y. Cao, “React: Synergizing reasoning and acting in language models,” 2023, ICLR】(用于带反思的思考)、ChatDev【28, Chatdev: Communicative agents for software development, 2024, ACL】(用于软件开发)、Graph of Thoughts【34, M. Besta, N. Blach, A. Kubicek, R. Gerstenberger, M. Podstawski, L. Gianinazzi, J. Gajda, T. Lehmann, H. Niewiadomski, P. Nyczyk et al., “Graph of thoughts: Solving elaborate problems with large language models,” 2024, AAAI】(用于解决复杂问题)和AFlow【29, AFlow: Automating agentic workflow generation, 2025, ICLR】(用于工作流自动化)等框架中,展示了其跨领域的多功能性。虽然该机制通过交互式交流实现了详细的推理,但其瞬时性限制了知识在即时上下文之外的保留——中间推理轨迹在任务完成后通常会消失,无法直接转移到新场景。此外,由于LLM的上下文窗口限制,实际实现需要主动的信息压缩(例如,摘要或选择性保留),并对多轮交互深度施加许多约束以防止性能下降。
长期记忆。长期记忆系统地存档代理的中间推理轨迹,并将其合成为可重用的工具以供未来调用。这个过程通过三种主流范式将短暂的认知努力转化为持久的操作资产:❶ 技能库,用于编码程序性知识(例如,Voyager在Minecraft中的自动技能发现【35, G. Wang, Y. Xie, Y. Jiang, A. Mandlekar, C. Xiao, Y. Zhu, L. Fan, and A. Anandkumar, “Voyager: An open-ended embodied agent with large language models,” 2023, TMLR】和GITM的基于文本的知识库【36, X. Zhu, Y. Chen, H. Tian, C. Tao, W. Su, C. Yang, G. Huang, B. Li, L. Lu, X. Wang et al., “Ghost in the minecraft: Generally capable agents for open-world environments via large language models with text-based knowledge and memory,” arXiv preprint arXiv:2305.17144, 2023】),❷ 经验库,用于存储成功/失败模式(例如,ExpeL的提炼经验池【37, A. Zhao, D. Huang, Q. Xu, M. Lin, Y.-J. Liu, and G. Huang, “Expel: Llm agents are experiential learners,” 2024, AAAI】和Reflexion的试验优化记忆【38, N. Shinn, F. Cassano, A. Gopinath, K. Narasimhan, and S. Yao, “Reflexion: Language agents with verbal reinforcement learning,” NeurIPS, vol. 36, pp. 8634–8652, 2023】),以及 ❸ 工具合成框架,通过组合适应来演化能力(例如,TPTU的自适应工具组合【39, J. Ruan, Y. Chen, B. Zhang, Z. Xu, T. Bao, H. Mao, Z. Li, X. Zeng, R. Zhao et al., “Tptu: Task planning and tool usage of large language model-based ai agents,” 2023, NeurIPS】和OpenAgents的自我扩展工具包【40, Openagents: An open platform for language agents in the wild, 2023, arXiv】)。跨领域实现,如Lego-Prover的定理库【41, H. Wang, H. Xin, C. Zheng, Z. Liu, Q. Cao, Y. Huang, J. Xiong, H. Shi, E. Xie, J. Yin et al., “Lego-prover: Neural theorem proving with growing libraries,” 2024, ICLR】和MemGPT的分层记忆架构【42, C. Packer, V. Fang, S. G. Patil, K. Lin, S. Wooders, and J. E. Gonzalez, “Memgpt: Towards llms as operating systems,” 2023, CoRR】,进一步展示了结构化长期存储如何通过战略性知识重用提高推理效率。
作为记忆的知识检索。此范式通过将外部知识库整合到生成过程中,不同于代理内部记忆的生成,从而有效地扩展了代理可访问的信息边界。当前的实现展现了三种主要方法:❶ 通过文本语料库(RAG【43, Retrievalaugmented generation for knowledge-intensive nlp tasks, 2020, NeurIPS】)或结构化知识图(GraphRAG【44, D. Edge, H. Trinh, N. Cheng, J. Bradley, A. Chao, A. Mody, S. Truitt, D. Metropolitansky, R. O. Ness, and J. Larson, “From local to global: A graph rag approach to query-focused summarization,” arXiv preprint arXiv:2404.16130, 2024】)进行静态知识基础构建,❷ 交互式检索,将代理对话与外部查询相结合,如Chain of Agents【45, Y. Zhang, R. Sun, Y. Chen, T. Pfister, R. Zhang, and S. Arik, “Chain of agents: Large language models collaborating on long-context tasks,” Advances in Neural Information Processing Systems, vol. 37】中所示,其中短期的代理间通信触发了上下文相关的知识获取,以及❸ 推理集成检索,以IRCoT【46, H. Trivedi, N. Balasubramanian, T. Khot, and A. Sabharwal, “Interleaving retrieval with chain-of-thought reasoning for knowledgeintensive multi-step questions,” arXiv preprint arXiv:2212.10509, 2022】和Llatrieval【47, X. Li, C. Zhu, L. Li, Z. Yin, T. Sun, and X. Qiu, “Llatrieval: Llmverified retrieval for verifiable generation,” 2024, NAACL】为例,它们将逐步推理与动态知识获取交织在一起。高级变体如KG-RAR【48, W. Wu, Y. Jing, Y. Wang, W. Hu, and D. Tao, “Graph-augmented reasoning: Evolving step-by-step knowledge graph retrieval for llm reasoning,” 2025】在推理过程中进一步构建特定任务的子图,而DeepRAG【49, X. Guan, J. Zeng, F. Meng, C. Xin, Y. Lu, H. Lin, X. Han, L. Sun, and J. Zhou, “Deeprag: Thinking to retrieval step by step for large language models,” arXiv preprint arXiv:2502.01142, 2025】引入了微调的检索决策模块,以平衡参数化知识和外部证据。这些混合架构使代理能够超越训练数据的限制,同时保持上下文相关性,将知识检索确立为可扩展记忆系统的关键基础设施。
2.1.3 规划能力
规划能力的重要性。规划能力是LLM代理能力的一个关键方面,使其能够以高精度在复杂任务和问题解决场景中导航【103, X. Huang, W. Liu, X. Chen, X. Wang, H. Wang, D. Lian, Y. Wang, R. Tang, and E. Chen, “Understanding the planning of llm agents: A survey,” arXiv preprint arXiv:2402.02716, 2024】。有效的规划对于在现实世界应用中部署LLM代理至关重要,在这些应用中,它们必须处理各种复杂的任务和场景。LLM代理的规划能力可以从两个角度来看:任务分解和反馈驱动的迭代。
任务分解策略。任务分解是通过将复杂问题分解为更易于管理的子任务来增强LLM规划能力的基本方法。尽管解决整个问题对LLM代理来说可能具有挑战性,但它们可以更容易地处理子任务,然后整合结果来解决整个问题。任务分解策略分为两大类:单路径链接和多路径树扩展。
单路径链接策略。单路径链接是一种简单的方法,其最简单的版本是零样本思维链【104, T. Kojima, S. S. Gu, M. Reid, Y. Matsuo, and Y. Iwasawa, “Large language models are zero-shot reasoners,” NeurIPS, vol. 35, pp.】、【105, J. Wei, X. Wang, D. Schuurmans, M. Bosma, F. Xia, E. Chi, Q. V. Le, D. Zhou et al., “Chain-of-thought prompting elicits reasoning in large language models,” NeurIPS, vol. 35, pp. 24 824–24 837, 2022】。它首先要求代理制定一个计划,该计划由一系列相互依赖的子任务组成。随后,要求代理按顺序解决这些子任务【50, L. Wang, W. Xu, Y. Lan, Z. Hu, Y. Lan, R. K.-W. Lee, and E.- P. Lim, “Plan-and-solve prompting: Improving zero-shot chainof-thought reasoning by large language models,” arXiv preprint arXiv:2305.04091, 2023】、【105, Chain-of-thought prompting elicits reasoning in large language models, 2022, NeurIPS】。这种“规划-解决”范式【51, E. H. Durfee, “Distributed problem solving and planning,” in ECCAI Advanced Course on Artificial Intelligence. Springer, 2001, pp. 118–149】直接且易于实现。然而,它可能缺乏灵活性,并且在链接过程中会累积错误,因为代理需要在问题解决过程中严格遵循预定义的计划。因此,一个研究方向提出采用动态规划,仅根据代理的当前情况生成下一个子任务【33, React: Synergizing reasoning and acting in language models, 2023, ICLR】、【105, Chain-of-thought prompting elicits reasoning in large language models, 2022, NeurIPS】。这使代理能够接收环境反馈并相应地调整其计划,从而增强其鲁棒性和适应性。此外,另一个研究方向提出使用多个思维链来提高规划过程的鲁棒性。这类似于集成方法,涉及自洽性【62, G. Wan, Y. Wu, J. Chen, and S. Li, “Dynamic self-consistency: Leveraging reasoning paths for efficient llm sampling,” arXiv preprint arXiv:2408.17017, 2024】、【106, X. Wang, J. Wei, D. Schuurmans, Q. Le, E. Chi, S. Narang, A. Chowdhery, and D. Zhou, “Self-consistency improves chain of thought reasoning in language models,” arXiv preprint arXiv:2203.11171, 2022】、多数投票【107, W. Li and W. Pan, “Enhancing chain-of-thought reasoning in large language models through text style diversity and prompt fusion,” in EIBDCT, vol. 13181. SPIE, 2024, pp. 226–232】和代理讨论【52, M. Tao, D. Zhao, and Y. Feng, “Chain-of-discussion: A multimodel framework for complex evidence-based question answering,” arXiv preprint arXiv:2402.16313, 2024】来组合多个链。通过结合多个链的智慧,代理可以做出更准确的决策,并减少错误累积的风险。
多路径树扩展策略。一种更复杂的方法是使用树而不是链作为规划数据结构,其中代理在规划时存在多个可能的推理路径,并且允许代理根据反馈信息进行回溯【53, M. Hu, Y. Mu, X. Yu, M. Ding, S. Wu, W. Shao, Q. Chen, B. Wang, Y. Qiao, and P. Luo, “Tree-planner: Efficient closeloop task planning with large language models,” arXiv preprint arXiv:2310.08582, 2023】、【54, J.-W. Choi, H. Kim, H. Ong, Y. Yoon, M. Jang, J. Kim et al., “Reactree: Hierarchical task planning with dynamic tree expansion using llm agent nodes,” 2025】。Long等人【55, J. Long, “Large language model guided tree-of-thought,” arXiv preprint arXiv:2305.08291, 2023】提出了一种思维树(ToT)方法,通过树状的思维过程探索解决方案空间。这使得LLM能够回溯到先前的状态,从而可以纠正其先前的错误,使其能够应用于涉及“试错-纠正”过程的各种复杂任务。在更现实的场景中,代理可以从环境或人类那里收集反馈,并动态调整其推理路径,可能会结合强化学习【56, D. Zhang, S. Zhoubian, Z. Hu, Y. Yue, Y. Dong, and J. Tang, “Restmcts*: Llm self-training via process reward guided tree search,” NeurIPS, vol. 37, pp. 64 735–64 772, 2024】、【108, J. Jiang, Z. Chen, Y. Min, J. Chen, X. Cheng, J. Wang, Y. Tang, H. Sun, J. Deng, W. X. Zhao et al., “Technical report: Enhancing llm reasoning with reward-guided tree search,” arXiv preprint arXiv:2411.11694, 2024】。这使代理能够在现实世界应用中使用先进算法(如蒙特卡洛树搜索【109, C. B. Browne, E. Powley, D. Whitehouse, S. M. Lucas, P. I. Cowling, P. Rohlfshagen, S. Tavener, D. Perez, S. Samothrakis, and S. Colton, “A survey of monte carlo tree search methods,” IEEE Transactions on Computational Intelligence and AI in games, vol. 4, no. 1, pp. 1–43, 2012】)做出更明智的决策,促进了在机器人技术【57, A. Lykov, M. Dronova, N. Naglov, M. Litvinov, S. Satsevich, A. Bazhenov, V. Berman, A. Shcherbak, and D. Tsetserukou, “Llmmars: Large language model for behavior tree generation and nlpenhanced dialogue in multi-agent robot systems,” arXiv preprint arXiv:2312.09348, 2023】–【59, C. Rivera, G. Byrd, W. Paul, T. Feldman, M. Booker, E. Holmes, D. Handelman, B. Kemp, A. Badger, A. Schmidt et al., “Conceptagent: Llm-driven precondition grounding and tree search for robust task planning and execution,” arXiv preprint arXiv:2410.06108, 2024】和游戏【110, H. Guo, Z. Liu, Y. Zhang, and Z. Wang, “Can large language models play games? a case study of a self-play approach,” arXiv preprint arXiv:2403.05632, 2024】、【111, Y. Liu, P. Sun, and H. Li, “Large language models as agents in two-player games,” arXiv preprint arXiv:2402.08078, 2024】中的应用。
反馈驱动的迭代。反馈驱动的迭代是LLM规划能力的一个关键方面,它使代理能够从反馈中学习并随着时间的推移提高其性能。反馈可以来自多种来源,例如环境输入、人类指导、模型内省和多代理协作。
反馈的来源与应用。环境反馈是机器人技术中最常见的反馈类型之一【60, V. Bhat, A. U. Kaypak, P. Krishnamurthy, R. Karri, and F. Khorrami, “Grounding llms for robot task planning using closed-loop state feedback,” arXiv preprint arXiv:2402.08546, 2024】,由具身代理操作的环境生成。人类反馈是另一种关键类型,来自用户交互或预先准备的手动标记数据【61, H. Li, H. Jiang, T. Zhang, Z. Yu, A. Yin, H. Cheng, S. Fu, Y. Zhang, and W. He, “Traineragent: Customizable and efficient model training through llm-powered multi-agent system,” arXiv preprint arXiv:2311.06622, 2023】、【112, A. R. Laleh and M. N. Ahmadabadi, “A survey on enhancing reinforcement learning in complex environments: Insights from human and llm feedback,” arXiv preprint arXiv:2411.13410, 2024】。模型内省提供了另一种反馈来源,由代理自身生成【62, Dynamic self-consistency: Leveraging reasoning paths for efficient llm sampling, 2024, arXiv】。多代理协作也作为一种反馈机制,多个代理共同解决问题并交换见解【63, S. Seo, J. Lee, S. Noh, and H. Kang, “Llm-based cooperative agents using information relevance and plan validation,” arXiv preprint arXiv:2405.16751, 2024】、【112, A survey on enhancing reinforcement learning in complex environments: Insights from human and llm feedback, 2024, arXiv】。这些反馈来源有助于评估代理的性能,从而指导其规划。例如,代理可以使用反馈来更新(重新生成)其计划,调整其推理路径,甚至修改其目标。这个迭代过程持续进行,直到达到满意的计划【64, H. Sun, Y. Zhuang, L. Kong, B. Dai, and C. Zhang, “Adaplanner: Adaptive planning from feedback with language models,” NeurIPS, vol. 36, pp. 58 202–58 245, 2023】、【65, M. Jafaripour, S. Golestan, S. Miwa, Y. Mitsuka, and O. Zaiane, “Adaptive iterative feedback prompting for obstacle-aware path planning via llms,” in AAAI Workshop, 2025】。
表1: 代理协作方法总结。
2.1.4 行动执行
行动执行的重要性。有了规划能力,LLM能够执行计划好的行动在现实世界中变得至关重要。如果代理不能有效地执行计划,好的计划也是无用的。行动执行涉及两个方面:工具利用【113, Z. Shen, “Llm with tools: A survey,” arXiv preprint arXiv:2409.18807, 2024】和物理交互【114, C. Y. Kim, C. P. Lee, and B. Mutlu, “Understanding large-language model (llm)-powered human-robot interaction,” in HRI, 2024, pp. 371–380】。
工具利用。工具利用【113, Llm with tools: A survey, 2024, arXiv】是LLM行动执行的一个重要方面,它使代理具备了广泛的能力,如精确的数字计算、最新的信息理解和熟练的代码生成。工具使用能力涉及两个方面:工具使用决策和工具选择。工具使用决策是决定是否使用工具来解决问题的过程。当代理生成内容时信心不足或面临与特定工具功能相关的问题时,代理应决定使用特定工具【66, S. Qiao, H. Gui, C. Lv, Q. Jia, H. Chen, and N. Zhang, “Making language models better tool learners with execution feedback,” arXiv preprint arXiv:2305.13068, 2023】、【67, R. Yang, L. Song, Y. Li, S. Zhao, Y. Ge, X. Li, and Y. Shan, “Gpt4tools: Teaching large language model to use tools via selfinstruction,” NeurIPS, vol. 36, pp. 71 995–72 007, 2023】。工具选择是工具利用的另一个重要方面,涉及对工具和代理当前情况的理解【68, S. Yuan, K. Song, J. Chen, X. Tan, Y. Shen, R. Kan, D. Li, and D. Yang, “Easytool: Enhancing llm-based agents with concise tool】、【69, S. Wu, S. Zhao, Q. Huang, K. Huang, M. Yasunaga, K. Cao, V. Ioannidis, K. Subbian, J. Leskovec, and J. Y. Zou, “Avatar: Optimizing llm agents for tool usage via contrastive reasoning,” NeurIPS, vol. 37, pp. 25 981–26 010, 2025】。例如,Yuan等人【68, Easytool: Enhancing llm-based agents with concise tool】提出简化工具文档以更好地理解可用工具,从而实现更准确的工具选择。
物理交互。物理交互【114, Understanding large-language model (llm)-powered human-robot interaction, 2024, HRI】是具身LLM代理的一个基本方面。它们在现实世界中执行特定行动并解释环境反馈的能力至关重要。当部署在现实世界环境中时,LLM代理必须理解各种因素以准确执行行动。这些因素包括机器人硬件【114, Understanding large-language model (llm)-powered human-robot interaction, 2024, HRI】、社会知识【70, Y. Huang, J. Sansom, Z. Ma, F. Gervits, and J. Chai, “Drivlme: Enhancing llm-based autonomous driving agents with embodied and social experiences,” in IROS. IEEE, 2024, pp. 3153–3160】以及与其他LLM代理的交互【71, Y. Zhang, S. Yang, C. Bai, F. Wu, X. Li, Z. Wang, and X. Li, “Towards efficient llm grounding for embodied multi-agent collaboration,” arXiv preprint arXiv:2405.14314, 2024】、【72, B. Colle, “Improving embodied llm agents capabilities through collaboration,” 2024】。
2.2 代理协作
代理协作的重要性。LLM代理之间的协作在将其问题解决能力扩展到个体推理之外方面起着至关重要的作用。有效的协作使代理能够利用分布式智能、协调行动,并通过多代理交互来完善决策【26, Autogen: Enabling next-gen llm applications via multiagent conversation, 2023】、【121, L. Ying, T. Zhi-Xuan, V. Mansinghka, and J. B. Tenenbaum, “Inferring the goals of communicating agents from actions and instructions,” in Proceedings of the AAAI Symposium Series, vol. 2, no. 1, 2023, pp. 26–33】。我们将现有的协作范式分为三种基本架构:中心化控制、去中心化合作和混合架构。这些范式在决策层次、通信拓扑和任务分配机制上有所不同,每种范式都为特定的应用场景提供了独特的优势。
2.2.1 中心化控制
中心化控制架构。中心化控制架构采用一种分层协调机制,其中一个中心控制器通过任务分配和决策整合来组织代理活动,而其他子代理只能与控制器通信。该范式具有两种实现策略:显式控制器系统利用专门的协调模块(通常实现为独立的LLM代理)来分解任务和分配子目标,而基于分化的系统通过使用提示来引导元代理承担不同的子角色来实现中心化控制。中心化方法在需要严格协调的关键任务场景中表现出色,例如工业自动化【122, J. Vyas and M. Mercangoz, “Autonomous industrial control using ¨ an agentic framework with large language models,” arXiv preprint arXiv:2411.05904, 2024】和科学研究【73, D. A. Boiko, R. MacKnight, B. Kline, and G. Gomes, “Autonomous chemical research with large language models,” Nature, vol. 624, no. 7992, pp. 570–578, 2023】。
显式控制器系统。多个相关工作已被开发出来以明确实现中心化架构。Coscientist【73, Autonomous chemical research with large language models, 2023, Nature】是显式控制器范式的典范,其中人类操作员充当中心控制器。它建立了标准化的科学实验工作流程,将专门的代理和工具分配到不同的实验阶段,并对最终的执行计划保持直接控制。LLM-Blender【74, H. Jiang, Q. Wu, C.-Y. Lin, Y. Yang, and L. Qiu, “Llmlingua: Compressing prompts for accelerated inference of large language models,” in EMNLP, 2023, pp. 13 358–13 376】明确创建了一个控制器,该控制器使用交叉注意力编码器进行成对比较以识别最佳响应,然后融合排名靠前的响应,增强其优势同时减轻其弱点。MetaGPT【27, Metagpt: Meta programming for a multi-agent collaborative framework, 2024, ICLR】模拟了真实世界的软件开发工作流程,直接指派专门的管理者来控制不同的功能角色和阶段。
基于分化的系统。AutoAct【75, S. Qiao, N. Zhang, R. Fang, Y. Luo, W. Zhou, Y. E. Jiang, C. Lv, and H. Chen, “Autoact: Automatic agent learning from scratch for qa via self-planning,” arXiv preprint arXiv:2401.05268, 2024】是基于分化范式的典范,它将元代理隐式地分化为三个子代理——计划代理、工具代理和反思代理——以分解复杂的ScienceQA任务。Meta-Prompting【76, M. Suzgun and A. T. Kalai, “Meta-prompting: Enhancing language models with task-agnostic scaffolding,” arXiv preprint arXiv:2401.12954, 2024】通过精心设计的元提示将复杂任务分解为领域特定的子任务。单个模型充当协调员,动态地将子任务分配给由面向任务的提示引导的专门子代理。然后,中心管理者整合所有中间输出以产生最终解决方案。这些工作主要采用能力强的代理作为中心控制器来优化任务分配和决策聚合。然而,WJudge【77, A. Khan, J. Hughes, D. Valentine, L. Ruis, K. Sachan, A. Radhakrishnan, E. Grefenstette, S. R. Bowman, T. Rocktaschel, and ¨ E. Perez, “Debating with more persuasive llms leads to more truthful answers,” arXiv preprint arXiv:2402.06782, 2024】证明,即使是判别能力有限的控制器也能显著增强代理系统的整体性能。
2.2.2 去中心化协作
去中心化协作架构。与中心化架构中单个控制节点因处理所有代理间通信、任务调度和冲突解决而常成为瓶颈不同,去中心化协作通过自组织协议实现直接的节点到节点交互。该范式可进一步分为两种不同的方法:基于修订的系统和基于通信的系统。
基于修订的系统。在这种范式中,代理只观察由同行生成的最终决策,并通过结构化的编辑协议迭代地完善共享的输出。这种方法通常产生更标准化和确定性的结果。例如,MedAgents【78, X. Tang, A. Zou, Z. Zhang, Z. Li, Y. Zhao, X. Zhang, A. Cohan, and M. Gerstein, “Medagents: Large language models as collaborators for zero-shot medical reasoning,” arXiv preprint arXiv:2311.10537, 2023】采用预定义的领域特定专家代理,它们独立地顺序提出和修改决策,通过最终投票达成共识。ReConcile【79, J. C.-Y. Chen, S. Saha, and M. Bansal, “Reconcile: Round-table conference improves reasoning via consensus among diverse llms,” arXiv preprint arXiv:2309.13007, 2023】协调代理通过相互响应分析、置信度评估和人工策划的范例来迭代地完善答案。METAL【115, B. Li, Y. Wang, J. Gu, K.-W. Chang, and N. Peng, “Metal: A multiagent framework for chart generation with test-time scaling,” arXiv preprint arXiv:2502.17651, 2025】为图表生成任务引入了专门的文本和视觉修订代理,展示了领域特定的修订如何提高输出质量。值得注意的是,修订信号不仅可以来自代理交互,还可以来自外部知识库【116, S. Guo, C. Deng, Y. Wen, H. Chen, Y. Chang, and J. Wang, “Ds-agent: Automated data science by empowering large language models with case-based reasoning,” arXiv preprint arXiv:2402.17453, 2024】、【123, D. Dell’Anna, N. Alechina, F. Dalpiaz, M. Dastani, and B. Logan, “Data-driven revision of conditional norms in multi-agent systems,” Journal of Artificial Intelligence Research, vol. 75, pp. 1549–1593, 2022】,从而实现混合修订策略。
基于通信的系统。与基于修订的方法相比,基于通信的方法具有更灵活的组织结构,允许代理直接参与对话并观察同行的推理过程。这使得它们特别适合模拟动态场景,如人类社会互动【30, Generative agents: Interactive simulacra of human behavior, 2023, UIST】。关键实现包括:MAD【80, T. Liang, Z. He, W. Jiao, X. Wang, Y. Wang, R. Wang, Y. Yang, S. Shi, and Z. Tu, “Encouraging divergent thinking in large language models through multi-agent debate,” arXiv preprint arXiv:2305.19118, 2023】采用结构化通信协议来解决“思维退化”问题,即代理过度固执于初始解决方案。MADR【81, K. Kim, S. Lee, K.-H. Huang, H. P. Chan, M. Li, and H. Ji, “Can llms produce faithful explanations for fact-checking? towards faithful explainable fact-checking via multi-agent debate,” arXiv preprint arXiv:2402.07401, 2024】通过使代理能够批判不合理的声明、完善论点并为事实核查生成可验证的解释来增强此功能。MDebate【82, Y. Du, S. Li, A. Torralba, J. B. Tenenbaum, and I. Mordatch, “Improving factuality and reasoning in language models through multiagent debate,” in ICML, 2023】通过在顽固坚持有效观点和协作完善之间进行战略性交替来优化共识建立。AutoGen【26, Autogen: Enabling next-gen llm applications via multiagent conversation, 2023】实现了一个群聊框架,支持多代理参与迭代辩论以进行决策完善。
2.2.3 混合架构
混合架构。混合架构战略性地结合了中心化协调和去中心化协作,以平衡可控性与灵活性,优化资源利用,并适应异构的任务需求。这种方法引入了两种实现模式:具有预定义协调规则的静态系统和具有自优化拓扑的动态系统。
静态系统。静态系统预定义了组合不同协作模式的固定模式。代表性的实现包括:CAMEL【25, Camel: Communicative agents for ”mind” exploration of large language model society, 2023, NeurIPS】将代理划分为组内去中心化的团队进行角色扮演模拟,同时通过中心化治理维持组间协调。AFlow【29, AFlow: Automating agentic workflow generation, 2025, ICLR】采用了一个三层级结构,包括中心化的战略规划、去中心化的战术谈判和市场驱动的运营资源分配。EoT【117, Y. Zhang, Y. Yang, Y. Li, J. Gu, R. Zhu, H. Chen, and K.-W. Chang, “Eot: A new paradigm for multi-agent communication that allows any-to-any agent to communicate with each other. it can improve the capabilities through cross-model communication,” arXiv preprint arXiv:2312.01823, 2023】形式化了四种协作模式(BUS、STAR、TREE、RING),以将网络拓扑与特定任务特征对齐。
动态系统。最近的创新引入了神经拓扑优化器,它们根据实时性能反馈动态地重新配置协作结构,从而实现对变化条件的自动适应。关键的实现展示了这种范式:DiscoGraph【118, Y. Li, S. Ren, P. Wu, S. Chen, C. Feng, and W. Zhang, “Learning distilled collaboration graph for multi-agent perception,” NeurIPS, vol. 34, pp. 29 541–29 552, 2021】通过一个教师-学生框架引入了可训练的姿态感知协作。具有全局视图输入的教师模型通过特征图蒸馏来指导学生模型,而矩阵值的边权重使得代理之间的空间注意力能够自适应调整。DyLAN【119, Z. Liu, Y. Zhang, P. Li, Y. Liu, and D. Yang, “A dynamic llmpowered agent network for task-oriented agent collaboration,” in COLM, 2024】首先利用代理重要性评分来识别贡献最大的代理,然后动态调整协作结构以优化任务完成。MDAgents【120, Y. Kim, C. Park, H. Jeong, Y. S. Chan, X. Xu, D. McDuff, H. Lee, M. Ghassemi, C. Breazeal, H. Park et al., “Mdagents: An adaptive collaboration of llms for medical decision-making,” NeurIPS, vol. 37, pp. 79 410–79 452, 2024】根据手头的任务动态分配协作结构。它首先进行复杂性检查,将任务分为低、中或高复杂性。简单的任务由单个代理处理,而更复杂的任务则通过分层协作来解决。
表2: 代理演化方法总结。
2.3 代理演化
代理演化机制。LLM代理通过各种机制不断演化,这些机制使其能够自主改进、进行多代理交互以及整合外部资源。本节探讨了代理演化的三个关键维度:自主优化与自学习、多代理共同演化以及通过外部资源演化。这些机制共同增强了模型在复杂环境中的适应性、推理能力和性能。我们在表2中总结了这些方法。
2.3.1 自主优化与自学习
自主优化与自学习的定义。自主优化和自学习允许LLM在没有大量监督的情况下提高其能力。这包括自监督学习、自我反思、自我纠正和自我奖励机制,使模型能够动态地探索、适应和完善其输出。
自监督学习与自适应调整。自监督学习使LLM能够使用未标记或内部生成的数据进行改进,从而减少对人工标注的依赖。例如,自演化学习(SE)【86, Q. Zhong, L. Ding, J. Liu, B. Du, and D. Tao, “Self-evolution learning for discriminative language model pretraining,” in ACL Findings, 2023, pp. 4130–4145】通过动态调整词元掩码和学习策略来增强预训练。演化优化技术有助于高效的模型合并和适应,无需大量额外资源即可提高性能【87, T. Akiba, M. Shing, Y. Tang, Q. Sun, and D. Ha, “Evolutionary optimization of model merging recipes,” Nature Machine Intelligence, pp. 1–10, 2025】。DiverseEvol【88, S. Wu, K. Lu, B. Xu, J. Lin, Q. Su, and C. Zhou, “Self-evolved diverse data sampling for efficient instruction tuning,” arXiv preprint arXiv:2311.08182, 2023】通过提高数据多样性和选择效率来改进指令微调。这些进步有助于LLM的自主适应性,使其能够更有效地学习和泛化到各种任务。
自我反思与自我纠正。自我反思和自我纠正使LLM能够通过识别和解决错误来迭代地完善其输出。例如,SELFREFINE【89, A. Madaan, N. Tandon, P. Gupta, S. Hallinan, L. Gao, S. Wiegreffe, U. Alon, N. Dziri, S. Prabhumoye, Y. Yang et al., “Self-refine: Iterative refinement with self-feedback,” NeurIPS, vol. 36, pp. 46 534–46 594, 2023】应用迭代的自反馈来改进生成的响应,而无需外部监督。在推理任务中,STaR【90, E. Zelikman, Y. Wu, J. Mu, and N. D. Goodman, “Star: Self-taught reasoner bootstrapping reasoning with reasoning,” in NeurIPS, vol. 1126, 2024】和V-STaR【91, A. Hosseini, X. Yuan, N. Malkin, A. Courville, A. Sordoni, and R. Agarwal, “V-star: Training verifiers for self-taught reasoners,” in COLM, 2024】训练模型来验证和完善其自身的问题解决过程,从而减少对标记数据的依赖。此外,自验证技术使模型能够回顾性地评估和纠正其输出,从而做出更可靠的决策【92, Y. Weng, M. Zhu, F. Xia, B. Li, S. He, S. Liu, B. Sun, K. Liu, and J. Zhao, “Large language models are better reasoners with】。这些方法共同增强了LLM代理自我反思和自我纠正的能力,减少了幻觉并提高了推理质量。
自我奖励与强化学习。自我奖励和强化学习方法通过生成内部奖励信号来使LLM增强性能。自生成的奖励有助于模型完善决策制定,相关技术确保了稳定和一致的学习改进【93, W. Yuan, R. Y. Pang, K. Cho, X. Li, S. Sukhbaatar, J. Xu, and J. Weston, “Self-rewarding language models,” 2024】。对比蒸馏进一步使模型能够通过自我奖励机制进行自我对齐【94, K. Yang, D. Klein, A. Celikyilmaz, N. Peng, and Y. Tian, “Rlcd: Reinforcement learning from contrastive distillation for lm alignment,” in ICLR, 2024】。此外,RLC【95, J.-C. Pang, P. Wang, K. Li, X.-H. Chen, J. Xu, Z. Zhang, and Y. Yu, “Language model self-improvement by reinforcement learning contemplation,” in ICLR, 2024】利用评估-生成差距,通过强化学习策略促进自我改进。这些方法通过整合自我奖励策略和强化学习范式来增强LLM的适应性。
2.3.2 多代理共同演化
多代理共同演化的定义。多代理共同演化使LLM能够通过与其他代理的互动来改进。这包括合作学习,即代理共享信息和协调行动,以及竞争性共同演化,即代理参与对抗性互动以完善策略和提高性能。
合作与协同学习。多代理协作通过实现知识共享、联合决策和协调解决问题来增强LLM。例如,ProAgent【96, C. Zhang, K. Yang, S. Hu, Z. Wang, G. Li, Y. Sun, C. Zhang, Z. Zhang, A. Liu, S.-C. Zhu et al., “Proagent: building proactive cooperative agents with large language models,” in AAAI, vol. 38, no. 16, 2024, pp. 17 591–17 599】使基于LLM的代理能够在合作任务中通过推断队友的意图和更新信念来动态适应,从而增强零样本协调能力。CORY【97, H. Ma, T. Hu, Z. Pu, L. Boyin, X. Ai, Y. Liang, and M. Chen, “Coevolving with the other you: Fine-tuning llm with sequential cooperative multi-agent reinforcement learning,” NeurIPS, vol. 37, pp. 15 497–15 525, 2024】将RL微调扩展到一个合作的多代理框架中,其中LLM通过角色交换机制迭代改进,增强了策略的最优性和稳定性。CAMEL【25, Camel: Communicative agents for ”mind” exploration of large language model society, 2023, NeurIPS】开发了一个角色扮演框架,其中通信代理使用初始提示自主协作,提高了多代理环境中的协调和任务解决效率。这些方法有助于构建更高效、适应性更强和更智能的多代理LLM系统。
竞争与对抗性共同演化。竞争性共同演化通过对抗性互动、辩论和战略竞争来加强LLM。例如,红队LLM【98, C. Ma, Z. Yang, H. Ci, J. Gao, M. Gao, X. Pan, and Y. Yang, “Evolving diverse red-team language models in multi-round multiagent games,” arXiv preprint arXiv:2310.00322, 2023】在对抗性互动中动态演化,不断挑战LLM以发现漏洞并减轻模式崩溃,从而实现更强大的安全对齐。Du等人提出了一个多代理辩论框架【82, Improving factuality and reasoning in language models through multiagent debate, 2023, ICML】,通过让多个LLM在多轮中相互批判和完善论点来增强推理能力,提高了事实性和减少了幻觉。此外,MAD框架【99, T. Liang, Z. He, W. Jiao, X. Wang, Y. Wang, R. Wang, Y. Yang, S. Shi, and Z. Tu, “Encouraging divergent thinking in large language models through multi-agent debate,” in EMNLP, 2024, pp. 17 889– 17 904】以针锋相对的方式组织代理之间的辩论,鼓励在复杂任务中进行发散性思维并完善逻辑推理。这些竞争性共同演化策略以多代理对抗的方式驱动LLM发展出更强的推理能力、弹性和战略适应性。
图3: LLM代理的评估基准和工具概览。左侧显示了按通用评估、领域特定评估和协作评估分类的各种评估框架。右侧展示了LLM代理使用的工具、代理创建的工具以及部署代理的工具。
2.3.3 通过外部资源演化
外部资源对演化的作用。外部资源通过提供结构化信息和反馈来增强代理的演化。知识增强的演化整合了结构化知识以改进推理和决策,而外部反馈驱动的演化则利用来自工具和环境的实时反馈来完善模型性能。
知识增强的演化。LLM可以通过整合结构化的外部知识来演化,从而改进推理、决策和任务执行。例如,KnowAgent【83, Y. Zhu, S. Qiao, Y. Ou, S. Deng, N. Zhang, S. Lyu, Y. Shen, L. Liang, J. Gu, and H. Chen, “Knowagent: Knowledge-augmented planning for llm-based agents,” arXiv preprint arXiv:2403.03101, 2024】通过整合行动知识来改进基于LLM的规划,约束决策路径并减轻幻觉,从而实现更可靠的任务执行。世界知识模型(WKM)【84, S. Qiao, R. Fang, N. Zhang, Y. Zhu, X. Chen, S. Deng, Y. Jiang, P. Xie, F. Huang, and H. Chen, “Agent planning with world knowledge model,” NeurIPS, vol. 37, pp. 114 843–114 871, 2024】通过综合专家知识和经验知识来增强代理规划,提供全局先验和动态局部知识以指导决策。这些方法通过整合多样化和结构化的外部信息,共同改善了LLM的演化。
外部反馈驱动的演化。LLM可以通过利用来自工具、评估者和人类的外部反馈来迭代地完善其行为,从而提高性能。例如,CRITIC【100, Z. Gou, Z. Shao, Y. Gong, Y. Yang, N. Duan, W. Chen et al., “Critic: Large language models can self-correct with tool-interactive critiquing,” in ICLR, 2024】允许LLM通过基于工具的反馈来验证和修订其输出,提高了准确性并减少了不一致性。STE【101, Y. Song, D. Yin, X. Yue, J. Huang, S. Li, and B. Y. Lin, “Trial and error: Exploration-based trajectory optimization of llm agents,” in ACL, 2024, pp. 7584–7600】通过模拟试错、想象和记忆来增强工具学习,从而实现更有效的工具使用和长期适应。SelfEvolve【102, S. Jiang, Y. Wang, and Y. Wang, “Selfevolve: A code evolution framework via large language models,” arXiv preprint arXiv:2306.02907, 2023】采用一个两步框架,其中LLM利用执行结果的反馈来生成和调试代码,无需人工干预即可提高性能。这些方法通过整合结构化反馈,使LLM能够迭代演化,提高了适应性和鲁棒性。
A4 实验环境
由于本文是一篇综述,它没有传统的实验环境设置,而是对现有的评估框架和工具进行了系统性的梳理和总结。
评估基准与数据集
LLM代理的演进推动了专门基准的创建,这些基准系统地评估代理在技术维度和应用领域的能力,主要分为三类:
-
通用评估框架:
- 多维度能力评估:现代基准采用分层范式,从推理、规划和问题解决等多个维度剖析代理智能。例如,AgentBench【124, X. Liu, H. Yu, H. Zhang, Y. Xu, X. Lei, H. Lai, Y. Gu, H. Ding, K. Men, K. Yang et al., “Agentbench: Evaluating llms as agents,” arXiv preprint arXiv:2308.03688, 2023】在八个交互环境中统一测试,Mind2Web【125, X. Deng, Y. Gu, B. Zheng, S. Chen, S. Stevens, B. Wang, H. Sun, and Y. Su, “Mind2web: Towards a generalist agent for the web,” NeurIPS, vol. 36, pp. 28 091–28 114, 2023】则专注于真实网站的交互任务。MMAU【126, G. Yin, H. Bai, S. Ma, F. Nan, Y. Sun, Z. Xu, S. Ma, J. Lu, X. Kong, A. Zhang et al., “Mmau: A holistic benchmark of agent capabilities across diverse domains,” arXiv preprint arXiv:2407.18961, 2024】通过超过3000个跨领域任务将代理智能分解为五个核心能力。
- 动态与自进化评估:为解决基准过时问题,新一代框架采用自适应生成和人机协作。BENCHAGENTS【131, N. Butt, V. Chandrasekaran, N. Joshi, B. Nushi, and V. Balachandran, “Benchagents: Automated benchmark creation with agent interaction,” arXiv preprint arXiv:2410.22584, 2024】通过LLM代理自动创建基准,而TestAgent【133, W. Wang, Z. Ma, P. Liu, and M. Chen, “Revisiting benchmark and assessment: An agent-based exploratory dynamic evaluation framework for llms,” arXiv preprint arXiv:2410.11507, 2024】使用强化学习进行领域自适应评估。
-
领域特定评估系统:
- 特定能力测试:针对医疗健康(MedAgentBench【136, Y. Jiang, K. C. Black, G. Geng, D. Park, A. Y. Ng, and J. H. Chen, “Medagentbench: Dataset for benchmarking llms as agents in medical applications,” arXiv preprint arXiv:2501.14654, 2025】)、自动驾驶(LaMPilot【138, Y. Ma, C. Cui, X. Cao, W. Ye, P. Liu, J. Lu, A. Abdelraouf, R. Gupta, K. Han, A. Bera et al., “Lampilot: An open benchmark dataset for autonomous driving with language model programs,” in CVPR, 2024, pp. 15 141–15 151】)、数据科学(DSEval【139, Y. Zhang, Q. Jiang, X. Han, N. Chen, Y. Yang, and K. Ren, “Benchmarking data science agents,” arXiv preprint arXiv:2402.17168, 2024】)和安全(AgentHarm【145, M. Andriushchenko, A. Souly, M. Dziemian, D. Duenas, M. Lin, J. Wang, D. Hendrycks, A. Zou, J. Z. Kolter, M. Fredrikson et al., “Agentharm: Benchmarking robustness of llm agents on harmful tasks,” in ICLR, 2024】)等领域设计了专门的基准。
- 真实世界环境模拟:OSWorld【146, T. Xie, D. Zhang, J. Chen, X. Li, S. Zhao, R. Cao, J. H. Toh, Z. Cheng, D. Shin, F. Lei et al., “Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments,” NeurIPS, vol. 37, pp. 52 040–52 094, 2025】构建了跨操作系统的真实计算机任务生态系统,EgoLife【149, J. Yang, S. Liu, H. Guo, Y. Dong, X. Zhang, S. Zhang, P. Wang, Z. Zhou, B. Xie, Z. Wang et al., “Egolife: Towards egocentric life assistant,” arXiv preprint arXiv:2503.03803, 2025】则通过自我中心的多模态数据集模拟日常活动。
-
复杂系统协作评估:
- 多代理系统基准:评估框架从评估孤立的代理能力转向系统级的认知协作。TheAgentCompany【151, F. F. Xu, Y. Song, B. Li, Y. Tang, K. Jain, M. Bao, Z. Z. Wang, X. Zhou, Z. Guo, M. Cao et al., “Theagentcompany: benchmarking llm agents on consequential real world tasks,” arXiv preprint arXiv:2412.14161, 2024】在模拟的软件公司环境中测试协作能力。MLRB【154, M. Kenney, “Ml research benchmark,” arXiv preprint arXiv:2410.22553, 2024】则设计了竞赛级的机器学习研究任务来评估多代理协作。
工具生态系统
工具是LLM代理的重要组成部分,可分为三类:
-
LLM代理使用的工具:
- 知识检索:利用搜索引擎(如WebGPT【155, R. Nakano, J. Hilton, S. Balaji, J. Wu, L. Ouyang, C. Kim, C. Hesse, S. Jain, V. Kosaraju, W. Saunders, X. Jiang, K. Cobbe, T. Eloundou, G. Krueger, K. Button, M. Knight, B. Chess, and J. Schulman, “Webgpt: Browser-assisted question-answering with human feedback,” 2022】)来获取实时信息。
- 计算:使用Python解释器和计算器(如Toolformer【162, T. Schick, J. Dwivedi-Yu, R. Dess`ı, R. Raileanu, M. Lomeli, E. Hambro, L. Zettlemoyer, N. Cancedda, and T. Scialom, “Toolformer: Language models can teach themselves to use tools,” Advances in Neural Information Processing Systems, vol. 36, pp. 68 539–68 551, 2023】)来处理精确计算任务。
- API交互:通过调用外部API(如RestGPT【164, Y. Song, W. Xiong, D. Zhu, W. Wu, H. Qian, M. Song, H. Huang, C. Li, K. Wang, R. Yao, Y. Tian, and S. Li, “Restgpt: Connecting large language models with real-world restful apis,” 2023】)来扩展功能。
-
LLM代理创建的工具:
- 为解决新问题或现有工具的局限性,研究探索了让LLM代理自行创建工具。例如,CRAFRT【166, L. Yuan, Y. Chen, X. Wang, Y. R. Fung, H. Peng, and H. Ji, “Craft: Customizing llms by creating and retrieving from specialized toolsets,” arXiv preprint arXiv:2309.17428, 2023】通过收集和抽象代码解决方案来创建专用工具集。CREATOR【168, C. Qian, C. Han, Y. Fung, Y. Qin, Z. Liu, and H. Ji, “CREATOR: Tool creation for disentangling abstract and concrete reasoning of large language models,” in EMNLP Findings, H. Bouamor, J. Pino, and K. Bali, Eds., Singapore, Dec. 2023, pp. 6922–6939】提出了一个四阶段框架(创建、决策、执行、反思)来让代理创建工具。
-
部署LLM代理的工具:
- 生产化:框架如AutoGen【26, Autogen: Enabling next-gen llm applications via multiagent conversation, 2023】、LangChain【170, “LangChain,” 1 2023. [Online]. Available: https://github.com/ langchain-ai/langchain】和Dify【172, “Dify,” 5 2023. [Online]. Available: https://github.com/ langgenius/dify】简化了LLM应用的部署。
- 运维:平台如Ollama【173, “Ollama,” 7 2023. [Online]. Available: https://github.com/ ollama/ollama】和Dify【172, “Dify,” 5 2023. [Online]. Available: https://github.com/ langgenius/dify】提供监控和分析功能,以跟踪模型性能和日志。
- 模型上下文协议:MCP是一个开放协议,用于标准化应用如何向LLM提供上下文,并创建与数据源的安全链接。
A4 实验结果
本节概述了LLM代理在现实世界中面临的挑战及其广泛应用,这反映了该领域研究的“结果”。
现实世界问题
随着LLM代理日益融入社会,它们带来了必须解决的重大现实挑战,主要分为安全、隐私和社会影响三大领域。
图4: LLM代理系统中现实世界问题的概览,分为三个领域:安全挑战(包括以代理为中心和以数据为中心的威胁)、隐私问题(涵盖记忆漏洞和知识产权利用)以及社会影响考量(突出益处和伦理挑战)。
-
安全挑战:
-
以代理为中心的安全:这类攻击直接针对代理模型本身,包括:
- 对抗性攻击:旨在通过操纵输入来损害代理的可靠性。
- 越狱攻击:试图绕过模型的安全防护,以获取未经授权的功能或信息。
- 后门攻击:植入特定触发器,使模型在遇到这些触发器时产生预设的错误行为。
- 模型协作攻击:针对多模型协作场景,通过操纵模型间的交互来破坏系统功能。
防御方法包括对抗性净化、多代理辩论、拓扑引导的安全检测等。
-
以数据为中心的安全:这类攻击旨在污染代理的输入数据,导致不合理的行为,包括:
- 外部数据攻击:如用户输入伪造(提示注入)、黑暗心理引导(诱导代理产生反社会行为)、外部源投毒(污染RAG系统的知识库)。
- 交互攻击:在用户与代理、代理与代理、代理与工具的交互过程中进行攻击,如内存提取、感染式攻击、修改规划思路等。
防御策略包括输入防火墙、多层代理防火墙、基于区块链的共识机制等。
-
-
隐私问题:
-
LLM记忆漏洞:LLM可能无意中泄露训练数据中的敏感信息。
- 数据提取攻击:从模型中提取个人身份信息(PII)。
- 成员推断攻击:判断特定数据样本是否属于训练集。
- 属性推断攻击:推断训练数据样本的敏感属性。
-
知识产权利用:
- 模型窃取攻击:通过查询模型来提取其参数或架构信息。
- 提示窃取攻击:从生成内容中推断出具有商业价值的原始提示。
-
保护措施:包括数据清洗、差分隐私、知识蒸馏、模型水印和隐私泄露检测工具。
-
-
社会影响与伦理关切:
-
社会效益:
- 自动化增强:在医疗、法律、教育等领域自动执行劳动密集型任务,提高效率。
- 就业转型:创造新的技术和管理岗位,重塑劳动力市场。
- 信息分发增强:加速商业广告分发,并提供智能辅导等教育解决方案。
-
伦理关切:
- 偏见与歧视:模型可能继承并放大训练数据中的偏见。
- 问责制:确定有害输出的责任归属仍然是一个挑战。
- 版权问题:AI生成内容对人类创作者的威胁以及数据滥用问题。
- 其他:包括对模型能力的过度依赖、高昂的计算成本和环境影响等。
-
应用
LLM代理的多功能性使其在科研和工业界的多个领域得到应用。
-
科学发现:
- 跨学科研究:SciAgents【266, A. Ghafarollahi and M. J. Buehler, “Sciagents: Automating scientific discovery through bioinspired multi-agent intelligent graph reasoning,” Advanced Materials, vol. n/a, no. n/a, p. 2413523】框架利用多代理协作生成和完善科学假设。
- 化学、材料科学与天文学:ChemCrow【269, A. M. Bran, S. Cox, O. Schilter, C. Baldassari, A. D. White, and P. Schwaller, “Chemcrow: Augmenting large-language models with chemistry tools,” 2023. [Online]. Available: https://arxiv.org/abs/2304.05376】集成化学工具自主规划和执行化学合成。AtomAgents 【270, A. Ghafarollahi and M. J. Buehler, “Atomagents: Alloy design and discovery through physics-aware multi-modal multi-agent artificial intelligence,” 2024. [Online]. Available: https://arxiv.org/abs/2407.10022】用于自动化合金设计 。
- 生物学:BioDiscoveryAgent【273, Y. Roohani, A. Lee, Q. Huang, J. Vora, Z. Steinhart, K. Huang, A. Marson, P. Liang, and J. Leskovec, “Biodiscoveryagent: An ai agent for designing genetic perturbation experiments,” arXiv preprint arXiv:2405.17631, 2024】设计基因扰动实验,BioRAG【211, C. Wang, Q. Long, X. Meng, X. Cai, C. Wu, Z. Meng, X. Wang, and Y. Zhou, “Biorag: A rag-llm framework for biological question reasoning,” arXiv preprint arXiv:2408.01107, 2024】用于生物学问题的问答推理。
- 科学数据集构建:PathGen-1.6M【276, Y. Sun, Y. Zhang, Y. Si, C. Zhu, Z. Shui, K. Zhang, J. Li, X. Lyu, T. Lin, and L. Yang, “Pathgen-1.6m: 1.6 million pathology image-text pairs generation through multi-agent collaboration,” 2024. [Online]. Available: https://arxiv.org/abs/2407.00203】通过多代理协作生成病理学图像数据集 。
- 医学:AgentHospital【281, J. Li, Y. Lai, W. Li, J. Ren, M. Zhang, X. Kang, S. Wang, P. Li, Y.-Q. Zhang, W. Ma et al., “Agent hospital: A simulacrum of hospital with evolvable medical agents,” arXiv preprint arXiv:2405.02957, 2024】模拟医院环境,进行从分诊到治疗的全周期护理。MedRAX【285, A. Fallahpour, J. Ma, A. Munim, H. Lyu, and B. Wang, “Medrax: Medical reasoning agent for chest x-ray,” 2025. [Online]. Available: https://arxiv.org/abs/2502.02673】集成多种工具解决复杂的胸部X光病例 。
-
游戏:
- 游戏扮演:Voyager【35, Voyager: An open-ended embodied agent with large language models, 2023, TMLR】是在Minecraft中进行持续探索的终身学习代理。
- 游戏生成:CALYPSO【289, A. Zhu, L. Martin, A. Head, and C. Callison-Burch, “Calypso: Llms as dungeon master’s assistants,” in AAAI, 2023, pp. 380–390】利用LLM代理作为地下城主助手,构建引人入胜的叙事。
-
社会科学:
- 经济学:Econagent【292, N. Li, C. Gao, M. Li, Y. Li, and Q. Liao, “Econagent: large language model-empowered agents for simulating macroeconomic activities,” ACL, pp. 15 523–15 536, 2024】模拟宏观经济活动。TradingGPT【293, Y. Li, Y. Yu, H. Li, Z. Chen, and K. Khashanah, “Tradinggpt: Multi-agent system with layered memory and distinct characters for enhanced financial trading performance,” arXiv preprint arXiv:2309.03736, 2023】是一个用于金融交易的多代理框架。
- 心理学:代理被用来模拟具有不同特质的人类行为,并研究从众等社会现象。
- 社会模拟:Generative agents【30, Generative agents: Interactive simulacra of human behavior, 2023, UIST】在一个交互式沙盒环境中模拟现实的人类行为。
-
生产力工具:
- 软件开发:ChatDev【301, C. Qian, X. Cong, C. Yang, W. Chen, Y. Su, J. Xu, Z. Liu, and M. Sun, “Chatdev: Communicative agents for software development,” in ACL, 2024, pp. 15 174–15 186】和MetaGPT【27, Metagpt: Meta programming for a multi-agent collaborative framework, 2024, ICLR】通过多代理协作简化软件开发流程。
- 推荐系统:Agent4Rec【302, A. Zhang, Y. Chen, L. Sheng, X. Wang, and T.-S. Chua, “On generative agents in recommendation,” in SIGIR, 2024, pp. 1807– 1817】使用LLM代理模拟用户行为,AgentCF【303, J. Zhang, Y. Hou, R. Xie, W. Sun, J. McAuley, W. X. Zhao, L. Lin, and J.-R. Wen, “Agentcf: Collaborative learning with autonomous language agents for recommender systems,” in WWW, 2024, pp. 3679–3689】将用户和物品都视为代理进行协同学习。
A7 补充细节
基于LLM的多代理系统的进步带来了巨大的机遇,但也在可扩展性、记忆、可靠性和评估方面提出了紧迫的挑战。本节概述了塑造代理AI未来的关键障碍和新兴趋势。
可扩展性与协调。由于计算需求高、协调效率低下以及资源利用问题,扩展基于LLM的多代理系统仍然具有挑战性【306, C. Qian, Z. Xie, Y. Wang, W. Liu, Y. Dang, Z. Du, W. Chen, C. Yang, Z. Liu, and M. Sun, “Scaling large-language-model-based multiagent collaboration,” arXiv:2406.07155, 2024】、【307, C.-M. Chan, W. Chen, Y. Su, J. Yu, W. Xue, S. Zhang, J. Fu, and Z. Liu, “Chateval: Towards better llm-based evaluators through multi-agent debate,” arXiv preprint arXiv:2308.07201, 2023】。现有的多代理框架专为轻量级代理(如函数调用和基于规则的系统)设计【308, O. F. Rana and K. Stout, “What is scalability in multi-agent systems?” in Proceedings of the fourth international conference on Autonomous agents, 2000, pp. 56–63】、【309, R. Deters, “Scalable multi-agent systems,” in Proceedings of the 2001 joint ACM-ISCOPE conference on Java Grande, 2001, p. 182】,缺乏对拥有数十亿参数的LLM代理的系统级优化【26, Autogen: Enabling next-gen llm applications via multiagent conversation, 2023】。未来的方向包括分层结构,即高层LLM代理将子任务委托给专门的低层代理,以及去中心化规划,使代理能够并行规划并定期同步以减轻瓶颈。需要改进鲁棒的通信协议和高效的调度机制,以增强协调、实时决策和系统鲁棒性【306, Scaling large-language-model-based multiagent collaboration, 2024, arXiv】、【307, Chateval: Towards better llm-based evaluators through multi-agent debate, 2023, arXiv】。
记忆约束与长期适应。在多轮对话中保持连贯性以及知识的纵向积累需要有效的记忆机制【310, G. Verma, R. Kaur, N. Srishankar, Z. Zeng, T. Balch, and M. Veloso, “Adaptagent: Adapting multimodal web agents with few-shot learning from human demonstrations,” arXiv preprint arXiv:2411.13451, 2024】。然而,由于LLM的有效上下文非常有限【74, Llmlingua: Compressing prompts for accelerated inference of large language models, 2023, EMNLP】、【311, Y. Jin, M. Choi, G. Verma, J. Wang, and S. Kumar, “Mm-soc: Benchmarking multimodal large language models in social media platforms,” in ACL Findings, 2024】,将足够的历史信息整合到提示中变得具有挑战性。这阻碍了模型在长时间交互中的上下文感知能力。确保交互连续性需要高效的记忆可扩展性和相关性管理【312, Z. Yao, Z. Tang, J. Lou, P. Shen, and W. Jia, “Velo: A vector database-assisted cloud-edge collaborative llm qos optimization framework,” in ICWS. IEEE, 2024, pp. 865–876】,这超出了当前如向量数据库、记忆缓存、上下文窗口管理和检索增强生成(RAG)【43, Retrievalaugmented generation for knowledge-intensive nlp tasks, 2020, NeurIPS】等实践。未来的方向包括分层记忆架构,它将用于短期规划的情景记忆与用于长期保留的语义记忆相结合,以及自主知识压缩【313, X. Cheng, X. Wang, X. Zhang, T. Ge, S.-Q. Chen, F. Wei, H. Zhang, and D. Zhao, “xrag: Extreme context compression for retrievalaugmented generation with one token,” in NeurIPS, 2024】,以动态优化记忆并增强在长时间交互中的推理能力。
可靠性与科学严谨性。LLM虽然知识丰富,但既不全面也不最新,因此可能不适合作为结构化数据库的独立替代品。它们的随机性使得输出对提示的微小变化高度敏感【314, Y. Jin, M. Chandra, G. Verma, Y. Hu, M. De Choudhury, and S. Kumar, “Better to ask in english: Cross-lingual evaluation of large language models for healthcare queries,” in WWW, 2024, pp. 2627–2638】,导致幻觉【315, V. Agarwal, Y. Jin, M. Chandra, M. De Choudhury, S. Kumar, and N. Sastry, “Medhalu: Hallucinations in responses to healthcare queries by large language models,” arXiv:2409.19492, 2024】并在多代理系统中加剧不确定性,例如在医疗应用和自主科学发现的代理框架中【316, C. Lu, C. Lu, R. T. Lange, J. Foerster, J. Clune, and D. Ha, “The ai scientist: Towards fully automated open-ended scientific discovery,” arXiv preprint arXiv:2408.06292, 2024】,不可靠的输出可能误导高风险决策。解决这些挑战需要开发严格的验证机制和结构化的验证流程,包括基于知识图的验证,即输出与结构化数据库进行交叉检查【317, G. Agrawal, T. Kumarage, Z. Alghamdi, and H. Liu, “Can knowledge graphs reduce hallucinations in llms?: A survey,” in NAACL, 2024, pp. 3947–3960】,以及通过检索进行交叉引用,将响应基于引用的来源,如WebGPT中的网页【318, R. Nakano, J. Hilton, S. Balaji, J. Wu, L. Ouyang, C. Kim, C. Hesse, S. Jain, V. Kosaraju, W. Saunders et al., “Webgpt: Browserassisted question-answering with human feedback,” arXiv preprint arXiv:2112.09332, 2021】。沿着这个方向,未来的工作可以探索能够直接生成引用的LLM,以及为LLM应用提供最新和全面的知识来源。同时,在医疗、法律或科学研究等高风险领域,纯自动化仍然存在风险。人机验证循环正成为确保安全性、可靠性和问责制的标准【315, Medhalu: Hallucinations in responses to healthcare queries by large language models, 2024, arXiv】。未来的工作可以增强交叉引用机制【319, T. Gao, H. Yen, J. Yu, and D. Chen, “Enabling large language models to generate text with citations,” in EMNLP, 2024】、自洽性【320, X. Wang, J. Wei, D. Schuurmans, Q. V. Le, E. H. Chi, S. Narang, A. Chowdhery, and D. Zhou, “Self-consistency improves chain of thought reasoning in language models,” in ICLR, 2023】和标准化的AI审计框架,如事实核查日志,以提高问责制。例如,一个关键挑战是在LLM生成的大量内容中确定最佳干预点。
多轮、多代理动态评估。传统的AI评估框架专为静态数据集和单轮任务设计,无法捕捉LLM代理在动态、多轮和多代理环境中的复杂性【310, Adaptagent: Adapting multimodal web agents with few-shot learning from human demonstrations, 2024, arXiv】。当前的基准主要评估孤立环境中的任务执行,如代码补全【321, S. Zhou, U. Alon, S. Agarwal, and G. Neubig, “Codebertscore: Evaluating code generation with pretrained models of code,” in EMNLP, 2023, pp. 13 921–13 937】、【322, Z. Wang, S. Zhou, D. Fried, and G. Neubig, “Execution-based evaluation for open-domain code generation,” in EMNLP, 2023, pp. 1271–1290】和对话生成【57, Llmmars: Large language model for behavior tree generation and nlpenhanced dialogue in multi-agent robot systems, 2023, arXiv】,忽略了在多轮交互中展开的涌现代理行为、长期适应和协作推理。此外,静态基准难以跟上不断演进的LLM能力【323, K. Zhu, J. Chen, J. Wang, N. Z. Gong, D. Yang, and X. Xie, “Dyval: Dynamic evaluation of large language models for reasoning tasks,” in ICLR, 2024】。关于潜在数据污染的担忧依然存在,即模型性能可能源于记忆而非真正的推理。未来的研究应侧重于动态评估方法,整合多代理交互场景、结构化性能指标和自适应样本生成算法【324, K. Zhu, J. Wang, Q. Zhao, R. Xu, and X. Xie, “Dynamic evaluation of large language models by meta probing agents,” in ICML. PMLR, 2024, pp. 62 599–62 617】,以创建更鲁棒和可靠的评估框架。
安全部署的监管措施。随着代理AI系统自主性的增强,监管框架必须演进以确保问责制、透明度和安全性。一个关键挑战是减轻算法偏见——代理可能无意中基于性别、年龄、种族或其他敏感属性进行歧视,其方式通常是开发者难以察觉的【248, S. Liu, Y. Jin, C. Li, D. F. Wong, Q. Wen, L. Sun, H. Chen, X. Xie, and J. Wang, “Culturevlm: Characterizing and improving cultural understanding of vision-language models for over 100 countries,” arXiv:2501.01282, 2025】、【325, X. Yi, J. Yao, X. Wang, and X. Xie, “Unpacking the ethical value alignment in big models,” arXiv preprint arXiv:2310.17551, 2023】。解决这个问题需要标准化的审计协议来系统地识别和纠正偏见,以及记录决策路径和模型置信度的可追溯性机制,以实现事后问责。未来的工作可以探索结合了公平感知训练流程与法律和伦理保障的多学科方法。政策制定者、研究人员和行业利益相关者之间的合作对于确保AI驱动的系统安全、公平地运行并符合社会价值观至关重要【326, X. Wang, L. Jiang, J. Hernandez-Orallo, D. Stillwell, L. Sun, F. Luo, and X. Xie, “Evaluating general-purpose ai with psychometrics,” arXiv preprint arXiv:2310.16379, 2023】。
角色扮演场景。LLM代理可以模拟研究员、辩手和教师等角色【307, Chateval: Towards better llm-based evaluators through multi-agent debate, 2023, arXiv】、【327, Y. Wu, Z. Jiang, A. Khan, Y. Fu, L. Ruis, E. Grefenstette, and T. Rocktaschel, “Chatarena: Multi-agent language game environ- ¨ ments for large language models,” 2023】,但它们的有效性受到训练数据限制和对人类认知理解不完整的制约【326, Evaluating general-purpose ai with psychometrics, 2023, arXiv】、【328, J. Yao, X. Yi, Y. Gong, X. Wang, and X. Xie, “Value fulcra: Mapping large language models to the multidimensional spectrum of basic human value,” in NAACL, 2024, pp. 8754–8777】。由于LLM主要在基于网络的语料库上进行训练,它们难以模拟在线上代表性不足的角色【329, V. C. Nguyen, M. Taher, D. Hong, V. K. Possobom, V. T. Gopalakrishnan, E. Raj, Z. Li, H. J. Soled, M. L. Birnbaum, S. Kumar et al., “Do large language models align with core mental health counseling competencies?” in NAACL, 2025】,并且常常产生缺乏多样性的对话【268, Y. Jin, Q. Zhao, Y. Wang, H. Chen, K. Zhu, Y. Xiao, and J. Wang, “Agentreview: Exploring peer review dynamics with llm agents,” in EMNLP, 2024, pp. 1208–1226】。未来的研究应侧重于通过改善多代理协调、整合现实世界的推理框架以及优化对话多样性来增强角色扮演的逼真度,以更好地支持复杂的人机交互。
A5 结论
本综述提出了一个关于LLM代理的系统性分类法,从构建、协作和演化三个维度解构了其方法论组成部分。我们提出了一种统一的架构视角,将单个代理的设计原则与多代理协作系统联系起来——这种方法将我们的工作与以往的综述区别开来。尽管取得了显著进展,但仍存在重大挑战,包括可扩展性限制、记忆约束、可靠性问题以及评估框架不足。展望未来,我们预计在协调协议、混合架构、自监督学习和安全机制方面将出现变革性发展,这将增强代理在不同领域的能力。通过提供这一基础性理解并确定有前景的研究方向,我们希望能为LLM代理技术的负责任发展做出贡献,这些技术可能会从根本上重塑人机协作。
💬 评论讨论
欢迎在这里分享您的想法和见解!