基于协作语义融合的多智能体行为决策方法 DUAN Pengting, WEN Chao, WANG Baoping, WANG Zhenni计算机科学(2026)被引用0|浏览12摘要多智能体行为决策方法,为工程应用领域,特别是协作任务下的智能体控制提供了广泛的应用前景.基于策略梯度的强化学习方法能够对智能体策略分布进行直接建模,更有利于复杂奖励机制下的策略多样性探索,在离散和连续空间中均能够提供较高的经验效能.基于策略梯度的多智能体联合策略生成通常采用参数共享等机制提升收敛效率,然而,这种机制缺乏对行为语义的建模,难以有效克服行为趋同性问题.针对该问题,从图建模的视角提出了一种基于协作语义融合(Collaborative Semantics Fusion,CSF)的行为序列预测方法.CSF方法利用图自编码器学习行为空间语义关系,获取相关性感知的行为语义嵌入;通过智能体行为特征与语义嵌入的交互实现信息融合.这种融合方式将具有协作关系的行为信息聚合于特定智能体的行为表示,实现多个智能体行为相互依赖的策略空间探索.在星际争霸和谷歌足球环境的多个复杂任务场景中开展实验,结果表明,CSF方法明显优于现有先进算法,验证了所提方法可以实现智能体间的高效协作.更多查看译文AI 理解论文数据免责声明页面数据均来自互联网公开来源、合作出版商和通过AI技术自动分析结果,我们不对页面数据的有效性、准确性、正确性、可靠性、完整性和及时性做出任何承诺和保证。若有疑问,可以通过电子邮件方式联系我们:report@aminer.cnChat Paper正在生成论文摘要