“干货!” 看完这些论文你也能让AI操控电脑(附下载链接)

发布时间2024年11月1日

最近这几天,让大模型具备控制电脑和手机的智能体不断涌现。从 Anthropic Claude 3.5 Sonnet荣耀 MagicOS 9.0 全局智能体,到智谱「全栈式工具使用能力」的 AutoGLM,掀起了一股“Computer Use Agents”的热潮。我们整理了相关论文,让我们一探究竟吧!

论文PDF下载链接:

链接:https://pan.baidu.com/s/1hETNh6mR0vUt9oXeSr_8xg

提取码:1234

Modeling/Framework


  • Agent Workflow Memory

文章提出一种称为 Agent Workflow Memory (AWM) 的方法,可以从agent的轨迹中感知可复用的工作流,并将其集成到agent的记忆中,解决了现有方法在处理长时间跨度和复杂行动轨迹的任务时面临的挑战。研究结果表明,AWM在网页导航任务中显著提高了任务成功率和执行效率,展现了其在动态环境下的强大适应能力。为智能体的动态记忆构建和适应能力的进一步研究提供了广阔的前景。

论文链接:

https://www.aminer.cn/pub/66e24c4d01d2a3fbfcbe4dd9?fr=awm


  • Agent S: An Open Agentic Framework that Uses Computers Like a Human

Agent S采用了一个叫做"经验增强分层规划"的方法。简单来说,就像人类在操作新软件时会去网上搜索教程、回忆过往经验一样,Agent S也会从网络知识和自己的"记忆库"中学习。它会先把复杂的任务分解成小步骤,然后一步步执行,并且在执行过程中不断积累经验,越用越熟练。这项突破性的研究不仅让AI自主操作电脑成为可能,更为残障人士提供了新的人机交互方式

论文链接:

https://www.aminer.cn/pub/66bd64f401d2a3fbfc1d8c91?fr=aqas


  • OSCAR: Operating System Control via State-Aware Reasoning and Re-Planning

本文提出了一种名为OSCAR的通用智能体,能够通过状态感知推理动态任务重规划自主导航和交互多种桌面和移动应用,实现对图形用户界面(GUIs)的精确控制,提高了用户生产力。

论文链接:

https://www.aminer.cn/pub/671afe5c01d2a3fbfc6b3c0d?fr=OSCAR


  • AgentStore: Scalable Integration of Heterogeneous Agents As Specialized Generalist Computer Assistant

采用了一种新颖的集成方法,允许用户动态整合第三方智能体——AgentStore平台,通过整合异质智能体来实现自动化计算机任务,并引入MetaAgentAgentToken策略,有效提升智能体在专业化和通用化方面的性能。

论文链接:

https://www.aminer.cn/pub/671afe0401d2a3fbfc69557c?fr=AgentStore


  • Cradle: Empowering Foundation Agents Towards General Computer Control

Cradle框架的独特之处在于,它允许AI实体以一种新颖的方式与游戏和软件进行交互,无需事先的训练过程。这意昧着AI能够直接使用键盘鼠标操作,类似于人类用户,而且在不依赖于特定应用程序接口(API)的情况下,Cradle能够与广泛的开源闭源应用程序进行有效沟通。

论文链接:

https://www.aminer.cn/pub/65e7d36d13fb2c6cf6f6c4bb?fr=Cradle


  • Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web Navigation

本文提出了一种世界模型增强(WMA)的互联网交互智能体,以帮助LLM互联网交互智能体更好地理解和预测其行动的结果。具体而言,研究者们提出了一种过渡聚焦的观察抽象方法,旨在训练LLM作为世界模型,通过自然语言描述关键状态变化。WMA互联网交互智能体在性能上超越了现有的基线方法。

论文链接:

https://www.aminer.cn/pub/6711c43701d2a3fbfc5803c4?fr=weba


  • NNetscape Navigator: Complex Demonstrations for Web Agents Without a Demonstrator

论文提出NNetscape Navigator(NNetnav),一种完全通过合成演示训练网络代理的方法,有效利用语言指令的层次结构来提高搜索效率,通过浏览器交互生成轨迹回滚,再使用语言模型将轨迹回滚反标为指令,进而利用这些合成演示进行监督微调,优化语言模型策略。

论文链接:

https://www.aminer.cn/pub/670348bd01d2a3fbfcb5f6a9?fr=nnn


  • The Impact of Element Ordering on LM Agent Performance

本文研究了元素排序对语言模型代理性能的影响,发现元素排序对代理性能有显著影响,并提出了基于维度降低的有效排序方法。通过比较不同元素排序方法在网页桌面环境中的表现,使用维度降低技术为像素环境提供有效排序。

论文链接:

https://www.aminer.cn/pub/66eb89d301d2a3fbfcea593f?fr=eol


  • Agent-E: from Autonomous Web Navigation to Foundational Design Principles in Agentic Systems

Agent-E是一种新型的网络智能体,它在自主网络导航方面实现了许多架构上的创新,包括层次化设计、灵活的文档对象模型(DOM)提炼降噪技术,以及利用变化观察来指导智能体更准确地执行任务。

论文链接:

https://www.aminer.cn/pub/6699cc7c01d2a3fbfcc2c6ea?fr=ae


  • Tree Search for Language Model Agents

本文提出了一种推理时搜索算法,使LM智能体能够在交互式网页环境中进行探索和多步骤规划。这是一种在实际环境空间内操作的最佳优先树搜索(best-first tree search),与大多数现有的方法互补。本文算法是第一个在现实网页任务中表现有效的LM智能体树搜索算法。

论文链接:

https://www.aminer.cn/pub/66836fa201d2a3fbfcb1ff59?fr=tsfl


  • ICAL: Continual Learning of Multimodal Agents by Transforming Trajectories into Actionable Insights

本文提出了一种名为ICAL的方法,通过将低质量演示转化为有价值的抽象经验,提升大规模生成语言视觉语言模型在决策和指令遵循方面的性能。ICAL方法通过构建一个从次优演示人类反馈中学习多模态经验洞察的记忆库,使模型能够从噪声演示中抽象出一般性程序,并通过人类反馈进行交互式精炼和适应。

论文链接:

https://www.aminer.cn/pub/6678d2dd01d2a3fbfc6e8df8?fr=ical


  • OS-Copilot: Towards Generalist Computer Agents with Self-Improvement

OS-Copilot是一个具有自我提升能力的通用计算机智能体框架,旨在通过提供通用的交互接口来加速计算机智能体的构建。它能够无缝集成到操作系统中,自动执行各种计算机任务,通过设计并学习面向新应用的操作课程,逐步积累所需的工具和技能,从而掌握操作应用程序的能力

论文链接:

https://www.aminer.cn/pub/65cad4c5939a5f4082f3860b?fr=oc

Grounding

  • Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents

本文提出了一种全新的人类化视觉定位方法,通过视觉 grounding 模型使得GUI智能体能够如同人类一样感知环境,并在无文本输入的情况下显著提升其性能。研究采用了一种基于视觉的定位方法,利用LLaVA架构的轻微调整和基于网络的合成数据训练视觉grounding模型。

论文链接:

https://www.aminer.cn/pub/67049ca601d2a3fbfc08e270?fr=ndwa


  • OmniParser for Pure Vision Based GUI Agent

OmniParser是一种通用的纯视觉方法,它可以将用户界面的截图解析成结构化的元素。这种方法包括两个微调模型:一个是图标检测模型,另一个是功能描述模型。不仅提高了大型视觉语言模型在用户界面操作中的表现,还提供了一种通用的屏幕解析方法,使得计算机能够更准确地理解和操作用户界面,从而更好地辅助用户完成各种应用程序中的任务。

论文链接:

https://www.aminer.cn/pub/66ac3e8501d2a3fbfc898589?fr=omni


  • SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents

本文提出并构建了一个基于大规模视觉语言模型(LVLM)的视觉GUI智能体SeeClick,SeeClick基于大规模视觉-语言模型(LVLM),通过在精心收集的GUI grounding数据上训练以增强其GUI定位能力,最终能够在iOS、Android、电脑操作系统和网页等各种GUI上准确地根据指令定位操作元素,像人类一样仅仅通过视觉观察屏幕执行点击、输入等操作。

论文链接:

https://www.aminer.cn/pub/65af2fe5939a5f4082fa4390?fr=click


Evaluation

  • Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale

本研究采用了Windows Agent Arena作为评估多模态操作系统智能体的核心方法,构建了一个基于真实Windows操作系统的可扩展环境。Windows Agent Arena的创新之处在于其能够实现任务的自动化执行基于结果的评估,这种方法相比于传统的基于人类演示的评估方式,更加灵活和高效。

论文链接:

https://www.aminer.cn/pub/66e3a00801d2a3fbfc96aa0f?fr=waa


  • AgentStudio: A Toolkit for Building General Virtual Agents

从环境到智能体,从数据到评估,AgentStudio提供了一套完整的解决方案覆盖了构建智能体的全过程,将极大地加速了智能体的发展。

论文链接:

https://www.aminer.cn/pub/66037e1213fb2c6cf6e8bbe9?fr=as

Computer Use Agent 领域正蓬勃发展,未来将带来更智能、更自主的电脑操控体验,为残障人士、办公自动化和智能家居等领域带来革命性的变革。