GLM-V GUI Agent实战教程:让AI自动操控手机、电脑与网页界面
GLM-V GUI Agent实战教程:让AI自动操控手机、电脑与网页界面
GLM-V是智谱AI推出的多模态模型项目,其中的GUI Agent功能能够让AI自动操控手机、电脑与网页界面,实现智能化的交互操作。本教程将带您快速掌握GLM-V GUI Agent的使用方法,开启AI自动操控的便捷体验。
一、GLM-V GUI Agent简介
GLM-V GUI Agent是GLM-4.5V和GLM-4.1V-Thinking模型的重要应用,它通过多模态推理能力,实现了对手机、电脑和网页界面的自动操控。借助该功能,用户可以让AI完成一系列复杂的界面操作任务,极大地提高工作效率。
二、准备工作
2.1 环境安装
首先,需要按照项目根目录下的requirements.txt文件安装相关依赖。请确保安装完成后,将transformers库强制升级到5.0.0及以上版本。
2.2 获取项目代码
通过以下命令克隆项目仓库:
git clone https://gitcode.com/zai-org/GLM-V
三、GLM-V GUI Agent核心功能
3.1 多平台支持
GLM-V GUI Agent支持手机、电脑和网页等多个平台的界面操控,能够满足不同场景下的需求。
3.2 丰富的操作指令
GLM-V GUI Agent提供了多种操作指令,包括单击、右键单击、中键单击、鼠标悬停、左键双击以及键盘按键等。例如:
click(x=100, y=200):在坐标(100,200)处进行左键单击key(keys='ctrl+c'):按下组合键ctrl+c
3.3 历史记录功能
为了给模型提供充分的历史信息,在电脑环境下支持选择最近历史动作相对应的位置按时间顺序插入最多4张历史图片,代表最近历史4步的屏幕截图。
四、使用步骤
4.1 配置应用
在使用GLM-V GUI Agent时,需要明确指定需要在哪个(些)应用中执行任务。例如,在AndroidWorld评测时的支持软件配置。
4.2 编写Prompt
编写合适的Prompt是使用GLM-V GUI Agent的关键。Prompt需要包含任务描述以及相关的参数配置。以下是一个实际使用的Prompt例子:
请在浏览器中打开allrecipes网站,搜索"July 4th recipes"并点击第一个搜索结果。
4.3 执行任务
通过运行examples/gui-agent/glm-45v/gui_agent_45v.py或examples/gui-agent/glm-41v/gui_agent_41v.py脚本,启动GLM-V GUI Agent并执行任务。
五、实际应用场景
5.1 网页自动操作
GLM-V GUI Agent可以模拟用户在网页上的各种操作,如点击、输入文本、提交表单等。在使用Selenium库操作网页时,为了确保select元素在截图中可见并且可操作,系统会执行JavaScript脚本对原生的select网页元素进行重写。
5.2 桌面应用控制
通过GLM-V GUI Agent,还可以实现对桌面应用的控制,如打开应用、点击按钮、填写表单等,帮助用户完成重复性的桌面操作任务。
六、总结
GLM-V GUI Agent为用户提供了强大的AI自动操控能力,能够极大地提高工作效率。通过本教程的介绍,相信您已经对GLM-V GUI Agent有了基本的了解,并能够开始使用它来完成各种界面操作任务。
在未来,GLM-V GUI Agent还将不断优化和完善,为用户带来更加智能、便捷的自动操控体验。如果您在使用过程中遇到任何问题,可以参考项目中的文档或向社区寻求帮助。
更多推荐





所有评论(0)