首页 培训动态 学习案例 AI长出眼睛和手,GUI 智能体元年来了
AI长出眼睛和手,GUI 智能体元年来了

你交给 AI 一件需要操作软件界面的事。比如把 A 系统的数据搬到 B 系统,或跨几个互不联通的界面把状态梳理整齐。它没有列出一份操作清单让你确认,而是直接打开软件,开始点击、输入、切换窗口,像另一个坐在电脑前的真人。


AI 不再只是聊天,它开始动手了。

但真正值得我们关注的,不是它能动手这件事本身,因为区别于传统聊天机器人的很多AI智能体都可以具体执行任务了,而是它动手的方式,它可以通过模拟人类的视觉而不是依靠软件接口进行操作这种方式,正在成为一条可以开源、可被复用的技术路径。这条路,叫做 GUI Agent。过去,类似能力大多只在个别产品的黑箱里;如今,它正被抽离出来,成为独立的能力层开始得到更广泛的应用。一种能力从产品内部释放出来成为独立层,往往是技术路线走向成熟的标志。

不接 API 也能操作软件,一条新路线浮出水面

智能体驱动软件,一直以来主要存在两条路径。

一条是接口模式。软件把能力开放为 API 或连接器,AI 通过授权调用接口完成动作。前提是软件愿意、且能够把能力暴露出来。一旦某个旧系统没有接口,或厂商未开放权限,AI 便鞭长莫及。

另一条是视觉操作模式。即 GUI Agent。它不需要软件开放任何接口,模型直接"看"屏幕画面,理解按钮、输入框、列表等界面元素,然后模拟人的点击和键入,把任务走完。那些存量的、不开放接口的老系统,那些网页中没有 API 的后台,全都能被它接管。

覆盖面广通用性强正是GUI这一路线的特长,任何有屏幕、有界面的软件,都在它的能力范围之内,不再受到接口生态的制约。

这条路走通之后,AI 与软件之间的关系可能会悄然发生逆转。过去是软件方决定 AI 能做什么,接口给你开通你才有得用;现在,AI 可以主动适配任何一个界面,不必等软件方配合。对普通用户和企业来说,这条路线的成熟意味着一件事,以后要让 AI 完成一件跨软件的繁琐任务,将会变得更加简单,大概率无需再等待企业之间把接口谈妥。

一周内密集落子,大厂抢的不是功能,是路基

8 月下旬,短短一周之内,GUI这条路线迎来了密集的"铺路"动作。而节奏本身,往往就是某种信号。

8 月 20 日,阿里发布 Qwen-UI-Agent,这是一个 GUI 智能体的开源基座,它能看懂屏幕,操作手机、PC 和网页;在移动端基准 MobileWorld-Real 上拿到 92.2%,在 AndroidDaily 上更是拿到接近满分的97.5%成绩,刷新当时 SOTA,超过 GPT-5.6 Sol 和 Claude Opus 4.8。在两个基准测试上都拿到高分说明,模型看懂并操作界面的精度,已经迈过了可用门槛,不再是展会上的演示花活。

几乎同一周,字节的豆包虚拟桌面与侧边工作台上线,同样无需 MCP 或 API,直接操作界面。短短时间内,多家厂商在桌面与移动端密集跟进,说明GUI这个路线层的竞速已然展开。

这些动作来自不同厂商,看起来不过是各自推各自的产品,却指向同一个方向,GUI 能力正从各家产品内部的隐藏功能,外溢为可被独立集成的一层底座。大厂抢的,已经不是某个功能点,而是这条路线的路基,谁先把路基铺好,谁就握住了未来无数产品的入口。

路线之争一旦进入"路基"阶段,比拼的就不再是谁的功能更花哨,而是谁更稳、更可信、更愿意开放。这一点,比任何技术指标都更值得关注。

最先受益的 是那些高频重复的界面操作

对开发者和企业来说,"手眼能力"开源意味着一件事:自建或集成 GUI Agent 的门槛骤降。这条路线会沉到许多产品的底层,成为默认自带的一项能力,而不再是少数大厂的专利。

哪种任务会最先被渗透?

首先是高频、重复、跨系统的界面操作。跨系统的数据搬运、软件界面的自动化测试、没有接口的老系统对接,都属于此类。它们不性感,但量大、机械、耗时,正是 GUI 路线最划算的用武之地。过去这些活要么靠人肉点击,要么靠专门写脚本,现在多了一层通用能力可以调用。

具体来看,GUI Agent在企业端的应用场景已经覆盖金融审核、保险理赔、物流协调、医疗行政管理、供应链监控等多个领域的认知型和行政型任务自动化。一个典型的例子是飞猪,在机票业务流程中,飞猪通过GUI Agent代替传统RPA,显著提升了研发效率。传统脚本面对按钮重命名、页面重构或加载延迟时极易失败,平均修复耗时超过2小时;而GUI Agent能够"看懂"界面变化,动态适应。

对企业而言,这意味着那些一直想自动化、却因系统老旧、没有接口、改造成本高而搁置的流程,重新有了低成本的路径。需要提醒的是,是低成本而非零成本,诸如接界面、管权限、做异常处理等工作,仍然需要必要的投入,但相对过往,已经下降了非常多。有类似需求的企业,可以考虑关注并做好准备了。

路基铺好了 但路还不平

路线下沉,不等于落地无代价。

误操作、权限边界、安全与可审计,是任何采用这条路线的产品都必须回答的问题。GUI Agent 的优势是通用,代价是可靠性不足。它无需App开发者配合,能打通所有应用,但正因如此,它依赖AI对界面的理解,面对复杂界面或UI更新时,识别错误和操作失败的风险更高。假设一个Agent单步操作的成功率是95%,听起来不错。但一个真实的企业流程往往需要连续完成几十步操作,比如20步连续操作后,整体成功率大约就会降到36%;40步则只剩下约13%。单步表现不错的Agent,一旦放入长链路、全流程,失败率会迅速累积。

这正是行业正在补的同一堂课。2026年上半年有一个比较明显的转向:Agent竞争的叙事,正从"能不能做"转向"能不能稳定地、反复地做成"。衡量Agent操作电脑能力的权威基准OSWorld,整体成功率在大约一年内从12%跃升至66%。但即便66%的成功率,也意味着在普通桌面任务的基准测试中,最好的Agent仍有约三分之一的情况会失败。

在此背景下,各厂商都在往可靠上靠。明略科技的端侧GUI模型Mano-CUA上线了Thinking模式,让AI从看一眼屏幕就动手,变成"先想清楚多步怎么走,再动手"。而Qwen-UI-Agent 在敏感操作上也会要求人工确认,这正是一种必要的刹车。多厂商在路线层竞速的局面已经形成,但在企业落地前的这些边界问题只会更突出。

开源把能力铺平了,但怎么用稳、用安全,仍是每个集成方自己的功课。这也是为什么说路基阶段的竞争,比的不是谁先铺,谁铺得快,而是谁铺得能让人敢放心走。

企业现在该做什么?

GUI Agent开源这件事,变量不在某个产品又多了项功能,而在于"让AI操作任何有屏幕的软件"正从大厂独家能力,变为人人可集成的基础设施。

对正在评估这项技术的企业,有几个方向值得提前布局:

第一,盘点内部无接口的自动化堵点。哪些业务流程长期依赖人工操作,却因为系统老旧、厂商不开放接口而无法自动化?财务对账、跨系统数据录入、ERP与CRM之间的数据同步——这些恰恰是GUI Agent最能发挥价值的地方。

第二,建立权限与审计框架。GUI Agent的本质是模拟人操作屏幕,这意味着它拥有与人类操作者同等的系统权限。企业需要提前思考,谁授权Agent执行什么操作?操作过程如何留痕?异常行为如何熔断?已有企业基于Qwen-UI-Agent开源发布,给出了"锁定运行环境/最小权限授权/敏感动作审批"三道闸的落地实践。

第三,从低风险场景开始试点。不必一开始就把核心业务流程交给Agent。选择那些容错率高、影响面小的重复性操作作为切入点,积累经验、建立信任,再逐步扩展。

对于实施数字化转型的企业而言,2026年已不仅是引入Agent的时机窗口,更是重构核心业务流程、将企业知识系统性地转化为可持续进化的智能资产的战略性节点。率先构建自进化能力闭环的企业,有望在这场"从工具到数字员工的"范式跃迁中,率先建立不可复制的竞争壁垒。

GUI Agent正在从技术概念走向企业生产力。它不是未来的事,它正在发生。