Agent从信息处理迈向交易执行,正以一种意想不到的方式突破传统的App入口逻辑。一家名为Airtap的初创公司推出基于iMessage的AI Agent服务:用户只需向一个美国号码发送一条iMessage,部署在云端的AI Agent就能通过视觉识别和模拟点击,代为执行TikTok刷视频、星巴克点单等操作——整个过程无需用户本地安装任何对应App。
这一功能由常驻美国的博主阿易实测验证。他在国内无法安装TikTok的情况下,通过向手机发送一条简单指令,触发了远在美国云端的AI Agent:AI Agent不仅自动注册了TikTok账号、浏览了10条热门视频,还将视频内容摘要原样返回。此外,该Agent同样能完成星巴克外卖下单等交易类操作。
Airtap的架构分为三个层次:最上层是“大脑”,负责理解用户的自然语言指令并分解为任务决策;中间层是“AutoPilot”,通过视觉识别(类似GPT-4V的视觉能力)理解屏幕内容,再模拟手指点击完成操作;底层则是一台24小时在线的“云手机”,确保Agent持续运行。这种设计的关键在于,Agent无需与目标App进行传统的API对接,而是模拟人类与图形界面的交互方式,从而绕开了生态内App各自为政的接口问题。
相比以往的AI助手主要停留在信息整合和对话层面(如设置日历提醒、查询天气),Airtap直接渗透进了交易环节。然而,用户必须正视一个核心问题:支付等敏感操作仍需用户手动确认,无法交由Agent完全执行。当Agent尝试进行星巴克下单时,到达支付环节便会被“卡住”,等待用户最终授权。这暴露出所有Agent厂商都绕不开的信任困境:用户如何确信AI不会在关键时刻做出错误决策?如何防范恶意指令诱导Agent进行非法操作?即便Airtap通过分段授权机制(交易环节由用户手动完成)部分缓解了风险,但信任与授权仍是一个悬而未决的行业难题。
从行业视角看,Airtap的尝试或许预示着一种新的产品入口逻辑:当用户不再需要安装App,而是通过聊天界面或单一入口指挥AI Agent完成跨应用操作时,传统App的流量分发和用户获取方式将被彻底重塑。对于产品经理而言,应密切关注这类“去App化”的Agent架构对用户行为习惯的长期影响。对于普通用户,可以主动体验这类服务以感受其便利性,但需时刻保持对授信边界的警觉——在AI代理你的数字生活的同时,也要确保它始终在你的掌控之中。