当AI Agent还在卷“理解指令”时,Airtap直接把赛道推向了“执行操作”的终局。通过一条简单的iMessage,用户就能让部署在云端的AI代为完成从注册TikTok到点星巴克等十余种操作——这套将自然语言转化为真实屏幕行为的闭环,正悄然敲碎移动互联网产品固有的入口逻辑。
Airtap的架构分为三层:大脑层负责解析用户发来的iMessage指令,将“帮我刷10条TikTok热门视频”转化为具体动作序列;AutoPilot层则像个戴着虚拟手指的机器人,通过视觉识别在云手机屏幕上模拟点击、滑动;最后的云手机层则提供7×24小时不间断的在线环境,这也是“发条短信,AI替你办事”能够成立的前提。本质上,这套系统将传统的“下载-注册-登录-操作”链路压缩成了“发短信-等结果”。
值得关注的是,Airtap在视频总结环节展示了深度信息加工能力——AI不仅模拟刷完了10条视频,还将其内容摘要打包发回,这比多数Agent停留在“信息推荐”层面又进了一步。但同时,星巴克下单环节暴露出信任链的断点:支付密码等敏感操作仍要求用户手动完成,这也解释了为何Airtap将这个环节设为“半自动”。
信任与授权的死结,是所有Agent厂商难以回避的顶层设计问题。用户愿意让AI浏览信息、构建个人资料,却难以完全交出付款权限。背后是对AI行为失控的合理担忧:一旦系统误读指令或遭遇恶意劫持,损失将由用户承担。从行业趋势看,类似Airtap这类云端Agent不会止步于信息处理,它们正向交易环节渗透,而解决安全边界问题,需要从交互流程、保险机制到监管框架的系统性重构。
对产品经理而言,Airtap引发的思考不仅在于“是否该做Agent”,更在于“如何设计让人敢用Agent”。当“无需安装App”的体验红利逐渐摊平,能否建立透明的行为日志、划分清晰的责任兜底边界,将决定谁能在AI Agent赛道的下一轮竞争中幸存。