AI Agent的演进正从“会聊天”迈向“会动手”。Airtap推出的iMessage功能,以极低的使用门槛,展示了Agent执行复杂操作的能力:用户只需向美国号码发送一条iMessage,远端的AI Agent便能通过视觉模拟点击,完成TikTok刷视频、星巴克点单等任务,且用户端无需安装对应App。
这一消息的核心冲击力不在于技术复杂度,而在于它彻底绕过了传统App的入口与分发逻辑。Agent执行的场景从“帮用户查信息、写文件”跃迁到“帮用户完成真实交易”,尽管支付环节仍需手动授权,但产品路径已清晰指向“无需安装、随叫随到”的下一代交互形态。
从技术架构看,Airtap的设计可拆解为三层:大脑层(大语言模型理解你的自然语言指令)、AutoPilot层(通过视觉识别屏幕元素,模拟手指点击、滑动)、云手机层(24小时在线的远程虚拟设备)。这种架构的核心创新在于:Agent不再依赖API接口,而是像人类一样“看屏幕、点按钮”。这使得它能操控任何无API支持的App,甚至是在国内无法访问的海外应用,这在当前主流Agent依赖API接入的路径外,开辟了一条“视觉操控”的野路子。
与Apple Intelligence、Perplexity等主流Agent思路相比,Airtap的视觉路径更具“破坏性”。前者强调系统集成与生态内闭环,而Airtap直接无视生态边界——它不需要微信、抖音开放接口,只需Agent在云手机上“看着屏幕点”。这种方式的代价是:速度慢(需等待画面渲染和识别)、易脆弱(UI变化即失效),但对想快速实现Agent实操价值的团队来说,是性价比极高的MVP路径。
值得关注的是支付安全设计。在星巴克点单场景中,Agent能完成商品选择、加入购物车等步骤,但进入支付环节时,系统会主动将“敏感操作”返回给用户手动确认。这表明,信任与授权机制仍是Agent落地的致命瓶颈——技术上解决不了“Agent是否值得完全信任”的问题,商业上就必须用安全兜底换取用户安全感。这也是所有Agent厂商绕不开的共同难题。
对产品经理和Agent创业者而言,Airtap的启示在于:不必等生态开放,视觉操控可以在当下就帮你验证“Agent实操”的价值。但需警惕其天花板——当操作复杂度提升、App反自动化机制升级时,视觉路径的可维护性会急剧下降。更持久的方案,仍是推动行业建立新的Agent-用户信任协议,以及App间有序的自动化接口标准。
一句话总结:Agent的“最后一步”不在技术,而在信任。谁先解决这个非技术问题,谁就可能重新定义App的入口。