发条iMessage就能操控美国手机,Airtap用AI Agent砸碎APP入口逻辑

标题:发条iMessage就能操控美国手机,Airtap用AI Agent砸碎APP入口逻辑

摘要:Airtap推出一项突破性功能:用户只需向美国号码发送iMessage,云手机上的AI Agent即可通过视觉模拟点击,替用户完成TikTok刷视频、星巴克点单等操作,无需安装任何App。该架构分为三层:大脑理解指令、AutoPilot视觉操控屏幕、云手机保持24小时在线。但支付等敏感操作仍需用户手动完成,信任与授权仍是所有Agent厂商绕不开的难题。

在Agent和智能体概念被反复炒作的当下,却有一个真正触及产品入口逻辑的服务正低调在科技圈引发震动。Airtap通过iMessage通道,让AI Agent远程操控美国云手机,完成了从刷TikTok到星巴克点单的完整操作链路。这不是实验室演示,而是任何用户发送一条iMessage就能体验的可用服务。

Airtap的架构设计尤为值得关注。其采用三层分级:第一层是大脑层,负责理解自然语言指令,将“帮我刷10条TikTok热门视频”转化为可执行步骤;第二层AutoPilot是视觉操控层,通过屏幕截图识别界面元素并模拟点击,类似Airtap的RPA;第三层是云手机层,部署在美国数据中心,保持24小时在线。这个分层让用户无需在任何设备上安装TikTok、星巴克等App,甚至无需解锁手机,AI Agent就能远程完成操作。

但真正有意思的不只是技术细节,而是Airtap对App产品入口的彻底颠覆。长期以来,AI助手要么是API调用,要么是浏览器插件,始终无法真正接管原生App界面。Airtap的做法本质上是将iMessage变成了所有App的超级入口,手机变成AI Agent的手套箱。这一点比苹果即将推出的App Intents更具普适性,因为Airtap不需要App任何配合,纯粹通过视觉模拟做到。

相比之下,Apple此前推出的Shortcuts app虽自动化能力强,但必须依赖App开发者主动开放接口;Google的Assistant Browsing基于浏览器控件分析,虽能理解界面,但操控能力有限。Airtap的方法显然更“暴力”但更有效:它直接接管了屏幕的视觉呈现,相当于AI替你用眼睛看、用手指点。

然而,这种“强控”在扩大覆盖面的同时,也放大了信任与安全这个核心矛盾。Airtap保留了关键的支付操作必须手动完成,说明敏感操作的安全闸门暂时只能由用户自己把控。这不是简单的技术问题,而是商业逻辑和用户信任的取舍。

可以预见,Agent从信息处理到交易执行的过程中,信任问题将长期存在。Airtap的“人机协作”模式——用户下指令、Agent做选择并操作、用户确认支付——可能成为一段时期内相对务实的解决方案。对于产品经理和观察者来说,Airtap的价值不仅仅在于展示了Agent能做多少事,更在于它回答了“Agent如何让人敢让它做这件事”这个根本问题。

趋势判断:Agent正在从“只说不做”走向“替你动手”,但信任这个坎决定了它到底是工具还是隐患。未来的产品设计中,“让用户省心”和“让用户放心”需要双轨并行,单点突破的Airtap已经证明了后者比前者更难,也更值钱。