当iMessage成为AI遥控器:一条短信背后的Agent革命与信任困局

在AI Agent的叙事中,一个最本质的痛点始终没有得到解决:如何让AI从“聊天”走向“动手”,从信息处理走向真实世界的交易?Airtap用一条iMessage给出了一个颇具冲击力的路径——发给美国号码一条短信,一个远在云端虚拟手机上的AI Agent就能替你打开TikTok刷完10条热门视频,并把这些内容总结打包发回用户。你甚至不需要在设备上安装TikTok。

这一能力的实现,得益于Airtap的三层架构设计,为行业提供了一种极简主义的技术范式参考:“大脑”层(大语言模型)负责破译自然语言指令,解决“用户想做什么”的问题;“AutoPilot”层承担视觉识别与模拟点击,负责“怎么做”;而最底层是一台7×24小时运行的云手机,它提供了整条链路中不可或缺的“物理”执行环境。这种分工让复杂的动手操作被巧妙分解为理解、操控、执行三个可复用的模块。

行业对此的关注焦点,不止于“能干点啥”,而在于Airtap几乎是在用最低预期的入口成本,大幅压低AI Agent的使用门槛。与各类通用Agent常受限于API权限、未能覆盖App内操作不同,Airtap利用纯视觉模拟点击的方式直接交互界面,拿到了对任何应用——包括那些未开放API的应用——的操作能力,这是一个访问权限上的核心突破。同时,操作全部在云手机而非个人手机上进行,既避免了本地算力需求,也绕开了本地App安装的限制。这也意味着,一个身处国内无法注册TikTok的用户,可以通过一条短信指使一台远在美国的云手机完成该操作。

然而,当Agent从“信息处理”推入“交易环节”时,信任的裂缝便显现了。Airtap明确将最后支付环节保留给用户手动完成——这并非技术不够强大,而是所有Agent厂商都绕不开的信任与授权难题。将支付密码、消费者权益、账户安全委托给一个视觉模型当前是不现实的。这一点也反过来定义了Agent商业化的边界:在未来很长一段时间内,高敏感操作仍需要“人类在环中”(Human-in-the-loop)

对于产品经理和开发者而言,Airtap带来的信号非常清晰:AI Agent正在走出对话框,通过视觉与实际界面发生交互,底层逻辑正从“调用API帮你查”转向“帮你亲手做完”。这笔交易中,入口的形态不是重点,信任机制是否建立才是决定Agent能否真正“代理”人类行使意志的关键。在支付环节解决之前,将Agent落地于刷视频、填表单、自动订阅等非资金敏感场景,或许是目前最为务实的策略。