近日,在 Linux.do 社区出现了一个针对视障人士(严重干眼症及畏光)的移动端 AI Agent 需求求助。求助者希望能找到一款应用程序,能够让用户仅通过语音唤醒和下达指令,由 AI 代为操作手机内的各类应用程序(如点击、滑动、输入等),最终通过语音反馈结果。目标是实现完全的“去屏幕化”操作,让用户在佩戴墨镜或无需注视屏幕的情况下也能完成复杂的手机任务。据描述,用户亲属(约 50 岁)目前虽然能熟练使用单一大模型应用“豆包”进行对话,但无法解决跨应用操作的系统级控制问题。该需求引发了关于目前主流手机自带智能助手(如 Siri、小爱同学等)是否具备实际“系统级 Agent”能力的讨论,即当前 AI 助手多局限于信息查询或单应用内指令,缺乏跨 App 的自动化操作能力。这一需求实际上暴露了当前大模型应用与手机底层操作系统权限之间的割裂现状,即由于缺乏系统级 API 权限(如 Android 的无障碍服务),纯软件类的 AI App 很难独立完成对手机全局的操控。
事件分析
💡 核心观点:真正的移动端 AI Agent 不应仅是信息交互的聊天应用,而必须具备跨应用操作与系统级控制的底层权限。
原文链接:Linux.do





