根据今日公开的一份专利申请文件,Apple正在开发一套系统。
当用户佩戴智能眼镜时,该系统可以把用户所说的自然语言指令,与用户注视、指向,或是以其他方式和周边环境产生交互的对象相结合,让语音指令具备更强的上下文感知能力。
这项技术旨在解决人机交互中长期存在的一类难题:人们日常会大量使用指代模糊的口语,例如这是什么?这本书是谁写的?。人类可以依靠语境理解这类表述,但计算机仅凭借文字内容,往往很难解读真实意图。
Apple的方案借助传感器识别周边物体,判断用户注意力落在哪一个目标上,再利用该物体的相关信息,消除语音指令当中的语义歧义。
这套系统的核心思路在于:用户向设备询问某件事物时,不必明确说出该物体的具体名称。
专利描述,设备会扫描用户所处环境,识别场景内各类物体。另一组传感器监测用户状态,判断用户视线的注视方向,锁定对应的物体。
除此之外,指向手势、身体姿态、手持物品等,也都可以作为上下文输入信号。当系统判定用户关注某个特定物件,该物件就被专利文件定义为触发对象。
随后系统会针对这个选定对象开展深度分析,而不是消耗大量算力处理视野内全部内容。Apple设想的处理流程分为两步:首先完成大范围物体粗略识别,之后仅针对用户感兴趣的目标做精细化解析。二次解析既可以在本机完成,也可以调用远端更强的计算资源执行。
举个例子,一本书在初次识别阶段只会被判定为书籍。当用户将视线投向,二次分析就可以进一步识别书名、作者、页数以及其他信息。同样的处理流程,还可以识别植物品种与养护条件、人物相关信息,或是麦片包装盒上的营养参数。
Apple列举多个案例,说明该技术如何让语音交互更加贴近自然交流。
用户看向一台扬声器,直接说出调大音量,系统就能够推断出,这条指令的作用对象就是刚刚注视过的扬声器。另一个场景,用户望着一本书发问这本书是谁写的?或者这是什么?,不需要报出书名。系统会把语音语句和刚刚视线锁定的物体进行关联,结合已经获取到的物体信息给出回答。
值得注意的是,这套系统不一定需要等待语音指令响起,才开始解析用户视野内容。检测到用户注视某物体之后,系统就可以提前预取相关信息。这样能够大幅缩短响应时间,在用户说完问题之前,精细化识别工作就已经完成。
该方案还可以解决另一个现实痛点:等到用户开口提问时,目标物体或许已经移出视野。Apple表示,预先分析可以保存近期观察对象的数据,后续指令依旧可以引用已经不在眼前的事物。
这套架构,也是为了解决持续感知现实世界所带来的巨大算力开销。
设备可以对视野中成百上千个物体做基础识别,但只有被用户视线或者其他输入选中的一小部分对象,才会执行高开销的二次解析。
二次分析还可以使用比初次识别更高分辨率的图像,在不需要全程以最高分辨率处理全部画面的前提下,实现精细识别效果。
Apple特别提到,对触发对象预加载信息能够降低延迟,尤其适合二次处理算力消耗远高于初次物体识别的场景。
对于可穿戴设备而言,这一点尤为关键,这类产品会受到处理性能、电池容量、散热条件的多重限制。
虽然这项技术的适用范围覆盖手机、平板等多种计算设备,专利文件重点提及各类可穿戴设备,包括头戴眼镜、护目镜,还有耳机等音频配件。
这套系统还支持多设备协同工作:搭载摄像头的设备负责扫描环境,头戴设备追踪用户视线,耳机或者头戴设备内置的麦克风接收语音指令。
这种跨设备架构十分值得关注。专利权利要求明确覆盖如下场景:由一台外部电子设备扫描周边环境,另一台不同的外部设备检测针对识别物体的用户输入。权利要求同时包含长时间注视物体、手部手势、高分辨率二次图像,以及带有隐性指代关系的语音指令。
该技术的本质转变:语音助手不再单纯理解语言文本,而是结合用户当下所处现实场景去解读语言。
对于未来眼镜以及其他可穿戴硬件,能够消除很多交互上的生硬感。用户不必说出识别正前方这栋建筑、告诉我第二层货架上的商品信息这类完整长句,只需要看向目标,直接问那是什么?,设备就可以明确理解那的具体指向。
这项专利描绘出全新交互范式:注视不只是用来做选择,注视本身成为上下文线索,帮助智能助手解读人类语言,让可穿戴设备的交互体验,无限贴近人与人之间的自然沟通方式。
