煕煕姸姸
26-07-23 01:42 微博认证:数码博主 超话小主持人(Apple超话)

随着Apple持续加大在体育领域的布局,该公司正在研发技术,用来完善音频各个环节的处理能力。

昨日,Apple获得一项专利,提出一种空间音频渲染技术,能够让内容创作者更加灵活地控制收听者听到的三维声场内容。

这项发明的核心是依靠元数据,在一段空间音频节目内划定屏蔽区域。音频内容传输至播放端后,解码器与空间音频渲染器会依据这套元数据,削弱或者完全去除屏蔽区域内的音频元素,同时保留区域以外的全部声音。

该设计的亮点在于,不再仅仅把空间音频当作沉浸式听音格式,更作为内容剪辑与隐私管控工具。创作者无需直接静音整条麦克风信号、音频通道或者音轨,而是可以划定一块三维声学区域,在播放时降低或消除该范围内的特定声音。专利摘要中提到,这套系统允许内容制作端控制音频节目的渲染效果,让元数据划定的三维声学屏蔽区内的声音无法被听到,屏蔽区之外的音频内容则正常播放。

整套技术从内容制作端开始生效。音频素材可以是直播信号、预先录制内容,或是为电影、演唱会、体育赛事、新闻报道、电子游戏、混合现实作品制作的音频节目。音频素材形式包含音频对象、多声道分轨音频、高阶一阶环绕声等。技术新增的核心要素是伴随音频编码文件一同传输的元数据,用来告知播放端如何处理划定屏蔽区域内的声音。

在解码播放端,设备接收音频文件与配套元数据,解析出声场组成元素,再输出适配收听设备的音频信号,既可以是适配耳机的双耳音频信号,也可以是多声道音响系统的扬声器信号。空间音频渲染器读取元数据,判断对应区域内的音频元素是否需要衰减或是直接静音。

这正是这项专利的核心设计:屏蔽指令并非直接固化混在原始混音当中,而是以元数据形式附带传输,由解码设备在空间音频渲染阶段按照创作者的设定执行处理。

这项专利最重要的创新点,是基于空间区域屏蔽,而非传统的单音轨屏蔽。元数据会定义声场内部的一块三维屏蔽区域,渲染器比对音频对象等声音元素的三维坐标与屏蔽区域范围。一旦声音落入屏蔽区,即可进行降音、静音等处理;区域外的声音则保持原样播放。

Apple在专利文件中列举了体育赛事的典型应用场景:创作者希望对部分敏感对话进行降噪或静音处理,例如教练和队员讨论战术、教练与裁判之间的争执对话。不需要将全场收音直接静音,只需要在这段对话所处位置划定一小块声学屏蔽区域即可。

该方案的价值就在于实现空间层面的选择性控音。现场观众呐喊声、运动员声响、解说语音等音频可以完整保留,仅针对性压制一小块区域内的目标声音。

Apple在专利文档中,明确该技术可适配多种主流空间音频格式,包含音频对象音频、传统多声道音频、高阶环绕声,或是多种格式混合的声场。

现实里不同内容的制作流程并不统一,体育直播、电影配乐、游戏音频、混合现实场景的音频编排方式差异极大。

针对对象型音频,系统比对音频对象坐标与屏蔽区域;针对高阶环绕声,通过声场处理削弱或消除指定区域声音,周边音频不受影响;针对传统多声道音频,系统会先进行声场分析或是格式转换,再执行区域音量衰减。

良好的格式兼容性提升了这项专利的实用价值,并非只为某一类空间音频打造的小众功能,而是一套可跨制作、跨播放架构使用的元数据屏蔽方案。

专利的一项细节优化为过渡区设计。配套元数据可以定义紧贴屏蔽区的过渡范围,介于屏蔽区域与正常收听区域之间。音频渲染时,屏蔽区内采用低增益音量,过渡区内音量平缓渐变,非屏蔽区维持正常音量增益。

如果屏蔽区边界直接硬切静音,听觉上会非常突兀。放到体育直播场景里,声音边界突然消失会严重干扰观众观感,刻意暴露了内容存在剪辑处理。过渡区域可以让声音在进出屏蔽范围时,音量平滑淡入淡出,听感更加自然。

元数据还可以设定过渡区的距离长度,定义音量渐变从屏蔽区外侧开始,直至屏蔽区内部完全生效。

专利提供两套划定屏蔽区域的实现方案:
第一种:
制作端与解码端共用一套预设区域数据库,元数据仅发送区域编号,渲染器调取数据库获取完整区域参数,适合机位固定、场地位置重复出现的直播场景。

第二种:
创作者直接在元数据中输入三维几何坐标,自定义任意形状、任意位置的屏蔽区,更适合游戏、混合现实这类需要动态变化屏蔽范围的内容。

两种模式给创作者提供充足灵活度,直播转播可以复用预设区域,游戏和混合现实内容可以针对角色、物体、事件动态划定声学屏蔽范围。

专利同时支持多机位画面配套机位位置、朝向元数据。参考视频流绑定音频对象与环绕声及其相对基准机位的坐标,其余机位仅传输相对位置角度,不需要单独重新制作音频。播放时,空间音频渲染器重新校准音频位置完成最终输出。

该功能对于体育赛事、演唱会、沉浸式视频十分关键。观众切换镜头视角时,声场空间位置不能错乱,屏蔽区域也要跟随视角变化保持合理生效范围。这套方案可以统一协调空间音频、多路画面、元数据,不需要每切换一次镜头就重新制作一版音频混音。

这项专利最大的创新,依靠元数据让创作者按空间区域管控空间音频播放效果。传统静音控制大多作用于整条声道、单支麦克风或者独立音轨。Apple这套方案直接在三维声场划定区域降噪,声场其余部分音频不受干扰。

应用场景十分广泛,包含隐私保护、播出合规管控、赛事战术保密、合家向节目内容处理、大型直播控音以及混合现实场景,适配AirPods、Apple TV、Vision Pro、iPhone、iPad、Mac组成的Apple全生态播放体系。

本次授权专利提出一套依托元数据的系统,可以在空间音频节目内划定三维声学屏蔽区域。播放端渲染器读取元数据,抑制屏蔽区内的声音元素,完整保留其余区域音频。

核心思路在于Apple不再只把空间音频当作一种沉浸式听音方案,而是视作一套可调控的声场环境。创作者能够依据发声位置,选择性处理隐私内容、敏感对话、多余杂音。未来在体育直播、演唱会、游戏、混合现实、沉浸式视频当中,空间音频将变得更加智能、干净可控。

发布于 浙江