轻智能拾音降噪,还原每一句清晰人声

人工智能 6 次阅读
摘要:你可能有过这样的经历:在嘈杂的街头接电话,对方总说“你那边好吵”;用录音笔在会议现场录制,回放时满耳都是键盘敲击声;用运动相机记录户外Vlog,自己的讲解声却被风声与车流声淹没。 这些时刻,困扰你的不是设备不够好,而是噪声无处不在。 01 什么是噪声? 从声学角度讲,噪声是干扰目标声音信号的一切非目标声音。它可以是地铁轰鸣、空调低鸣、窗外的雨声和鸟叫声;也可以是突发的拍手、敲桌子和关门声。 图|

你可能有过这样的经历:在嘈杂的街头接电话,对方总说“你那边好吵”;用录音笔在会议现场录制,回放时满耳都是键盘敲击声;用运动相机记录户外Vlog,自己的讲解声却被风声与车流声淹没。

这些时刻,困扰你的不是设备不够好,而是噪声无处不在。

01

什么是噪声?

从声学角度讲,噪声是干扰目标声音信号的一切非目标声音。它可以是地铁轰鸣、空调低鸣、窗外的雨声和鸟叫声;也可以是突发的拍手、敲桌子和关门声。

图|噪声区分区间图

噪声无处不在,而人声是我们最想保留的信号。如何让设备在拾音时“听懂”人声、过滤噪声,是音频技术的挑战。

02

为什么传统降噪

总在“误伤”人声?

过去几十年,音频降噪主要依赖基于统计的传统算法。

它的工作原理可以这样理解:算法先对输入的音频信号进行频谱分析,估算出其中噪声的能量大概是多少,然后直接从原始信号中把估算出来的噪声“减掉”。

听起来合理,但实际应用中存在三个明显缺陷:

简而言之,传统降噪像一副粗糙的筛子——能滤掉一些大颗粒,但细沙和杂音照样漏进来。

03

+AI的拾音降噪

不“估”噪声,只“认”人声

当传统方案还在通过“估算”来降噪时,上海海思AI音频降噪方案换了一种思路——让算法学会“识别”人声与噪声,并在拾音端提取出清晰的目标人声。

它的核心原理,可以通俗地理解为一次“深度学习训练营”:准备两组数据,数据1是纯净的人声(也就是我们想要的“目标”),数据2是各种噪声与人声混合后的带噪语音。

AI降噪算法通过海量数据训练,不断学习“如何把数据2变成数据1”——也就是从混合信号中精准识别并分离出纯净人声。

图|AI降噪训练

经过充分训练,模型掌握了从各种嘈杂环境中提取清晰人声的能力。即使遇到从未见过的突发噪声,也能根据深层特征将其分离。键盘声、关门声,这类传统算法抓不住的“漏网之鱼”,在AI面前无所遁形。

这个方法的本质是基于学习的语音转换,而非简单的阈值扣除。因此,它不仅能有效压制瞬态噪声(如敲键盘),还能针对特定说话人声进行增强,在多人场景中锁定目标音色,输出纯净、高保真的语音信号。

04

端侧落地

把AI装进小设备

如此强大的AI模型,如果只能依赖云端算力,便难以在手表、麦克风、录音笔这类小型终端设备上真正发挥作用。

上海海思的核心突破在于端侧部署:通过模型蒸馏、剪枝等技术“瘦身”,把原本需要GPU才能跑的AI模型,压缩到可在DSP或NPU上实时运行——让终端设备的小算力也能有大智慧。

图|端侧部署

这意味着设备无需依赖网络,本地即可完成高质量的AI拾音降噪处理。无论是地下停车场还是偏远户外,清晰通话不再受信号强弱限制。

AI放到端侧后,功耗又成了问题。上海海思依托长期在AI软硬件领域的技术积累,在软件端充分优化网络结构,在硬件端深度打磨算子设计,使得AI模型的执行效率提升,功耗相应变得更低。

05

覆盖三种典型拾音场景

上海海思AI音频降噪方案目前已成熟支持通话、录音、助听等多种应用场景,让不同形态的设备都能在复杂声学环境中采集到清晰纯净的人声:

从“估算噪声”到“认准人声”,从“云端依赖”到“端侧落地”,上海海思AI音频降噪用深度学习重新定义“拾音”,用工程优化让强大AI轻量化落地。

在这个噪声无处不在的世界里,清晰,是一种稀缺品。而上海海思要做的,就是用轻智能,让每一句你想说的话,都能被这个世界清晰地听见。

常见问题

Q:什么是“拾音降噪”?和我们常说的“降噪”有什么区别?

A: 日常说的"降噪",往往指播放端的体验——比如耳机里的主动降噪,让你听到的音乐更纯净。而“拾音降噪”发生在声音采集端——当你用手机通话、用录音笔记录时,设备在“拾取”声音的同时,就把环境中的噪声过滤掉,只保留清晰的人声。简单来说:播放端降噪是让你“听得更清”,拾音降噪是让别人“听得清你”。

Q:传统降噪与上海海思AI音频降噪的本质区别是什么?

A:传统方案基于统计算法“估算”噪声能量,再从原始信号中“减掉”噪声,容易“减多了”损伤人声,或“减少了”残留杂音。上海海思AI音频降噪则通过深度学习“识别”人声与噪声,从混合信号中精准分离并保留目标人声——不是做减法,而是做判断。

Q:上海海思AI音频降噪是如何“学会”识别人声的?

A:模型通过海量“纯净人声”与“带噪语音”的对比训练,学习如何将嘈杂录音还原为清晰人声。经过充分训练后,即使遇到从未见过的突发噪声,也能根据深层特征将其精准分离。

Q:为什么强调“端侧部署”?把AI模型放进小设备难在哪里?

A:强大的AI模型通常需要GPU支撑,难以在耳机、手表等小型设备上运行。上海海思通过模型蒸馏、剪枝等技术为AI模型“瘦身”,并结合软硬件深度优化,将其压缩至可在DSP或NPU上实时运行——让终端设备的小算力也能有大智慧。

Q:上海海思AI音频降噪目前已覆盖哪些终端应用?

A:上海海思AI音频降噪方案目前已成熟支持通话、录音、助听等多种应用场景:如通话降噪(智能手表、耳机)、录音降噪(直播麦克风、录音笔、运动相机)、助听降噪(助听器设备)。

相关推荐
评论区

登录后即可参与讨论

立即登录