当前位置:首页 > 消费电子 > 音视频及家电
[导读] (文章来源:百度智能云) 你可能发现这样的场景,当你坐在沙发上说一声“打开电视机”,不需要遥控器,你就可以尽情观赏电视节目;跟朋友聊天,无需手动敲字,语音输入后便可实时转化成文字,发送给

(文章来源:百度智能云)

你可能发现这样的场景,当你坐在沙发上说一声“打开电视机”,不需要遥控器,你就可以尽情观赏电视节目;跟朋友聊天,无需手动敲字,语音输入后便可实时转化成文字,发送给对方,既省时又省事。这是怎么回事呢?这些设备是如何听懂我们的语言的呢?这里不得不提的,就是语音识别技术。“什么是语音识别?语音识别是完成从语音信息到机器可识别文本信息的转化过程。”

语音识别就是让机器拥有“耳朵”。当然,不是简单的给机器装台收音器就可以实现,它需要不断的进化。这就好像是人的听觉系统的成长。一个出生的婴儿能听到声音,但是听不懂,往后随着年龄的增长,不断的学习、训练,能听懂的东西越来越多。机器的语音识别也有类似的成长过程。语音识别技术的研究最早可以追溯到上世纪50年代,当时的效果并不好。

直到21世纪初,特别是近10年,借助机器学习领域深度学习研究的发展,以及大数据语料的积累,语音识别技术才有了突飞猛进的发展。如今,语音识别的正确率已经接近甚至部分超过了人类。比如,2017年,IBM、微软相继宣称自家产品的语音识别错误率接近了人类,人类的语音识别错误率大约为5.1%,而百度更是通过像百度大脑中语音语义一体化这样的技术,把语音识别错误率控制在了3%左右。

根据识别内容的范围,语音识别可分为“封闭域识别”和“开放域识别”两大类。封闭域识别,识别范围为预先指定的字/词集合,即算法只在开发者预先设定的封闭域识别词的集合内进行语音识别,对范围之外的语音会拒识。因此,可将其声学模型和语言模型进行裁剪,使得识别引擎的运算量变小。并且,可将引擎封到嵌入式芯片或者本地化的SDK中,从而使识别过程完全脱离云端,摆脱对网络的依赖,并且不会影响识别率。

典型的应用场景是,不涉及到多轮交互和多种语义说法的场景。比如,智能家居,主要指只能进行简单指令交互的智能家居和电视盒子,语音控制指令一般只有“打开窗帘”、“打开电视”等,或者语音唤醒功能“小度小度”。开放域识别,无需预先指定识别词集合,算法将在整个语言大集合范围中进行识别。

为适应此类场景,声学模型和语言模型一般都比较大,引擎运算量也较大。因此,业界厂商基本上都只以云端形式提供。比如,百度云就可以提供这样的产品。具体而言,开放域识别按照音频录入和结果获取方式又可将产品形态分为3种:

产品形态一:流式上传-同步获取,应用/软件会对说话人的语音进行自动录制,并将其连续上传至云端,说话人在说完话的同时能实时地看到返回的文字。典型应用场景:语音输入法、实时字幕、语音笔记。

产品形态二:已录制音频文件上传-异步获取,音频时长一般小于5小时。典型应用场景:音/视频字幕配置、实时性要求不高的客服语音质检和语音内容审查等。

产品形态三:已录制音频文件上传-同步获取,音频时长一般小于1分钟。典型应用场景:语音搜索、更智能的机器人语音交互。

当前,百度语音识别技术已经全面开放,包括语音识别、长语音识别、远场语音识别、呼叫中心实时语音识别、呼叫中心音频文件转写五大类别,数十项基础技术,并服务于众多开发者。通过这样的介绍,你大概了解到计算机的“耳朵”是如何练成的吧。如果在实践中,智能音箱这类产品听不懂你的话,你可以多说几遍,像对待孩子那样。只要这样,智能音箱就会越来越懂你。

本站声明: 本文章由作者或相关机构授权发布,目的在于传递更多信息,并不代表本站赞同其观点,本站亦不保证或承诺内容真实性等。需要转载请联系该专栏作者,如若文章内容侵犯您的权益,请及时联系本站删除。
换一批
延伸阅读

9月2日消息,不造车的华为或将催生出更大的独角兽公司,随着阿维塔和赛力斯的入局,华为引望愈发显得引人瞩目。

关键字: 阿维塔 塞力斯 华为

加利福尼亚州圣克拉拉县2024年8月30日 /美通社/ -- 数字化转型技术解决方案公司Trianz今天宣布,该公司与Amazon Web Services (AWS)签订了...

关键字: AWS AN BSP 数字化

伦敦2024年8月29日 /美通社/ -- 英国汽车技术公司SODA.Auto推出其旗舰产品SODA V,这是全球首款涵盖汽车工程师从创意到认证的所有需求的工具,可用于创建软件定义汽车。 SODA V工具的开发耗时1.5...

关键字: 汽车 人工智能 智能驱动 BSP

北京2024年8月28日 /美通社/ -- 越来越多用户希望企业业务能7×24不间断运行,同时企业却面临越来越多业务中断的风险,如企业系统复杂性的增加,频繁的功能更新和发布等。如何确保业务连续性,提升韧性,成...

关键字: 亚马逊 解密 控制平面 BSP

8月30日消息,据媒体报道,腾讯和网易近期正在缩减他们对日本游戏市场的投资。

关键字: 腾讯 编码器 CPU

8月28日消息,今天上午,2024中国国际大数据产业博览会开幕式在贵阳举行,华为董事、质量流程IT总裁陶景文发表了演讲。

关键字: 华为 12nm EDA 半导体

8月28日消息,在2024中国国际大数据产业博览会上,华为常务董事、华为云CEO张平安发表演讲称,数字世界的话语权最终是由生态的繁荣决定的。

关键字: 华为 12nm 手机 卫星通信

要点: 有效应对环境变化,经营业绩稳中有升 落实提质增效举措,毛利润率延续升势 战略布局成效显著,战新业务引领增长 以科技创新为引领,提升企业核心竞争力 坚持高质量发展策略,塑强核心竞争优势...

关键字: 通信 BSP 电信运营商 数字经济

北京2024年8月27日 /美通社/ -- 8月21日,由中央广播电视总台与中国电影电视技术学会联合牵头组建的NVI技术创新联盟在BIRTV2024超高清全产业链发展研讨会上宣布正式成立。 活动现场 NVI技术创新联...

关键字: VI 传输协议 音频 BSP

北京2024年8月27日 /美通社/ -- 在8月23日举办的2024年长三角生态绿色一体化发展示范区联合招商会上,软通动力信息技术(集团)股份有限公司(以下简称"软通动力")与长三角投资(上海)有限...

关键字: BSP 信息技术
关闭
关闭