当前位置:交游天下最新资讯行业热点智能语音交互技术将会让“懒人时代”提前到来
智能语音交互技术将会让“懒人时代”提前到来

46亿年的地球历史,在后段才产生了人类文明。人类的求知欲,想象力和创造力激发了前所未有的科技进步,让这颗原本平凡无奇般存在于浩瀚宇宙中的小小星球变得生机勃勃且璀璨夺目。

科技让我们进步的同时,也让我们越来越慵懒。如果在前些年的时候,听到别人说科技让人越来懒惰,我会觉得这句话还为时尚早。但是,看看现在,看看今天的科技 ,当你看到AI人工智能异军突起,特别是语音交互技术越来越成熟,这一切会让懒人时代提前到来。之所以这么说,是因为智能语音技术会代替传统的手动操作,这一切将会是翻天覆地的技术革命。

让我们来看看智能语音的发展史:

关于人工智能诞生没有统一说法,有部分学者以1950年“人工智能之父”马文·明斯基(Marvin Lee Minsky)建造世界上第一台神经网络计算机为起点。且以当年语音交互起始到现在,大致经历三段演化和推进。让我们一起回顾整个过程,来看一下人工智能语音发生的几次技术跃进。

马文·明斯基

马文·明斯基

我们更应该铭记的还有图灵和冯.诺依曼。前者是密码破译之父和机器密码学之父,也是二进制思维的先驱。后者是现代计算机之父,在图灵二进程理念之下造出了现代计算机。

图灵

图灵

冯.诺依曼

冯.诺依曼和他的计算机

人工智能语音1.0:一问一答

现在,工智能语音技术在数码、电子、工业制造领域被广泛应用并且成为全民热议的话题,可是在发展之初它还有很多稚嫩的地方。关于人工智能时代的讨论有很多,但在消费层面上,真正大范围进入用户试用阶段的人工智能语音应用大概在2010年之后。这个阶段的人工智能语音技术形成了以语音交互为主的感知状态,我们暂且称之为第一阶段。

这时的人工智能语音应用通过算法的演变和大量数据的输入,在技术层面实现自然语音识别和语义理解,针对对话内容进行数据匹配,然后调取相关话题,从而实现简单内容的单向一问一答。第一阶段在自我学习、逻辑推力方面有很大欠缺,不能针对同一对话内容展开深入交互,横向拓展和纵向发展都不能满足用户需求。例如你问今天天气如何?他调取今天的天气数据。接着你问明天的天气如何?他调取明天的天气预报。今天天气和明天天气只是各自独立的对答,不能连接贯通,形成逻辑。

关于人工智能语音技术的研究,国外企业投入较早,且发展也比较全面。像Nuance,曾经在语音识别方面功绩卓著,到现在为止仍然是全球最大的语音技术公司,专利数量和市场份额都遥遥领先。之后包括亚马逊、苹果和谷歌,都在深度挖掘智能语音,推出自己的语音助手。据不完全统计,目前全球专业做人工智能语音的公司有上千家之多,后起之秀越来越多,涉及的领域越来越广。如总部位于奥地利维也纳的Cortical.io,主要提供新型自然语言理解(NLU)解决方案。由艾伦人工智能研究所和亚马逊Alexa基金等机构资助KITT.AI公司,开发可定制热词检测器(hotword detector)和对话引擎ChatFlow。旧金山的MindMeld公司可提供对话式人工智能平台等等。

众多的语音助手

人工智能语音2.0:有问有答

早在2000年,比尔盖茨曾经提出“未来10年是语音的时代”。我们目前所说的智能语音,学术界称为“自然语言处理”(来自百度)。业内人士认为,智能语音技术将会成为人类主流的人机交互方式之一,计算机技术与人工智能领域的发展为智能语音交互发展带来了希望。

人工智能语音交互的更深层阶段——对话,即有问有答,包含上下文逻辑。举个例子或许更好理解,如果一门课程上一年没开设,对于“这门课程去年有多少同学没通过”这样的问题,机器是回答“都没通过”还是“去年没开这门课”?同时机器还需要提前存储“去年没开这门课”的信息,想想我们从小时候啥也不懂到现在懂得的知识和信息,这是难以想象的数据量。再比如说“我想听周杰伦的歌”,机器只会将周杰伦的歌显示出来,并不能直接播放。就是说假如你要做一件事情,需要给机器一个明确的指令,否则,会让人很烦躁,因为你要一直说下去。

当然,“对话”层面,仍然停留在“人机对话”阶段,机器仍然停留在被动接受人类输入大量数据阶段,相比“问答”层面,只不过信息流、数据存储量更大,机器仍然不能更深层次理解人的意思,无法实现自学习、自成长,与机器的语音交流还不能像人一样自然。

波士顿动力公司的机器人发展史

波士顿动力公司的机器人发展史

人工智能语音3.0:自然交互

人工智能进入第三阶段,最大的进展就是交互的进展。不仅仅有问有答,不仅仅包含上下文逻辑了,人工智能硬件能够更多地融合各种环境信息,作出不同决策或推荐。也就说,在交互的过程中,机器有了更多的主动性,能够为人提供更多、更好的帮助,让人们的生活更便捷,更安全,更有趣。

有两个比较典型的应用场景,一个是智能汽车,一个是智能家居。

2010年,谷歌秘密研究的无人汽车项目被《纽约时报》记者曝光,当时引起了不小的震动。无人汽车即无人驾驶汽车,也叫智能汽车,主要是通过车载传感系统感知道路环境,并依靠车内的人工智能系统自动规划行车路线,到达预定目的地。

谷歌无人驾驶汽车在开放道路上行驶时,会对来往车辆、行人,路面环境信息进行识别与分析,为系统的决策判断提供依据。系统经过长期的“学习”后,人工智能具备的策略神经元将变得更加熟练高效,并形成类似于人的“感觉”,能及时处理驾驶过程中的突发情况。

2016年1月,美国国家公路安全交通管理局(NHTSA)在其网站上发布了公开信,表示根据联邦政府现行法律规定,谷歌的无人驾驶汽车采用的人工智能系统可以被视为“司机”。这被视为是人工智能发展里程碑的事件,也标志着“智能”可以像“人工”一样感知、判断、推理并做出决策,可以实现主动控制,也能更好地人机交互与协同。

在智能家居领域,人工智能的发展方向同样是人机交互、操作简单、通过大数据能够进行自主判断决策。

人工智能之AlphaGo人类围棋高手之战

2016年,Google Assistant伴随Google Home 正式亮相,抢夺亚马逊智能音箱市场。(亚马逊Echo在2016年的智能音箱市场占有率达到了巅峰的88%)

同年,科大讯飞上线DFCNN(深度全序列卷积神经网络,Deep Fully Convolutional Neural Network)语音识别系统。

同年11月,科大讯飞、搜狗、百度先后召开发布会,对外公布语音识别准确率均达到“97%”。

2017年3月,IBM结合了 LSTM 模型和带有 3 个强声学模型的 WaveNet 语言模型。“集中扩展深度学习应用技术终于取得了 5.5% 词错率的突破”。相对应的是去年5月的6.9%。

2017年8月,微软发布新的里程碑,通过改进微软语音识别系统中基于神经网络的听觉和语言模型,在去年基础上降低了大约12%的出错率,词错率为5.1%,声称超过专业速记员。相对应的是去年10月的5.9%,声称超过人类。

2017年12月,谷歌发布全新端到端语音识别系统(State-of-the-art Speech Recognition With Sequence-to-Sequence Models),词错率降低至5.6%。相对于强大的传统系统有 16% 的性能提升。

市场分析公司Canalys在2018年1月分布一份报告,其预测2018年将是普及智能音箱的“决定性一年”,相比全年出货量刚过3000万台的2017年,2018年智能音箱全球出货量预计将达到5630万台。

智能音箱

智能语音的诞生,为我们的生活带来了更多的方便与乐趣,做减法的生活,是否会助长懒人经济的持续运行,其实也是个未知数。但,科技不断的进步,方便人们的生活这一潮流始终是历史趋势,是所有人都应该正确面对的。只不过在未来科技到来的同时,我们要更加学会思考,我们的存在,到底是为何?我们究竟以什么样的方式来面对未来的科技生活才是关键,而非一味的批评与抱怨。

人工智能+大数据+云

交游天下是以智能语音交互为核心的互动小说平台,解放读者的眼睛和手,会写小说就能创作智能交互作品。加入我们,抢占爆发增长的新流量入口。

我们的交游天下APP即将上线,敬请关注我们官网的最新动态。

作品评论(0)

切换注册

登录

忘记密码 ?

切换登录

注册