向右滑动:上一篇 向左滑动:下一篇 我知道了
广告

人工智能生成的声音可以欺骗你的耳朵

MIT开发出一款人工智能系统,该系统可“观看”无声视频并生成该视频应该包含的声音……

人工智能已经突破了一项声音障碍。麻省理工学院(MIT)的研究人员开发了一款人工智能系统,可以“观看”无声的视频并且生成一段声音,效果十分逼真,以至于多数观众无法分辨出这些声音是否是计算机生成的。dDDesmc

MIT计算机科学和人工智能实验室(MIT Computer Science and Artificial Intelligence Laboratory)称,其“深度学习算法”是头一个通过“声音图灵测试”的,生成的声音能够以假乱真。
20160616-AI-1
这款视觉指示声音系统(Visually Indicated Sounds,简称Vis)受到训练,能够对棍子击打、刮擦或者捅一系列物体(从树叶、水到土壤和钢铁)时发出的声音进行分析。dDDesmc

研究人员称,Vis的本领可以延伸至很多其他场景。例如,未来的版本可以为电影和电视生成比传统方法(比如在铝箔上撒盐以模拟雨声)更逼真的声音效果。dDDesmc

该项目的负责人安德鲁•欧文斯(Andrew Owens)称,更重要的应用或许是帮助机器人理解物体的物理属性、更好地与它们所在的环境互动。该项目将于本月晚些时候在拉斯维加斯举行的计算机视觉与模式识别大会(CVPR)上展出。dDDesmc

“机器人可以看着人行道、本能地知道水泥地是硬的而草地是软的,因此知道如果它踩上两种地面会发生什么,”他说,“能够预测声音,是预测与世界进行物理互动的后果的重要第一步。”dDDesmc

该MIT团队“训练”Vis的方法是,向其输入包含4.6万种声音的1000段视频,这些声音是鼓槌在不同坚实度的物体上敲打或划过而产生的。之后,帮计算机在大量数据中找到模式的“深度学习”算法对这些声音进行解构。dDDesmc

为了从无声视频片断中预测一种新声音,Vis会查看最可能与每个视频画面相关的音频属性,并把这些音频串在一起编辑成连贯的声音。Vis可以模拟快节奏和舒缓的微妙声音,无论是断断续续拍打岩石的声音,还是穿过常春藤时发出的细小沙沙声。它既可以模拟击打垫子发出的低沉砰砰声,又可以模拟敲击栏杆时发出的刺耳声音。dDDesmc

为了测试这些声音在人耳听起来的逼真性,研究人员对400名观众进行了调查。他们观看了两遍视频,其中一遍听的是真实声音,另一遍听的是Vis的模拟版。他们要说出哪一次是真实的声音。dDDesmc

如果Vis生成的声音与真实的声音无法区分,Vis版被选择的概率应为50%。结果调查得出的概率为40%,这是一个相当不错的分数。dDDesmc

当声音清晰、尖锐时——比如敲木头或金属的声音——该系统的表现最差,在生成由树叶或泥土产生的较轻柔、持续时间较长的声音时,Vis表现最好。有时,如果棍子刚好停在目标物之前,它还会“幻想出”假的敲击声。dDDesmc

欧文斯的梦想是在没有明确视觉线索的情况下让Vis模拟声音。“从微风轻抚、到笔记本电脑的嗡嗡作响,任何时候环境中都存在着许多与我们正盯着看的东西无关的声音,”他说。(来源/FT中文网)dDDesmc

20160613-ESMC-1dDDesmc

Edit
本文为国际电子商情原创文章,未经授权禁止转载。请尊重知识产权,违者本司保留追究责任的权利。
  • 微信扫一扫,一键转发

  • 关注“国际电子商情” 微信公众号

您可能感兴趣的文章

  • 制造商在芯片设计中受益于AI的5种方式

    芯片设计中的人工智能(AI)是该技术在制造业中最有前途的应用之一。它有望更快、更准确地制造芯片,同时减轻劳动力的压力。

  • NVIDIA Q1营收下降13%,AI增速超过10%,未来将达一万亿美

    美东时间 5月24日周三美股盘后,NVIDIA发布了一季度财报。财报显示,第一季度收入 71.9 亿美元,环比增长 19%,数据中心收入达到 创纪录的42.8 亿美元,2024 财年第二季度收入预期为 110 亿美元。

  • 为了搭建好的AI基础设施,英伟达也是蛮拼的

    没有人会相信近十年间,与训练模型和数据相关的计算量会扩大100万倍。而在生成式AI需求爆发式增长的背景下,行业更需要进行充分的供应链准备,以满足全球对AI的需求,这也是黄仁勋之所以多次强调加速计算的原因所在。

  • 瑞萨公布MCU最新路线图

    近年来,很多厂商开始尝试在MCU中融入AI功能,瑞萨电子也是关注MCU+AI的厂商之一。

  • ChatGPT的现象级爆红,可带来哪些半导体产业链机遇?

    AI领域的从业者认为,ChatGPT是AIGC(AI Generated Content,利用人工智能技术来生成内容)应用的新起点,随着深度学习模型不断完善、开源模式的推动、大模型探索商业化的可能,AIGC有望进入应用爆发期。ChatGPT技术的商用落地,对半导体行业有哪些推动作用?

  • Arm真能吃下30%的个人电脑市场?言之过早吧...

    11月份的一份报告提到,2023年的笔记本市场上,13.9%的份额将归属于Arm架构处理器。虽说相较于主流的x86还有距离,但比之2020年的数据已经是10倍成长了——当时Arm笔记本仅占到市场的1.4%。

相关推荐

可能感兴趣的话题