仅靠 Synthesizer V 的技术还无实现的新型乐器:Instrument X 两位开发者揭秘AI 乐器音源的诞生幕后
仅靠 Synthesizer V 的技术还无实现的新型乐器:Instrument X 两位开发者揭秘AI 乐器音源的诞生幕后
Synthesizer V 的开发商 Dreamtonics 株式会社推出了全新的 AI 演奏合成软件 Instrument X,它打破了以采样音源为中心的传统软件音源的常识,堪称一场 DTM 音源的。如此自然的演奏、如此立体的声音,背后究竟有着怎样的开发故事呢?
最近,Dreamtonics 发布了一段介绍 Instrument X 开发幕后的。中出现的两位人物,分别是 Dreamtonics 及 AHS 的代表董事 Kanru Hua,以及作编曲家、以及可称为 Instrument X 前身的 AI 乐器演奏软件 Melia 的开发者中迫酒菜。这次,DTM Station的藤本健有机会对两位进行深入采访,听他们讲述 Instrument X 诞生之前一路走来的经历。
Dreamtonics 音源 Instrument X 的开发者 Kanru Hua(左)与中迫酒菜(右)
下面是 Dreamtonics 发布的。不过,这次还问到了许多连中也没有提及的幕后故事。
藤本:首先,请谈谈你们最初为什么会想到开发 Instrument X。
Kanru:其实,Synthesizer V 发布后很早就有用户向我们提出,希望它也能支持乐器。也就是说,能不能把用于歌声合成的神经网络技术,直接应用到乐器上呢?
藤本:确实,这是很自然的想。
Kanru:不过,真正开始研究后,我们很快就发现,人声和乐器完全是两回事。歌声以音素与发音之间的关系为基础,而乐器则涉及发声机制、演奏技等完全不同的因素。我们意识到,不能只是沿着 Synthesizer V 的思路继续做下去,而是需要为乐器建立一个专用的平台。
Dreamtonics 代表董事 Kanru Hua
藤本:话虽如此,Kanru 先生您自己也并不是乐器方面的专家,对吧?
Kanru:是的。也正因为如此,我一直在寻找能够把音乐和技术这两方面连接起来的人。
藤本:于是,您与中迫先生相识了。其实,介绍你们认识的正是我。
中迫:没错。我原本在个人开发一款名为 Melia 的软件,用 AI 生成乐器演奏。DTM Station 对它进行报道之后,我就以此为契机向藤本先生咨询了谁在这个领域更有见地。
作编曲家中迫酒菜,同时也是 Instrument X 前身 Melia 的开发者
藤本:中迫先生当时问我,接下来应该怎样推进,于是我把 Kanru 先生介绍给了他。这就是最开始的经过。
Kanru:不过,在那之前,中迫先生就曾经与 AHS 合作制作过弦卷真纪的官方歌曲。与中迫先生直接见面后,我们最先开始的也并不是 Instrument X 的开发,而是学习(笑)。中迫先生给了我一本书,内容涉及管弦乐队各种乐器的发声机制和演奏技、编制的组织方式以及如何阅读谱子和记谱。我就是从那本书开始学习的。
藤本:也就是说,Kanru 先生是从头开始学习乐器知识的。
Kanru:是的。那是一个与歌声完全不同的世界,对我来说既新鲜,也确实有必要。
藤本:中迫先生,您当初为什么会想要开发 Melia 呢?
中迫:我的本职是作曲家,也经常制作游戏BGM。有一次,我接到一个委托,希望在非常有限的预算下,做出品质可以媲美完整管弦乐队的编曲。不过,只靠当时使用的工具,要通过 MIDI 编程表现出人类演奏的细微感觉,非常困难。
藤本:预算不允许使用现场演奏,但又不想让音乐听起来像是 MIDI 编程出来的,就是这样的两难吧。
中迫:乐器即使只看其中一种,也非常复杂。单说小提琴,奏与拨奏的音色就完全不同。乐器本身的结构、指等各种因素复杂地相互作用,才形成了那种乐器特有的声音。我想,如果能像 Synthesizer V 那样,通过机器学习把这些再现出来,也许工作就能更高效。因此,在交付那首作品之后,我马上开始学习神经网络。在一位小提琴家朋友的帮助下,最终完成的就是 Melia。
藤本:听说之后您还尝试过把它做成编辑器。
中迫:是的。其实,在正式向 Kanru 先生咨询之前,有一段时间我尝试过独自制作编辑器。但如果采用一个音、一个音依次生成的方式,延迟无论如何都会变得很大,没能做出以实用速度运行的程序。于是,我一度判断,只靠自己一个人很难把它完成。
藤本:所以,后来又重新向 Kanru 先生咨询,是这样一个过程吧。
中迫:正好在那个时候,Melia 开始在海外的网络等地方引起讨论,也陆续有几家海外公司向我接洽。但那个规模已经不是我一个人能够应付的,所以一边向藤本先生咨询,一边又把这件事带到 Kanru 先生面前讨论(译者注:早在2023年Melia就已经在日本作曲家圈子里传开了)。
藤本:之后,就进一步发展到了 Instrument X 的开发。
中迫:在制作 Melia 的过程中,我也意识到了自己的局限。有些事情,仅靠神经合成是做不到的。让一种乐器的声音独一无二的,不只是乐器本身的结构,也与它在什么样的空间里演奏有很大关系,也就是录音棚或音乐厅。这个发现,后来就成为 Instrument X 在声学方面采取相应方的契机。
藤本:你们两位是怎样分工的?
Kanru:AI 技术、音响处理以及销售相关事务由我负责;中迫先生则负责从音乐角度出发的整体工作,包括易用性,也就是从用户的角度来看,采取怎样的方才能让产品更好。准备什么样的数据、按照怎样的比例准备,这些设计也由中迫先生负责。
中迫:引擎代码本身并不是我写的。说实话,我也会好奇那些代码究竟是什么样子(笑)。不过,比起这些,我觉得站在用户的角度,不断把意见告诉 Kanru 先生,最终更能做出好的东西。
藤本:毕竟,中迫先生本来就是作曲家,工程师并不是您的本职。
中迫:是的。我们各自集中在最擅长的部分,在同时开发多达15种乐器的过程中,我认为从效率上来说,这确实是正确的选择。
藤本:第一篇文章里也介绍过,Instrument X 有 Adagio、Allegro、con Fuoco、Pop、Ballade 这五种风格能。选择这五种,有什么原因吗?
中迫:我认为,如果只采用古典音乐的速度术语,就无覆盖如今 DTM 用户创作的曲风。Adagio、Allegro 和 con Fuoco 在管弦乐语境下比较容易使用,而 Pop 和 Ballade 则更便于贴近现代歌曲。所以,我们有意加入了性质不同的风格。我希望找到一个平衡,让古典音乐作编曲家,以及制作流行音乐或游戏音乐的人,都能自然地使用它们。
藤本:也可以谈谈 AI Retakes 能的用意吗?虽然这本来就是大家在 Synthesizer V 中已经熟悉的能。
中迫:是的。这项能来自 Synthesizer V。不过,我们把它加入乐器软件,是基于这样一个前提:乐器演奏也往往无一次就达到想要的效果。真人演奏时,也经常会说“再演奏一遍试试”,对吧?我希望用户能够用同样的感觉,轻松、反复地尝试音高或音色上的细微差异。保持发音和动态不变,只重新生成演奏中“表情”的部分,是因为我们希望在 DTM 中,也能再现实际录音现场挑选不同演奏版本的感觉。
藤本:接下来,请谈谈 Instrument X 的一大亮点——麦克风混音器。使用多支麦克风进行混音,这样的用户界面在以往的采样音源中应该也存在。
Kanru:界面看起来相似,但背后的机制完全不同。用多支麦克风录制像滑奏这样音高不断移动的演奏时,在真实的录音棚里,声音先到达近处的麦克风,稍晚一些到达远处的麦克风,随后从墙壁反射的声音再返回来。这样就会产生时间差。单纯的神经音频合成无很好地保持这种时间上的先后关系,结果在立体声聆听时,声音就可能显得平面化,或出现相位错乱、带有“phasey”感的声音。
藤本:所以,你们想把声音传播的规律本身,纳入网络之中。
Kanru:是的。如果是歌声,可以用简单的脉冲响应,也就是 IR,来再现空间。但乐器就没那么简单。随着频率变化,声音会朝乐器周围360度中的哪个方向发出,会发生相当随机的变化。因此,我们需要的是具有各个方向特性的 DRIR,也就是 Directional Room Impulse Response,方向性房间脉冲响应。
藤本:就是8月4日公布的 Instrument X 预告里的那个十二面体扬声器吧。
手持十二面体扬声器的 Kanru
Kanru:没错。它的正式名称是“十二面体扬声器阵列”,其中12个扬声器都可以控制。我们用它向录音棚的各个方向发射声束,从而测量房间的反响特性。
中迫:把测得的扬声器特性,反向应用到已经录好的多麦克风音源上,就能提取出乐器本身原本朝什么方向、以什么方式辐射声音的数据。然后再把想要的录音棚的方向性 IR 应用上去,就能再现出仿佛在那个录音棚里录制的声音。这就是它的原理。
藤本:明白了。这与单纯“给音源加上混响”的思路完全不同。所以,即使增加麦克风数量,也不容易出现相位关系失控,而且渲染速度也很快。
Kanru:正是如此。
藤本:实际的乐器录音,是由谁负责的呢?
中迫:所有录音都委托给了 KM Works的三國浩平。我与三國先生在十多年前就认识了,算是御宅族伙伴那样的关系(笑)。他是一位录音工程师,但不止如此,他也是作编曲家和指挥。因此,不只是声学方面,连音乐方面在内,录音相关的事情都可以全面托付给他。
负责 Instrument X 全部录音工作的 KM Works 三國浩平
藤本:也就是说,不只是架设麦克风录音,还包括指导演奏。
中迫:是的。例如,根据事先用十二面体扬声器测得的录音棚特性来布置麦克风,诸如此类相当专业的部分,也都请他负责。我们是在日本屈指可数的专业录音棚中录制的。我想,即使在采样音源里,也很少有在这么好的环境中录制的产品。这也是 Instrument X 的一大特点。
录制 Instrument X 的录音棚俯瞰照片
藤本:我也听三國先生说过,麦克风本身的选择也非常讲究。
中迫:是的,三國先生会根据乐器来选用不同的麦克风。例如,双簧管和巴松管的近距麦克风使用 Neumann U67;铜管以及低音提琴以外的弦乐器,近距拾音使用 Neumann M49。长笛和单簧管使用 AKG 414,低音提琴则使用 Neumann U47 Tube。确实是为每一种乐器选择最合适的麦克风来录音。
巴松管的近距拾音使用了 Neumann U67
藤本:铜管声部有什么不同吗?
中迫:铜管除了上述麦克风之外,还另外架设了一支 Royer Labs R-121 铝带麦克风。据三國先生说,Decca Tree 使用 SANKEN CO-100K,环境拾音使用 B&K 4006,宽距麦克风使用 SCHOEPS CMC-55U。
装有 SANKEN 麦克风的 Decca Tree
藤本:麦克风前级方面呢?
中迫:远距拾音这一侧使用 Over Quality 的前置放大器。据说它的特点是声音干净、信噪比高。而近距拾音这边,为了获得更厚实的声音,则搭配使用 Rupert Neve Shelford 5025。我听说他们是这样分别选用的。
Over Quality 的高品质前置放大器
藤本:这已经是相当发烧的话题了(笑)。
中迫:是的。不过,我认为也正是因为在录音上如此讲究,才产生了 Instrument X 这样真实的声音。
藤本:最后,也请聊一点轻松的话题。Instrument X 这个名字是怎么确定的?
Kanru:每次最难的就是起名字(笑)。最初,我们在公司内部提出了大约50个候选名称,再缩减到20个进行。但日本团队与海外团队各有不同的喜好,一直很难统一意见。
藤本:最终决定用“X”的关键是什么?
Kanru:它可以与“V”形成对照,又带有类似变量的感觉,而且标志也容易设计。能够让人容易理解它与 Synthesizer V 之间的关系,这一点也很好。
藤本:顺便问一下,您还记得排名第二的候选名称吗?
Kanru:当时也有 Synthesizer I、Instrument I、Instrument 1 这样的方案。不过,最终还是定下了 Instrument X。
藤本:那些名字也挺让人好奇的(笑)。感谢二位今天分享这些宝贵的故事。
在采访最后,中迫先生还说了这样一段话。
中迫:我们特别重视的是,软件应该自动处理的部分,与用户希望按照自己的意愿调整的部分之间的平衡。我认为,如果在这里处理不当,软件就可能成为剥夺用户个性和创造力的工具,或者反过来,变成现有采样音色库的翻版。今后,我们还计划持续增加音乐和技术方面的能,包括现代音乐等目前市场上还没有相应产品的领域。
据介绍,Dreamtonics 从 Synthesizer V、VOICEPEAK、Vocoflex 到这次的 Instrument X,都坚持一款产品对应一个理念的方针。歌声归歌声,乐器归乐器,看来每款产品都会继续沿着各自专注的方向发展。今后的更新与产品阵容扩充,也值得我们继续关注。
藤本健
以 DTM、数字录音和数字音频为主要写作领域的作者。自2001年起,也在 Impress 的 Watch 连载 Digital Audio Laboratory。著有《Cubase 彻底操作指南》(Rittor Music)、《VOCALOID 技术论》(Yamaha Music Media)等多部书籍。爱好是太阳能发电,自2004年起使用太阳能为自己家中供电,目前还运营着三座发电站,是一位发电站站长。