2026年9月15日火曜日

【2026年秋】 鏡音リン・レンNTの調声について - おやつP (名誉会長P)

概要

鏡音リン・レン NTの調声に関しては 研鑽を重ねていますが、より一般的で、かつ結果がしっくりくるものを見つけたのでこちらに更新を書いておきます。以前の記事で記したものとは根本的に異なりますが、ニンゲンのボーカルにも流用できる汎用性のある方法です。


先に、どのくらいになったか、作例を挙げておきます(作例がないとただのズルい作文なので)。


https://piapro.jp/t/J_Fd

https://piapro.jp/t/cUTg

https://piapro.jp/t/55-R


その上で、これがどういう手法かを記しておきます。私の提案するごく個人的な方法ではありますが、鏡音NTユーザーに何らかの参考になればと考えます。また、ざっくりとした方法はこちらをお読みになっていただけたらと思います。


基礎と前提

今回の基本は、「FET (1176)→LA2A」というコンプのつなぎです。これだけで大分効果があると思います。リダクションは、これは教科書的で嫌な表現ですが、これから挙げるコンプをいくつ足しても、トラックでは「6db以内」に留めると上手くいく、と思います。

また、今回の前提は、エディタでの「ベタ打ち」で、マスタリングで昨今のJ-POP程度音圧を上げる場合に有効な方法です。したがって、この記事の想定読者は、鏡音NTを手にして、他者に理解できるように歌わせたいし喋らせたいDTM初心者です。

あくまで私個人の率直な感想ですが、(しばしば網羅的なもので「DTM初心者向け」、として解説されているように)エディタで余計なことを少しでもすると、鏡音NTの調声に関しては大抵ダメになります。一貫してDAWでの音響の編集に徹しましょう。ピアプロスタジオでのVoice Voltageだとか、Vocal Morphingだとかは、今後DTMをやっていくにあたって流用も効かないし、とりあえず無視で大丈夫です。出力する時の音量だけ-6db程度に下げてやると、デジタル的なビビリが出ないので、そこだけ注意してあげてください。

トラックで済んでしまう人もいると思いますが、応用編で「ボーカルバス」についても詳述しておきました。お好みで読んでいただけたらと思います。

それでは、「FET (1176)→LA2A」というコンプを基礎にして、展開していきます。


詳細


以降述べる工程を、GoogleのAIに表にまとめてもらいました。

段階順番処理 / プラグイン例主な設定・狙い
準備1EQ(ローカット)120Hz以下をスパッと切る。後段のコンプが低音で誤作動するのを防ぐ。
↑2ディエッサー(1段目)4.5kHz前後を狭い幅で瞬間的に-9dB強力に削る。NT特有のシュワシュワ感を完全消去。
↑3デジタルコンプ
(Oxford Dynamics / Pro-C 3など)
瞬間的に飛び出すアタック(ピーク)を事前に優しく削っておく。
基礎4FETコンプ(1176系)大きなピークを叩く。アタック・リリースは共に「相当遅め」。リダクションは-3dB目安。
↑5オプトコンプ(LA-2A系)全体を滑らかにする。リダクションは-0.5dB程度で薄く。Volumeの上げすぎによる歪みに注意。
味付6アップワードコンプ
(Waves MV2 / OTTなど)
薄くかける。 鏡音NTの繊細な「ブレス(息遣い)」を持ち上げて存在感を出す。
↑7Pultec系 EQ10kHzを「3dBブースト&3dBカット」(同時押し)。LA-2Aでなまった高域の抜けを取り戻す。
↑8Abbey Road RS124「cutter」モード / Super Fuseをオン。 アタックを滑らかにし、パワフルにする(赤ランプに注意)。
↑9サチュレーター薄くかけて艶を出す。 ここでトラックの最終的な音量を整えておく。
バス-【ゲイン調整】※ボーカルバスに送る直前で、全体のゲインを「-18dB」までガッツリ絞る!
↑10VCAコンプ(SSL系)アタック30 / リリース1.2(またはAuto) / レシオ2。リダクション-2dB目安でトラックを接着(Glue)。
↑11Abbey Road TGインプットフラット(0dB)/ コンプ「Original」。ハイパスを軽く。M/S処理はマスタリングに回す。
↑12ディエッサー(2段目・3段目)8kHz周辺を軽く削る。子音が強ければさらに12kHz周辺にも設置(マスタリング時の曇りを防ぐ)。
仕上13リミッター最終的な音量の引き上げ。 昨今のJ-POP基準まで、ここで一気に音圧を上げて調整する。

・トラック

とにもかくにも「FET (1176)→LA2A」というコンプが今回の基礎です。あとは、せいぜい料理についてくるパセリか、あるいは英語の副詞のような「おまけ」程度に考えてください。

まず、最初は準備です。EQでローカットをします。後段にたくさんコンプを使うので、なにをいっているのか、意味内容を掴むのに不要な帯域をカットします。これで、コンプの誤動作(意図しない動作)も防ぐことができます。どのくらいかは人それぞれですが、とりあえず120Hzまでの低域を切ります(後からある程度音圧を上げる前提ですので、これくらいローカットしておきます)。

次に、ディエッサーです。4.5kHz前後を狭い幅で、メーターを見たときに瞬間的に-9db程度かかるように、強力にリダクションします。これで、鏡音NTのそのまま出力した時のシュワシュワとした感じをかなり抑え込むことができます。これがニンゲンだったらこんな極端なリダクションはしないのですが、どうも4kHz周辺は合成された音声ではよくピーキーになります。

ここで、デジタル系のコンプで瞬間的なアタックを削ります。Oxford Dynamicsを使用しましたが、Logicの標準にもありますし、FabFilter Pro-C 3など、似たようなもので大丈夫です。

ここからが、基礎で提示した「FET (1176)→LA2A」の組み合わせです。Logicの付属コンプでも構わないのですが、UAなど他にいいものがあるので、調べてみてください。

さて、ここではまず1176系で、大きめのピークを削ります。FETはVCAコンプ(GlueといわれるSSLなどが有名)に次いで動作が速い部類なので、アタック、リリースともに相当「遅め」に設定します。VUメーターを睨んで、-3db程度で戻ってくる感じを目安にリダクションします。

そして、LA2A 系(いわゆるオプトコンプ)を挿します。ここでは、あまりゲインリダクションにこだわらず、-0.5db程度VUメーターが動けばいいと思います。左側にvolumeがあるのが一般的ですが、あまり上げ過ぎると後置するEQなどでピークを超えてしまい、歪みが増える可能性がありますので、少し音量が戻る程度に留めます。

ここまででも、結果はなかなか良好で納得できるのですが、芸の幅は広く持たせた方がよいので、少し欲張ってみます。ここで、鏡音NTの繊細なブレスの部分を上げるために、Upward系(OTTなどが有名)のコンプを薄くかけます。私はWavesのMV2を使いましたが、もしかしたらOTTでもいいかもしれません。

さらに、PultecというEQで、10kHzを3db程度上げて、同時に3db程度下げます。これで、高域のディエッサーの補助になります。また、LA2Aで少しなまってしまった高域を取り戻す役割にもなります。このあたりはもうお好みです。

さて、次にかけるのはAbbey Road RS124です。喋らせるときに、これを入れておくとパワフルかつ、アタックが滑らかになります。なにも弄らずにcutterにして、Super Fuseをオンにしただけですが、効果はあったのでかけてみました。あくまで基本は先に提示したFET1176系とLA2Aなので、これもリダクション目的のコンプというよりは、味付け程度です。この辺り、アナログモデリングなので、ピークを示す赤ランプがつかないように気をつけてください。

トラックの最終段はサチュレーターです。これも薄く掛けて艶を出す程度です。ただし、この後にボーカルバスがあるので、ここで音量を整える形にすると、後の作業が楽になると思います。ハモリがある場合は、ハモリパートがひとつであれば、ステレオで処理し、その後にディレイを片チャンネルだけ20ms程度かけて、整合性をとるのもいいと思います。

・ボーカルバス

ここからは多少の応用編です。ボーカルトラックができたら、ボーカルバスに送ります。先に音量を上げなくていいといったのは、ここでまずゲインを-18dbまで絞るためです。

ここでVCAコンプのSSLを使います。スレッショルドは、ゲインリダクション-2db程度を基準に、VUメーターと他のパラメーターを睨みながら調整します。Make-Upはリダクションで下がった分を取り戻す程度、アタックは30、リリースは1.2にします(Autoでもよさそう)。レシオは2。アタックリリース遅めで圧縮せずに、いわゆるGlueにするというもので、この辺りは鉄板設定です。

次に、Abbey RoadのAR TGです。マスタリングでも使うので、入力はフラットで0dbにしましたが、テープにしたり、インプットを突っ込んだりしても面白いかもしれません。ステレオ設定で(ミッド・サイド処理もできますが、私はこれをボーカルバスではなくてマスタリングで使います)、EQは適当。フィルタはハイパスだけ軽くかけています。コンプはやはりほとんどリダクションをせずに、オリジナルを選んでいます。これは、モダンモードの方が扱いやすいですが、後段で音量を必要としない理由があるので、私はオリジナルにしました。

それで、2段目のディエッサーです。8kHz周辺を軽く削っています。ここで子音が強い場合は、この後にお好みで3段目に12kHz周辺のディエッサーを設置してもいいと思います。マスタリングでこの帯域を設定すると、場合によりストリングスの高域やハットと被るので、個別処理しないとクリアネスが減退するかもしれません。

最後にリミッターをかけます。音量が気に入らない場合はここで一気に上げて、調整します。


最後に

あくまで、作例に基づいた一つの例として受け取っていただけたら幸いです。

あと、トラックの処理で済んでしまう場合が多いと考えます。その場合、繰り返しになりますが、重要なのは基礎で提示した「FET (1176)→LA2A」の組み合わせです。これも、もっとうまい組み合わせがあるのかもしれません。そうしたら、是非教えてください、よろしくお願いいたします。

今後の展望としては、いいマルチバンドコンプを購入して、トラックの時点で不要な倍音を抑えたいということです。倍音が豊かというか、暴力的にちくちく出ているのが鏡音NTなので、なんとか抑えられないかなと。現状はマスタリングで一応FIRのマルチバンドコンプを使い、泣く泣く抑えています。

ついでに初段の方のEQとディエッサーの画像貼っておきます。なんらかの参考になればと考えます。ではでは。






2026年1月29日木曜日

AIとその限界を文化人類学的に考える

ボイスチェンジャーが面白いと数年前にぶっちぎりPさんがおっしゃっていて、昨今のVOCALOIDの品質にも飽きてきたので、色々考えて「じゃあ自分で作ってみるか」ということになり、これまで持っていた理論をコーディングして落とし込んだら、意外にも2〜3日で「歌声を他人の声質に変換するもの」ができてしまいました(公開する予定はないし、パッケージングして公開するだけの技術もないのですが、動くものはあるので興味があればお問い合わせください)。


DAC(Descript Audio Codec)で抽出したLatentをWhisperで分析にかけて、ソースのLatentからピッチと内容をを抽出し、ターゲットのlatentから声質を抽出、その後DiTとFlow-matchingで推論し、再びDACで合成する。こういうと訳がわからないけれども(そのうち理解されるだろうとは考えていますが)、そういうことをやっているうちにひとつ理解したことがあります。


この作業には、現状では、NVIDIAのGPUかApple Silicon以降のMacが必要です(例外として、Google Colabのようなサービスや、AMDへのCUDAからの翻訳はある)。これが、大企業や専門的企業が消費者向け販売に踏み出せない理由でもあり、一般化の阻害要因だと考えます。一方で、大衆化したVOCALOIDムーブメントのように、醜いビジネスコンテンツの氾濫には発展していない今は、この手のプログラムにとっては平和で牧歌的な時代でもあります。


しかしながら、GPU普及のロードマップなどを考えると、概ね10年後にはこの状況が一般化するのではないかとも漠然と推測します。


そのうち、ひとつ理解できたことがあります。「浮遊するシニフィアン」の問題です。これは、記号から意味内容を思い浮かべることができない、という、クロード・レヴィ=ストロースの示した、ソシュール言語学への批判的展開なのですが、どうやらヒトはあらかじめ学習済みの「知識」と、短期間におけるその場の「学習」によって、これを分類しているのではないか、と。


これは、実際問題ヤコブソンとあの三角形では理解しにくい。いわゆるAIの処理では、誰がいったか(formant)、何をいったか(content)、抑揚は(f0)など、まずソースを細かい分類に分けていきます(latent)。もちろん、被りはありますが、これら「特徴量」を、まあその特徴しか扱えないけれども、高次ベクトルに抽象したその後、さらに推論にかけます。この推論のときに、いかに短時間で済ませるか(zero-shot)がトレンドですが、私はこれは「学習済みデータを参照することで、未知の知識をいかに判断するか」である、と考えています。


その学習の仕組みが、語の持つ定義の違いを文脈から判断させている。そこでは、「民主主義」や「マナ」のような記号はどう扱われるでしょうか。やはり、空白のままです。しかし、例えばAIの安倍晋三氏は話すでしょう。「民主主義と自由」と。


真面目に勉強した文系諸氏なら、ここでAIが文系を超えてこないことを理解できるでしょう。私たちは、空白を埋め続けます。そして、納得するのです。AIにはそれができない。場合によっては出力を誤魔化します。つまり、ここが現時点でのAI推論の限界であり、AIに政治ができないことも示しています。


AIによる言語処理は大変明確で理解しやすい側面があります。ぜひ、ヒトとの差分をとって、考えてみてください。きっと知識欲が満たされます。ところで、代替不可能な「誰が話しているか」を考えると、「スペクトル包絡」となります。あるいは、その残差信号をもって、「その人」が話していると、ヒトもAIも判断するでしょう。このとき、位相は捨象されています。いわゆるモノ化です。位相を持つということは、多数話者の選別プロセスでしょうけれども、代替不可能な個は確固として位相を持ちません。逆にいえば、複数話者によって、位相が際立ってくるために、「その人」を判別できます。これも興味深い事実です。


2025年11月23日日曜日

鏡音リン・レンNTの調声について - おやつP (名誉会長P)

この記事は古いものです。最新の成果はこちらをご参照ください。より詳細があります。





【鏡音レンNT・調声参考動画】 さよならリサイクル 【オリジナル曲】

https://www.youtube.com/watch?v=_3IhdjWqcwA


MP3はピアプロからどうぞ


動画ではそんなに重要ではなさそうなものは割愛してありますが、ここでは使用したプラグインを一覧にまとめておきます。よろしければご参照ください。鏡音リン・レンNT共通で使えるかと思います。

  1. Melodyne Studio:ピッチ修正ソフトです。今回はほとんど使っていません。お守り?
  2. Oxford Trans Mod:滑舌がよいので、アタックを削ります
  3. OneKnob Phatter:トラックに直差しするとファットな音になります。1.2程度かけました
  4. Oxford Dynamics:デジタル系のコンプです。レシオ深め、スレショ深め
  5. Abbey Road RS124:ヴィンテージ系コンプ。しっかりかかるのでパラメーターは味付け程度
  6. Oxford SuprEsser HR:ディエッサーです。そんなにはかけていない
  7. Abbey Road Saturator:サチュレーターです。これもサチりは浅め
  8. Smack Attack:2. のTrans Modでアタックを削った分、今度はアタックを足します
  9. Vitamin:補正です。EQは使わずに補正で足ります(EQでは低域も切らないです。余計なことすると面倒)
  10. Oxford Reverb:Studioというプリセットを12くらいかけてます。トラックに馴染ませます
  11. L2:マキシマイザーですが、実質リミッターとして使用。DAW内部は64bitフロート処理なので、ここでピークを切って、その後でマスタリングでもリミッターかけたら、音圧レベルもいい感じになります。L2でなくてもいいと思います

今回、エディタでは最低限の調声しかしていませんが、子音の調整など独自の機能は他の曲でよく使いました(れれれPさんによるこちらを参考にしました)。NTでは、エディタが重要になりますが、その記事はもう有名な方が書かれているということで、私は「音響」の方面でいろいろやってみました
あと、滑舌が気になったら素直にその部分の子音をオートメーションで突き上げますが、今回はやっておりません。

鏡音NTの調声は情報が少ないし、実際どこまでできるのかよくわからないのですが、あくまで一例として提示しました

では、よい鏡音リン・レンNTライフを

2024年8月28日水曜日

新曲・リマスターのお知らせ

 こんにちは。

たくさんあります。まずこれ


「俺のロードローラーだッ! 2024」

https://piapro.jp/t/5ep9


リマスターシリーズです


「ド・ラ・イ・ブ! - Drive Me Flat 2024」
https://piapro.jp/t/JYIw

「No Thank You 2024」
https://piapro.jp/t/6u7W

「あわぶくゆうれい 2024」
https://piapro.jp/t/yg6g

「14歳の恋愛 2024」
https://piapro.jp/t/vaUJ




以降、GUMIさんです



「日清戦争」
https://piapro.jp/t/GB-y

「椅子と机 2024」
https://piapro.jp/t/8SZR

「知りたい 2024」
https://piapro.jp/t/LkQn

「移動できない」
https://piapro.jp/t/kHqZ

「コミュニティ・ベル」
https://piapro.jp/t/A6PY

たくさんですが、聴いていただけたら嬉しいです。それでは!

2024年6月15日土曜日

Love ☆ Peace

 

☆

On sale to critical acclaim.

https://honorarychairman.booth.pm

Please enjoy delicate and beautiful videos up to 4K HDR. ☆Below are the staff members of the team.☆ ・名誉会長P (企画・楽曲 - Plan, Produce and Music-Maker) Twitter hc84290207   ・薛南 (歌唱 - Vocal) Twitter setsunann_vocal   ・小山鹿梨子 (イラスト - Illustration) Twitter h_shibasyon   ・DaLq (動画 - Movie) Twitter dalqxxx   Thank you for your patronage.😊

Please feel free to use them. (BGM, broadcast, podcast, reproduction.. etc.)


If you use this content, it would be appreciated if you could describe and report it on the form that each service has.


商用・非商用に限らず、ツイキャス配信、BGM、転載など、ご自由にお使いください。その際、フォームがある場合には、記載ならびにご報告いただけると嬉しいです。