1 ポイント 投稿者 GN⁺ 2023-10-04 | 1件のコメント | WhatsAppで共有
  • Weird Al Yankovicのパロディ曲を元の歌手の声に戻そうとする実験は、音声クローンが単に声だけを変える技術ではなく、発音・イントネーション・歌唱の癖まで一緒に表れることを示している
  • A.I. カバーのコミュニティは A.I. Hub Discord と Hugging Face を中心にモデル・ツール・ノウハウを流通させており、非商用の実験と著作権のグレーゾーンが絡み合いながら急速に拡大している
  • Michael Jackson、Madonna、Kurt Cobain、Lady Gaga、Lorde のモデルを使っても、入力ボーカルの音域と Weird Al 特有の誇張された発声が残り、結果は元の歌手というより Weird Al の影に近いものになる
  • Google Colab と AICoverGen は、GPUを持たないユーザーでも A.I. カバーを作れるようにし、Kits AI・Voicify AI・Voiceflip・voicemy.ai・covers.ai などのアプリは使いやすさのハードルを下げている
  • RIAA による著作権上の圧力と Discord による A.I. Hub の永久停止は、音声クローンが面白いインターネット実験を超えて、コミュニティ運営と音楽業界の法的衝突へ広がっていることを示している

Weird Al の曲を元の歌手に戻す実験

  • 映画 Weird: The Al Yankovic Story の設定を出発点に、Weird Al Yankovic のパロディ曲が元曲で、元の歌手たちがそれをカバーしたらどんな音になるのかを A.I. 音声クローンで実験している
  • 最初の対象は、Michael Jackson が Weird Al の「Eat It」を歌うケースだった
    • Michael Jackson の元曲は Weird Al のパロディより低く調整されており、ボーカルはより高く歌われているため、ボーカルを1オクターブ上げ、曲全体を半オクターブ下げて合わせようとした
    • アーティファクトを除いても、結果は Michael Jackson というより、Weird Al をまねる Michael Jackson のように聞こえ、パンチラインがよく聞こえるように誇張された発音がそのまま残った
  • Michael Jackson の A.I. 音声モデルを6つ試したが、結果に大きな差はなかった
    • あるモデルは7時間分のボーカルを300 epochsで学習していたが、一般的に良いモデルには15分以上のクリーンな音声は必要ないと考えられている
    • Fat」の実験には、DestinyOff The WallThriller の曲で学習されたモデルを使用した
  • Weird Al の独特な声と発音は、別の A.I. 生成音声で覆っても簡単には消えず、実験全体に奇妙な残響を残す

A.I. カバーコミュニティとモデル流通の仕組み

  • A.I. カバー曲コミュニティの中心には、50万人以上が集まる A.I. Hub Discord があり、メンバーはノウハウ・ツール・技術・元曲やカバー曲のリンクを交換していた
  • コミュニティは毎日、数百の新しい音声モデルを Discord のスレッドデータベースに追加している
    • 人気カテゴリはミュージシャンだけでなく、架空のキャラクター、アニメキャラクター、YouTuber・ストリーマー、有名人にまで広がっている
    • 最近のモデル例として Francoise Hardy、Donald Duck、VCHA の全メンバー、Markiplier、Tom Waits、LeBron James、Knuckles、Adolf Hitler が登場している
  • モデルに関する議論やリンクは Discord 上で行われるが、ファイル自体はほぼすべて Hugging Face にアップロードされている
    • Hugging Face は2023年8月、Google、Amazon、Nvidia、Salesforce、AMD、Intel、IBM、Qualcomm などが参加した Series D で2億3500万ドルを調達し、評価額は45億ドルだった
    • A.I. Hub はモデル登録に Hugging Face のリンクを求めており、AICoverGen も UI と例の中で Hugging Face モデルへの直接リンクの使用を推奨している
  • 一部のユーザーは、他人が作った数百から数千のモデルを巨大なリポジトリに集めている
    • あるアカウントは、有名人、ミュージシャン、アニメキャラクター、YouTube 関係者など、ほぼ4,000個の音声モデルを保有している

著作権上の圧力と A.I. Hub の停止

  • RIAA は A.I. Hub を把握しており、音声モデルの学習に使われた元の著作権付き楽曲データセットのアップロードを問題視していた
  • 2023年6月、RIAA は Discord に対して A.I. Hub の閉鎖、侵害ファイルへのリンク削除、アップローダーの身元開示を要求した
  • その後 A.I. Hub は、著作権付きデータセットへのリンク、特に新しい音声モデルの学習に使われる A.I. 処理済みのボーカル分離ファイルへのリンクについて厳格なルールを設けた
  • 記事公開時点では、RIAA が A.I. モデル自体やモデル制作者に対して措置を取った事例は確認されていなかった
  • Discord は記事公開の2日後に A.I. Hub を永久停止した
    • TorrentFreak の Ernesto Van der Sar が最初にこれを報じた
    • 新サーバーでの未確認報告によると、誰かが投稿を編集して著作権コンテンツへのリンクを追加し、そのため Discord には DMCA 処理以外の選択肢がなかったという

複数の歌手モデルで作った Weird Al カバーの結果

  • Madonna が「Like A Surgeon」を歌う実験には、1984年のアルバム Like a Virgin のクリーンなスタジオ品質アカペラ13分で500 epochs学習されたモデルを使用した
    • Madonna のボーカル音域は Weird Al よりはるかに高いため、1オクターブのピッチシフトを適用した
    • 結果は女性ボーカルのように聞こえるが、1980年代の Madonna にはかすかに似ている程度だった
  • Kurt Cobain が「Smells Like Nirvana」を歌う実験では複数のモデルを試し、最も良かったモデルは YouTuber @Cleberslk が作ったものだった
    • 制作者は「急いでスマートフォンでモデルを作った」と書いている
    • 結果には説明しにくいヨーロッパ風のアクセントが混じっていた
  • Lady Gaga が「Perform This Way」を歌う実験には、@udrivemecrazy が作った RVC モデルを使用した
    • このモデルは5分間の「非常にクリーンなアカペラ」だけを使用している
  • Lorde が「Foil」を歌う実験も行った
    • この曲は Weird Al の14作目で最後のスタジオアルバム Mandatory Fun の収録曲である
    • 結果は実験の中では珍しく気に入るほどだったが、判断が鈍っていたのかもしれないとも見ている

制作ツールと下がる利用ハードル

  • ローカルでモデル推論を行うには通常、適切なGPUを搭載したPCが必要だが、Google Colab は互換GPUがない、またはターミナルに抵抗があるユーザーでも、サーバー上で生成 A.I. ワークフローを実行できるようにする
  • Mac にはこのモデル推論に必要な Nvidia GPU がないため、AICoverGen の Colab ノートブックを使用した
    • AICoverGen は、既存モデルから A.I. カバーを生成する手順を処理するパッケージで、Web UI を提供する
    • 起動には数分かかり、各曲の生成は1分未満で済んだ
  • Colab と WebUI は非技術系ユーザーには負担になり得るため、複数のスタートアップがシンプルなアプリの形で A.I. ボーカルカバーの生成とモデル学習を提供している
  • There I Ruined It チャンネルのダラスのミュージシャン Dustin Ballard は、310万人の TikTok フォロワーと70万人の YouTube 登録者を持ち、直近4か月にわたって音声クローンを試している
    • 事例として、The Beach Boys が Nine Inch Nails の「Hurt」を「Surfin’ USA」の旋律で歌う動画、Hank Williams 風の「Straight Outta Compton」、Red Hot Chili Peppers「Snow (Hey Oh)」の作り替えがある
    • Ballard は新しいボーカルトラックを自分で録音し、各歌手の音域とスタイルをある程度まねたうえで A.I. 音声クローンを適用している
    • この方法は、歌詞、メロディ、拍子、イントネーションを元曲から大きく変える作業により適している
  • 現在の技術で Weird Al プロジェクトをもっともらしく作るには、パロディ対象の歌手の音域とスタイルに合わせて誰かがまず Weird Al の歌詞を歌い、その上に音声クローンを適用するほうがよい
  • Singing Voice Synthesis と Singing Voice Conversion は急速に発展している研究分野である
    • Ghostwriter が2023年4月の「Heart on My Sleeve」で Drake と The Weeknd をまねるために使った so-vits-svc は、すでにリポジトリ所有者によってアーカイブされており、RVC が広く使われるツールになっている
    • 研究者たちは、ボーカルの音色とイントネーションを「beautify」したり、テキストから新しいボーカルを自然に合成したり、別のアーティストのスタイルへ移す可能性を示している

スタイルパロディと存在しないモデル

  • Weird Al Yankovic はパロディ歌手でありアコーディオン奏者として有名だが、独創的な作曲家でもある
  • 好きな曲の多くは、特定の曲を直接パロディにするのではなく、他のアーティストのスタイルを riff するスタイルパロディである
  • Devo の Mark Mothersbaugh が「Dare to Be Stupid」を、David Byrne が「Dog Eat Dog」を、James Taylor が「Good Old Days」を歌う合成版も聴いてみたいが、これらの歌手の既存 A.I. モデルは A.I. Hub になかった
  • A.I. Hub でしばらく活動してみると、コミュニティは若年層に偏っているようで、昔のアーティストの一部はモデル・カバー・リクエストであまり見かけない
  • A.I. Hub の活動の大半は非商用である
    • モデルは無料で配布されている
    • 人々は YouTube に投稿した A.I. カバーを共有し続けている
    • ただし #request-a-model チャンネルでは、有料で音声モデルの学習を請け負う人たちもいる

音声クローンをめぐる倫理と法的衝突

  • 生成 A.I. をめぐる議論と同様に、音声クローンツールも倫理と合法性の問題を避けにくい
  • アーティストごとに立場は分かれる
    • Holly Herndon は、自分の声がこのような形で使われることに前向きである
    • Grimes は、収益分配があれば商用利用も許可している
    • 無料かどうかにかかわらず、これを望まないアーティストもいる
  • 2020年4月、Jay-Z は自分の声を使った複数のディープフェイク音声パロディを YouTube から削除するよう求めた
    • 当時は露骨なパロディだったが、無断で Jay-Z が新しいシングルにフィーチャリングしたり、広告で製品を推薦したりするように見せる場合、著作権またはパブリシティ権の侵害になり得る
  • Ghostwriter のような匿名制作者は、有名アーティストの名前と声を使って曲の人気を集め、そのアーティストの認識・同意・報酬なしに音楽を作っている
    • 「Heart on My Sleeve」について、音楽業界はすべてのストリーミングプラットフォームにテイクダウンを要請した
    • Ghostwriter はその後、Travis Scott と 21 Savage の A.I. 版を使った別の曲を X と TikTok に投稿し、TikTok はすぐに削除したが、X には残っていた
  • 音楽業界は A.I. ボーカルの商用利用を引き続き取り締まる可能性が高いが、A.I. ボーカル制作そのものを止めるのは難しそうだ

1件のコメント

 
GN⁺ 2023-10-04
Hacker News のコメント
  • こういうツールを実行するたびに、毎回モデルのコピーを転送しているというのはかなり驚き。Google Colab ノートブックでもローカルマシンでも同じなら、Hugging Face の帯域幅コストはとんでもないことになりそうだけど、何か見落としているのか気になる
    ピアリング契約があるか、かなり強力にキャッシュを使っているのかもしれない

    • Python モジュールがダウンロードをキャッシュして、再取得する前にまず確認する。それでも帯域幅コストが膨大だろうという点はたぶん正しい。最近の状況でも、VC 資金はかなり多く調達しているようだ
    • 10年以上前にカスタム CDN の見積もりを取ったときでさえ、無制限の 10ギガビット以上の回線は卸値でだいたい $1/mbit/月 くらいだった
      AWS で 100TB を外部転送する費用があれば、24時間ずっと 10Gbit/s を維持でき、100% 利用なら月 3PB を超える。帯域幅はいつも信じられないほど安かった
    • Hugging Face には AWS との戦略的パートナーシップがある
      1. AWS は AI で Azure や GCP に大きく遅れているので、信頼性を得るにはパートナーが必要
      2. Hugging Face は GitHub と比べるとコストが非常に大きい可能性が高い。それでも AWS なら帯域幅コストを下げる最適化を作れそうだし、AI モデル向けの汎用的な差分保存方式のようなものも、きっと開発中だと思う
    • Hugging Face は、GitHub がコードリポジトリであるように、単にモデルリポジトリなのかなと思う。CPU や GPU の計算リソースも借りられるようだが、ほとんどのモデルは別の場所で実行されているようではある
    • こういうものを C: ドライブ以外の場所にキャッシュするよう設定できるといい
      もっと良いのは、モデルをどこに保存するか先に聞いてくれること
  • この記事は AI 音声クローンの音楽的側面だけを扱っているが、もっと複雑なのは映画・ゲーム・アニメにおける一般的な声優の代替だ。例: https://www.axios.com/2023/07/24/ai-voice-actors-victoria-at...
    歌手を置き換えるには相当な後処理が必要で、競争で大きな打撃を受けないだけの資金力や法的な力もあるが、声優は違う。ElevenLabs や Bark、VALL-E X のようなオープンソース代替のデフォルト設定だけでもそれなりに複製できるし、すでに低賃金で、契約ベースなので自分の声に対する法的所有権もない。声優の成果物は通常クライアント企業が所有し、そのクライアントが音声保護に積極的である理由も弱いかもしれない
    Persona 5 と Genshin Impact の声優文化の影響についてブログ記事を書きたいが、Hacker News 読者の大半はあまり関心がなさそう

    • 結局、企業は数千ドルとピザ一枚を必要としている大学生を雇い、適当な台本を読ませ、すべての権利を譲渡する契約に署名させて、その声を永久に使えるようになる気がする
      もっとこっそりやるなら、音声アシスタントを提供して、利用規約に「あなたの声のコピーをあらゆる用途に使用できる」と入れることもできる。既存の声優は職を失い、本物の人間の声を求める少数派だけが残るだろう。一部のプロジェクトではそれが重要ではないだろうから、かなり混乱しそうだ
    • 書く場所は HN だけではない。ここではこうした職業問題への共感は薄そうだが、ニッチな記事でもたまにトップページに上がる
      いずれにせよ読んでみたい
    • 声は著作権の対象ではないが、ものまねが合法というわけではない。有名な例として Midler v. Ford があり、状況が完全に明確だとは言いにくい
    • 興味深いのは、多くの Vocaloid、特に Hatsune Miku は歌手ではなく声優サンプルから生まれたという点だ
      歌手はソフトウェアによる複製を望まなかったが、声優の声は自由に使える対象として扱われたわけだ
    • AI 音声はより安いが、同時により退屈で平凡な演技でもある。優れた独自の作品を作る創造的 AI の方向には、まったく進展がないように見える
      この市場は、プロの声優を雇う余裕のない小規模事業者に開かれる可能性が高い。AI は新しい市場を開くものであって、本当に才能のある人たちの仕事を奪うものではないと思う
  • うわ、これで誰でも Weird Al の歌詞はそのままに、元の歌手の声で作り直せると気づいた。昼休みごろには Michael Jackson が Just Eat It を歌うのを聴けるかもしれない
    新しい AI 技術がどう使われ得るのかには、いつも驚かされる。もちろん、ほとんどの国の著作権法では違法の可能性が高い

    • Weird Al の I Think I'm a Clone Now もあって、AI クローン音声のパフォーマンスには本当にぴったりだと思う。原曲は Tommy James and the Shondells の I Think We're Alone Now だが、Weird Al は1980年代の Tiffany のカバーをパロディにしたようだ
      Weird Al 本人は許可を求めるが、パロディが著作権侵害ではないことは十分に確立されている。優秀な弁護士が主張すれば、AI 音声によるパロディパフォーマンスにも余地があるはずだ
    • それがなぜ驚きなのか分からない。ただ馬鹿げていて時間の無駄に聞こえる
  • これまで見たこの技術の活用例でいちばん気に入っているのは、The Beach BoysがHurtを歌うもの。初めて本気でアーティファクトをほとんど感じなかったし、本来ならあり得ない組み合わせなのに、すごくうまく合っている
    聴いてみてほしい: https://youtu.be/gmNSFqyg_Z8

    • 何を期待していたのかは分からないけど、あれはHurtではなく、Hurtの歌詞を乗せたSurfin' USAに近いし、音がかなり震えて荒く聞こえる
      ただ、近いうちにどこかのAIがNIN原曲の実際のコードとメロディにBeach Boys風のスタイルを合成して、そこにJohnny Cash的な悲壮感まで少し加えられるのかは気になる
    • Sinatraが歌うWhere Is My Mind: https://youtu.be/BO4cKQ8DxYU?si=uzF_TdrQoZOAOlEc
    • このアカウントは、変な音楽ミックスを作る人たちの中でも最上位クラス。最近のディープフェイク音楽作品は衝撃的なほど良かった
      アーティストや作曲家などの権利がすべて整理されるなら、こういうものはAIの「許容できる」利用例と見なせる。才能ある人たちが自分でふざけるほうがいつだって面白いけれど、こういう奇妙なマッシュアップアルバムなら確実に聴くと思う
    • 録音の粗い質感が潜在的な問題をかなり覆い隠している。それでもこの試みがBeach Boysのテンポと発音を保っている点を見ると、同じ手法でMichael JacksonがEat Itをカバーするバージョンを作れば、ずっと説得力が出そうだ
  • サンプル音声はMichael Jacksonのようにも、Weird Alのようにも聞こえない。良い試みではあるけれど、プロのものまね歌手ならどちらの方向でももっと上手くできた可能性が高い

    • Weird AlがMichael Jacksonのふりをしていて、そのMichael JacksonがさらにWeird Alのふりをしているように聞こえる
    • 人口5万人の街でいちばん上手いMichael Jacksonものまね芸人でも、これより上手いと思う。これは……いまいち
    • 言いたいことは分かる。Michaelのほうでより目立って感じるけど、確かにそういう感じがある。変に聞こえる部分は、ある程度ピッチ補正のせいのように思う
  • AIの歌カバーはすごい。GokuがDon't Stop Me Nowを歌うものから、SpongeBobの出演陣がOcean Manを歌うものまでいろいろある

  • こういうものがあるとは知らなかった。「AIカバー曲コミュニティの中心はA.I. Hubという50万人超規模のDiscordで、メンバーが新しいコツ、ツール、手法、原曲やカバー曲のリンクをやり取りしている」

    • 私も知らなかった。インターネットの変なところはまさにこういう部分
      50万人が一緒に通りに出ていたら間違いなく気づくはずなのに、オンラインでは、こうした巨大コミュニティがあっても、偶然出くわすか誰かに教えてもらうまでまったく分からないことがある
    • 今の世代の技術好き、特にモデルを何時間も調整して結果を共有する時間がある人たちは、こうしたWeb 2.0的なフォーラム型コミュニティよりもDiscordをはるかに好むのだと、だんだん受け入れつつある気がする
      RedditでさえZ世代の間ではDiscordやTikTokより人気が後れを取っているし、/r/LocalLLMsを読めば、このコミュニティのかなりの部分が未成年だということもすぐに感じ取れる。はっきり言うと、これは良いことだと思う
      メーリングリストを好んだ世代があり、IRCやBBSを好んだ世代があり、私の世代はフォーラムや長いコメントスレッドを好む。今の自分たちのやり方が永遠に続くと思うのはナイーブだ
      Discordへの批判、特に検索性や発見可能性の問題は非常に現実的だが、ここまで来ると賽は投げられたように思う。若い人たちはすでに選んだ
    • しばらく見て回ったけど、全体的にレベルが低いという印象を受けたので、だから比較的あまり知られていないのかもしれないと感じた
      ただ、それが技術の限界なのか、単に「素材があまりにも面白くない」せいなのかは分からない。「今どきの人気ラッパーが歌うクラシック曲」みたいなものが非常に多いが、昔からのヒップホップファンとして言うと、最近の人気ヒップホップアーティストのボーカルに面白い点はほとんどないと思う
  • 1年前の、Darth Vaderの声が今後AIで生成されるという関連記事
    https://arstechnica.com/information-technology/2022/09/james...

  • 「有名人の声まね」なら、YouTube MusicでLight My Fireを聴いてみればいい
    https://music.youtube.com/watch?v=lN3v3EfA6_A&si=_hcG3Wjakxd...