Podcastを始め…る前に、技術の無駄づかいをしてみた

音声コンテンツって、まだまだ参入余地あると思うだけどな〜、と思って、あさっての方へ向かってしまった話。


技術のムダ使い評論家(というか、実践家?)の佐塚です。

Podcastが好きで(というか生活にあっていて)、毎日10時間分ぐらい聞いています。
目で見るメディアは争奪戦だけど、耳は空いている、と思うんだよなあ。

工務店さんもPodcastをやったらいいのに、と思いますが、なかなか普及しません。
まあ、そんなのやるぐらいなら、Youtubeに、ってなっちゃうんだろうな〜。


隗より始めよ、ということで、僕からやってみました。

ブログの中身を紹介する音声コンテンツです↓

…間がおかしいな、とか、ちょっと音がこもってるな〜いいマイク買えよ、と思われたかもしれません。
勘のいい人は気づいたかな?

これ、AIによる合成音声です。
(直接お話ししたことない人は、そもそもわかんないだろうけど)


AIの音声合成は、もはや珍しい技術ではありません。

ただ、今回は「無料で」「クラウドにデータをアップせず」というのをテーマでやってみました。
要するに、素材の音声データは外部には漏らしていない、ということ。

素材の多くは、ZoomとかGoogleMeetとかの録画データです。
当然、相手の声も入っています。お仕事のナイショ話もあるわけです。
これをクラウドにアップしちゃうのは流石になあ…

というわけで、録音を扱う部分はMacの中で完結させました。

ざっくりいうと

自分の声だけを取り出す

約24時間ぶんの録音から、しゃべっている区間を見つけて、声紋(声の特徴)で話者を分けました。
「全部のミーティングに出てくる人」が僕、という考え方です。
実際に耳でも確かめて、他の人の相槌が混ざる部分は削って、最終的に約96分ぶんの「僕だけの声」が残りました。
ここが一番大事で、一番地味な作業でした。

文字起こしで、声に言葉を教える

AIに「この声は、こう言っている」と教えるために、文字起こしをします。
これも、Macの中で動くオープンソースのWhisperで。

学習は、CPUで6時間

GPT-SoVITSという、オープンソースの音声合成AIに、僕の声を覚えてもらいます。
問題は、うちにはNVIDIAのグラフィックボードがなくて、M4のMac miniだけということ。
CPUで、約6時間、回しっぱなしにしました。

台本を読ませるだけ

学習が終わると、文章を渡すだけで、僕の声でしゃべります。
速さは、しゃべる時間の半分くらい。三分の音声なら、一分半で作れます。

最後は耳で仕上げる

最初は、「ちょっといがらっぽい」というか、咳払いを一回してほしくなる、ノイズ感が出てしまいました。
調べると、本物の録音より高い音が多めに出ていたので、ノイズ除去と、高音を少し抑える処理をかけて解決。
ここは数字より、耳で聞いて決めました。

結果は先の通り。

妻にAIだと言わずに聞かせたところ、僕の声だと思ったそうです。
うれしいような、ちょっと複雑なような。

「完全にローカル」と言い切りたいところですが、正確にはこうです。録音データそのものは、外に出していません。
ただ、この作業は、AIのClaudeに手伝ってもらいながら進めたので、作業中のコマンドの出力(文字起こしの断片など)は、そのやりとりの中で送られています。


お金をかけたり、クラウドも使ったりすれば、音質・抑揚などは、もっと良くなるはずです。

とはいえ、これが工務店のコンテンツ作りに役立つのか? あるいは僕の仕事に寄与するのか?
結局技術とリソースの無駄遣いになるのか?

どうなるんでしょうね〜。ご興味のある方はご連絡ください(いんのか?)