技術のムダ使い評論家(というか、実践家?)の佐塚です。
Podcastが好きで(というか生活にあっていて)、毎日10時間分ぐらい聞いています。
目で見るメディアは争奪戦だけど、耳は空いている、と思うんだよなあ。
工務店さんもPodcastをやったらいいのに、と思いますが、なかなか普及しません。
まあ、そんなのやるぐらいなら、Youtubeに、ってなっちゃうんだろうな〜。
隗より始めよ、ということで、僕からやってみました。
ブログの中身を紹介する音声コンテンツです↓
…間がおかしいな、とか、ちょっと音がこもってるな〜いいマイク買えよ、と思われたかもしれません。
勘のいい人は気づいたかな?
これ、AIによる合成音声です。
(直接お話ししたことない人は、そもそもわかんないだろうけど)
AIの音声合成は、もはや珍しい技術ではありません。
ただ、今回は「無料で」「クラウドにデータをアップせず」というのをテーマでやってみました。
要するに、素材の音声データは外部には漏らしていない、ということ。
素材の多くは、ZoomとかGoogleMeetとかの録画データです。
当然、相手の声も入っています。お仕事のナイショ話もあるわけです。
これをクラウドにアップしちゃうのは流石になあ…
というわけで、録音を扱う部分はMacの中で完結させました。
ざっくりいうと
自分の声だけを取り出す
約24時間ぶんの録音から、しゃべっている区間を見つけて、声紋(声の特徴)で話者を分けました。
「全部のミーティングに出てくる人」が僕、という考え方です。
実際に耳でも確かめて、他の人の相槌が混ざる部分は削って、最終的に約96分ぶんの「僕だけの声」が残りました。
ここが一番大事で、一番地味な作業でした。
文字起こしで、声に言葉を教える
AIに「この声は、こう言っている」と教えるために、文字起こしをします。
これも、Macの中で動くオープンソースのWhisperで。
学習は、CPUで6時間
GPT-SoVITSという、オープンソースの音声合成AIに、僕の声を覚えてもらいます。
問題は、うちにはNVIDIAのグラフィックボードがなくて、M4のMac miniだけということ。
CPUで、約6時間、回しっぱなしにしました。
台本を読ませるだけ
学習が終わると、文章を渡すだけで、僕の声でしゃべります。
速さは、しゃべる時間の半分くらい。三分の音声なら、一分半で作れます。
最後は耳で仕上げる
最初は、「ちょっといがらっぽい」というか、咳払いを一回してほしくなる、ノイズ感が出てしまいました。
調べると、本物の録音より高い音が多めに出ていたので、ノイズ除去と、高音を少し抑える処理をかけて解決。
ここは数字より、耳で聞いて決めました。

結果は先の通り。
妻にAIだと言わずに聞かせたところ、僕の声だと思ったそうです。
うれしいような、ちょっと複雑なような。
「完全にローカル」と言い切りたいところですが、正確にはこうです。録音データそのものは、外に出していません。
ただ、この作業は、AIのClaudeに手伝ってもらいながら進めたので、作業中のコマンドの出力(文字起こしの断片など)は、そのやりとりの中で送られています。
お金をかけたり、クラウドも使ったりすれば、音質・抑揚などは、もっと良くなるはずです。
とはいえ、これが工務店のコンテンツ作りに役立つのか? あるいは僕の仕事に寄与するのか?
結局技術とリソースの無駄遣いになるのか?
どうなるんでしょうね〜。ご興味のある方はご連絡ください(いんのか?)

