音声UIのAI化、電話や動画に浸透
音声の入出力をAIが担い、電話・動画という既存メディアへの統合が小さく始まっている。
音声がテキストの次のUIになる
これまでAIとの対話はチャット画面が中心だったが、今週の材料からは音声そのものをAIが処理・生成し、電話や動画といった既存メディアに統合する動きが見える。チャット欄を開いて文字を打つのではなく、電話がかかってくる、動画の中でAIが会話する、という形でAIが生活の中に入り込む。UIとしての音声は目新しくないが、AIが個人の関心や履歴を踏まえて内容を組み立て、双方向でやり取りできる点が変化している。テキストベースのAIプロダクトが飽和しつつある中で、音声という別チャネルに同じ技術を持ち込む動きとして見ておきたい。
Attaché:ニュースを電話で聞き、会話で深掘る
Attachéは電話でニュースブリーフィングを届けるサービスで、利用者の関心を学習し、既に知っている内容は飛ばして更新分だけを伝える。毎日決まった時間に電話をかけてもらう予約制のほか、任意のタイミングで電話をかけて速報について質問したり深掘りしたりできる。さらにリンクをテキストで送るとその文脈を踏まえた折り返し電話が来る仕組みもある。ニュースアプリのプッシュ通知や記事一覧とは異なり、電話という同期的な音声チャネルにAIによる要約・対話を載せている点が特徴で、情報収集の形を変える試みと言える。
VoiceStudio:音声処理をオープンソースで手元に
VoiceStudioは完全ローカルで動作するオープンソースの音声ツールで、ボイスクローン、ボイスデザイン、動画の吹き替え、口述筆記、文字起こし、646言語でのオーディオブック作成までをカバーする。クラウドサービスとして提供されがちな高度な音声合成・変換機能を、外部送信なしに自前の環境で動かせる点が既存の商用サービスとの違いだ。動画の多言語吹き替えや文字起こしといった、音声とテキストの相互変換をまとめて扱えることで、開発者が個別の用途ごとにサービスを組み合わせる手間を減らせる。
Eclatira:会話するビデオエージェントという統合先
Eclatiraは任意のスタックに組み込める会話型ビデオエージェントで、動画という映像メディアの中にAIとの対話を持ち込む。音声だけでなく映像を伴うことで、既存のカスタマーサポート動画や説明動画のような場に、対話するAIキャラクターを差し込む用途が想定される。VoiceStudioが音声処理の基盤を提供し、Attachéが電話という通話チャネルに統合するのに対し、Eclatiraは動画というビジュアル込みのメディアへの統合を担っており、音声UIのAI化が複数のメディア形態に同時並行で広がっていることが分かる。
なぜ既存メディアへの統合が今なのか
電話、動画、ポッドキャストはいずれも以前から存在するメディアであり、目新しいのはそこにAIによる個人化・対話性が加わったことだ。Attachéのように利用者ごとに内容を変え会話で深掘りできる仕組みや、VoiceStudioのように音声合成・変換をローカルで自由に扱える基盤が整ったことで、電話や動画という「作り込みが必要だった」メディアに小規模なチームでもAIを統合しやすくなっている。既存メディアの利用習慣を変えずにAIを裏側に差し込むという設計は、新しいアプリの使い方を覚えてもらう必要がないという点で採用のハードルが低い。
🔭 音声・動画という既存メディアへのAI統合が、電話案内や動画エージェントといった具体的な用途で小さく実装され始めている。