DeepL Voiceでは、言語を問わず、リアルタイムで話者の声をそのまま再現できるようになりました

リアルタイム音声翻訳により、言語を問わず各話者の語調や声のニュアンスを再現できるようになりました。Zoom、Teams、Google Meetに対応した統合デスクトップアプリもご利用いただけます。

DeepLが2026年9月15日、話し手の声をそのまま保ったまま翻訳する新しい音声モデルを発表しました。日本語で話せば、その人の声のまま外国語が流れます。
ここで目を引くのは、その仕組みではありません。録音を保存しなくてよいと書かれている点です。

この記事の事実と数値はDeepLが2026年9月15日に公開した発表によります。

これまでは、同じ合成音声だった

翻訳した言葉を音で出すとき、これまでは決まった合成音声が使われてきました。だから誰が話しても、返ってくる声は同じです。会議に何人いても、音だけでは誰の発言か分かりませんでした。

新しいモデルは、話し手ごとの声と話し方を保ったまま言語を替えます。そのため複数の参加者がいる会話でも、音だけでそれぞれの声を聞き分けられるようになりました。

DeepLは、質問は質問らしく聞こえ、興奮した口調もそのまま伝わると説明しました。ためらい、強調、切迫感といったものも残るとしています。

保存しない、という一行

今回いちばん確かめる価値があったのは、性能の数字ではなく次の一行でした。

音声サンプルを保存したり、後で使用するための音声プロファイルを作成したりする必要がない

人の声をまねるなら、その人の音を先に登録しておく必要がありそうに思えます。しかしDeepLは、それが要らないと書きました。そしてこれを、データの安全が保たれる理由として挙げています。

ただし、どうやって保存せずに写しているのかはDeepLの発表には書かれていません。

ここは別の報道が補っていました。CNET Japanが2026年9月16日に報じた記事によると、声の再現に使うのは会議中の話し声です。

そしてそのデータはメモリー内だけで保持して会話の終了後に破棄し、別の会議には引き継がないと書かれています。

つまり、その場で聞いた声をその場で使い、終わったら捨てる。だから声を登録しておく必要がないわけです。

マイクを通り抜けた音の波が形だけ変わり、色は同じまま。横に空の引き出しが開いている
誤り率4%は、DeepLが測った数字ではない

発表には、翻訳の誤り率も載っています。ただしこれはDeepLが自分で測ったものではありません。Slatorによる独立したテストを、DeepLが引用した形でした。

対象翻訳の誤り率(Slatorのテスト)
DeepL Voice4%
Microsoft Teams、Google Meet、Zoomの平均17%

数字の出どころが自社でないことは、本文にそのまま書かれていました。こういう書き方をしている記述には、読む側が確かめに行く手がかりが残ります。

対応は12言語。ブラウザ版はまだベータ

声の再現に対応するのは当初12言語で、今後さらに追加される予定だとしています。

あわせてWindowsとMac向けのデスクトップアプリも出ました。対応するのはZoom、Microsoft Teams、Google Meetの3つです。会議の開始を自動で見つけ、ひとつの操作で翻訳を始めます。

利用者は、翻訳された字幕を読むか、音で聞くか、両方を切り替えるかを選べます。ただし外部の参加者向けにブラウザで動かす形は、まだベータ版のままでした。

3本の色の違う音の波が、それぞれの色を保ったまま細い隙間を通って立ち上っている
まとめ
  • DeepLが2026年9月15日、話し手の声を保ったまま翻訳する新しい音声モデルを発表した
  • これまでは翻訳のたびに同じ合成音声だったが、参加者ごとの声を聞き分けられるようになる
  • 音声サンプルの保存も、音声プロファイルの作成も要らないと記されている
  • 声の再現に使うのは会議中の話し声で、会話の終了後に破棄され、別の会議には引き継がれない(CNET Japanの報道)
  • 誤り率4%対17%は、Slatorの独立したテストをDeepLが引用したもの
  • 声の再現は当初12言語。外部参加者向けのブラウザ版はまだベータ版

DeepL Voiceが声を再現するのに使うのは、その場で話された声だけでした。CNET Japanによれば、それは会話が終わると破棄され、次の打ち合わせには引き継がれません。話し手ごとの声を聞き分けられるのに、声の見本を保存しない作りになっています。