イレブンラボジャンパン、「演じる」AI音声モデル「Eleven v4」を提供開始 低遅延版「Eleven v4 Turbo」も同時公開

イレブンラボジャパンは、2025年9月29日、感情表現力を高めた新しい音声合成モデル「Eleven v4」およびリアルタイム向けの「Eleven v4 Turbo」の提供を開始した。

新しいモデルアーキテクチャを採用した「Eleven v4」は、同社のモデルの中で最も高い感情表現力を備える。文章の文脈や演出意図を捉え、声のトーン、間、感情、キャラクター性を表現する。Artificial Analysisの「Text to Speech Leaderboard(Provider Voices)」で1位を獲得しており、ドラマティックな場面から穏やかな語り、緊迫したせりふ、コミカルな掛け合いまで幅広い表現を可能にする。

インラインタグを使用することで、感情、テンポ、間、リアクションなどを直接指定できる。「[laughs](笑う)」「[whispers](ささやく)」「[long pause](長めの間)」といったタグを1つのせりふに複数連ねた場合でも、「Eleven v3」より安定して反映される。また、環境音や効果音もインラインタグで演技に組み込める。複数話者の会話は、会話全体をひとつの文脈として生成し、発言の重なりや間がやりとりそのものから生まれるため不自然さが残らない。

90以上の言語に対応し、日本語の表現力も向上した。音声を切り離して扱えるため、ある言語の話者の声で別の言語の台本を読ませる場合も、声の特徴を保ちながら対象言語として自然な発音に近づけられる。長尺コンテンツでも一貫した声質を維持する。

リアルタイム対話向けの「Eleven v4 Turbo」は、最初の音声が出るまでのモデル推論時間が中央値で約100ミリ秒と低遅延を実現する。『ElevenAgents』で提供され、通話の途中で相手が話す言語を切り替えても、同じ声のまま応対を続ける。

ボイスクローンの機能も向上し、約10秒の音声から声を再現する「インスタントボイスクローン」で特徴をより忠実に捉えられるようになった。他方、安心・安全な音声AIの利用に向け、権利や許可の求められる仕組みや、Voice CAPTCHAによる確認などの悪用防止対策を講じているとのこと。

 

■関連サイト

▼公式サイト
https://elevenlabs.io/v4

▼イレブンラボ日本語サイト
https://elevenlabs.io/ja

▼イレブンラボ 日本語版LinkedIn
https://www.linkedin.com/company/elevenlabs-japan/

▼イレブンラボジャパン公式note
https://note.com/elevenlabs_japan

 

【PR】業界未経験からゲーム・エンタメ業界へ!あなたの経験を活かせる求人あります