AIエージェント能力アトラス › 仕事ごとの一覧 › コンテンツ制作 › 音楽・音声
TTS・ナレーション/オーディオブック制作
TTS narration and audiobook production
5/52026年: 専門家超え
2030年(予測): 5/5 専門家超え
2030年(予測): 5/5 専門家超え
22022
32023
42024
42025
52026
52027予
52028予
52030予
0 できない / 1 デモ止まり / 2 補助 / 3 実務品質(要確認) / 4 専門家並み / 5 専門家超え。「予」は予測。
専門家と比べて
独立テストでElevenLabs v3が5テイク中3本が放送品質と評価される水準に到達
できること
感情タグ([whispers][excited]等)による演技指導、長尺オーディオブックでの一貫した声の維持
まだできないこと
常に放送品質のテイクを出すこと(5本中2本は『使える』程度に留まる)、俳優の即興的な間の取り方
なぜそうなのか
感情表現は大幅改善したが、一貫した『名演』の再現性はなお確率的
これからの予測の根拠
既に専門家並みに到達しておりレベル5相当。今後は安定性(再現性)の向上が焦点になると予測
いま使える主な道具
ElevenLabs v3、VOICEVOX
根拠
- Audio tags 101: Directing emotional TTS in Eleven v3 2026-03
[whispers][laughs][excited]等のインラインタグで感情演技を指示できる新機能 - ElevenLabs for Audiobooks: Strengths and Limits 2026
5本中3本が放送品質、2本は使える程度という独立テスト結果
同じ分野のほかの仕事(音楽・音声)
AIエージェント能力アトラス 2026(2026-09-06 時点・v1.0)の1マスです。レベルは公開された実験・ベンチマーク・報告から付けた目安で、2027年以降は予測です。全マスに根拠のリンクがあります。作者は個人で、AI(Claude)と一緒に調べて作っています。