2002 Fiscal Year Annual Research Report

平均声に基づく多様な声質・発話スタイルが可能な音声インタラクションシステム

Research Project

Project/Area Number	13878070
Research Institution	Tokyo Institute of Technology
Principal Investigator	小林隆夫東京工業大学, 大学院・総合理工学研究科, 教授 (70153616)
Co-Investigator(Kenkyū-buntansha)	益子貴史東京工業大学, 大学院・総合理工学研究科, 助手 (90272715) 徳田恵一名古屋工業大学, 工学部, 助教授 (20217483)
Keywords	テキスト音声合成 / 平均声 / 共有決定木 / コンテキストクラスタリング / HMM音声合成 / 話者適応 / 発話様式 / モデル補間
Research Abstract	本研究では,「平均声からの音声合成」という新たな枠組みを提案し,多様な話者の声質や発話様式を自動的に生成可能なマルチモーダルヒューマンコンピュータインタラクションを実現するための基礎を開拓することを目的として,研究初年度に引き続き以下の項目について検討を行った。 1.複数の話者の平均的な声の特徴を表す音声単位である平均声モデルの学習法として,初年度に提案した共有決定木コンテキストクラリング(STC)および話者適応学習(SAT)の二つの方法を統合し,話者の性別や学習データ量の大小による影響を低減する新たな平均声モデル学習法を提案した。そして,平均声の音声合成とその評価実験および任意話者が発声した少量の音声データを用いて平均声モデルを話者適応した適応モデルからの音声合成とその評価実験により,従来法に比較して提案法による合成音声の品質が向上し,目標話者の大量の学習データに基づく話者依存モデルに近い合成音声が得られることを示した。さらに,平均声の学習法として,声道長正規化に基づく手法を提案し,その有効性の検討を行った。 2.多様な発話様式の合成に向けて,「丁寧」,「ぞんざい」,「楽しげ」,「悲嘆」という異なる様式で発声された音声データベースを作成し,HMM音声合成の枠組みによる音声単位のモデル化と合成音声の評価を行った。その結果,それぞれのデータベース中の発話様式を反映した音声が合成可能なこと,各様式に対応するモデルを補間することにより,中間的な様式の音声が合成できることを明らかにした。 3.インタラクションシステムのプラットホームとして,本研究担当者が開発に加わっている「擬人化音声対話エージェント基本ソフトウェア」を利用し,平均声モデルを話者適応したモデルから多様な声質での音声出力が可能なシステムの検討を行った。

Research Products
(6 results)

All Other

All Publications (6 results)

[Publications] Yamagishi, Junichi: "A context clustering technique for average voice models"IEICE Transactions on Information and Systems. E86-D・3. 534-542 (2003)
[Publications] 田村, 正統: "HMMに基づく音声合成におけるピッチ・スペクトルの話者適応"電子情報通信学会論文誌. J85-D-II・4. 545-553 (2002)
[Publications] Yamagishi, Junichi: "A context clustering technique for average voice model in HMM-based speech synthesis"Proceeddings of the 7th International Conference on Spoken Language Processing, ICSLP2002. 1. 133-136 (2002)
[Publications] 大西, 浩二: "HMM音声合成における異なる発話スタイルの生成の検討"電子情報通信学会技術研究報告. 102・619. 17-22 (2003)
[Publications] 山岸順一: "平均声モデル構築のためのコンテキストクラスタリング手法の検討"電子情報通信学会技術研究報告. 102・292. 5-10 (2002)
[Publications] 山岸順一: "話者適応のための平均声モデル学習法の評価"日本音響学会2002年秋季研究発表会講演論文集. I. 353-354 (2002)

2002 Fiscal Year Annual Research Report

平均声に基づく多様な声質・発話スタイルが可能な音声インタラクションシステム

Principal Investigator

小林 隆夫 東京工業大学, 大学院・総合理工学研究科, 教授 (70153616)

Research Products

[Publications] Yamagishi, Junichi: "A context clustering technique for average voice models"IEICE Transactions on Information and Systems. E86-D・3. 534-542 (2003)

[Publications] 田村, 正統: "HMMに基づく音声合成におけるピッチ・スペクトルの話者適応"電子情報通信学会論文誌. J85-D-II・4. 545-553 (2002)

[Publications] Yamagishi, Junichi: "A context clustering technique for average voice model in HMM-based speech synthesis"Proceeddings of the 7th International Conference on Spoken Language Processing, ICSLP2002. 1. 133-136 (2002)

[Publications] 大西, 浩二: "HMM音声合成における異なる発話スタイルの生成の検討"電子情報通信学会技術研究報告. 102・619. 17-22 (2003)

[Publications] 山岸 順一: "平均声モデル構築のためのコンテキストクラスタリング手法の検討"電子情報通信学会技術研究報告. 102・292. 5-10 (2002)

[Publications] 山岸 順一: "話者適応のための平均声モデル学習法の評価"日本音響学会2002年秋季研究発表会講演論文集. I. 353-354 (2002)

小林隆夫東京工業大学, 大学院・総合理工学研究科, 教授 (70153616)

[Publications] 山岸順一: "平均声モデル構築のためのコンテキストクラスタリング手法の検討"電子情報通信学会技術研究報告. 102・292. 5-10 (2002)

[Publications] 山岸順一: "話者適応のための平均声モデル学習法の評価"日本音響学会2002年秋季研究発表会講演論文集. I. 353-354 (2002)