2021 Fiscal Year Annual Research Report

End-to-End音声合成とEnd-to-End音声認識の統合システム

Research Project

Project/Area Number	19J21031
Research Institution	Kyoto University
Principal Investigator	上乃聖京都大学, 情報学研究科, 特別研究員(DC1)
Project Period (FY)	2019-04-25 – 2022-03-31
Keywords	音声認識 / 音声合成
Outline of Annual Research Achievements	研究の目的はEnd-to-End音声合成とEnd-to-End音声認識を統合することで、適用対象(タスク、ドメイン)のテキストのみがある条件でも音声との対データを構成し、一括で学習するシステムを実現することである。今年度は音声認識と音声合成を効率的に統合でき、かつ音声認識の性能の低下が少ない表現を構成する方法の研究を行った。音声認識の性能の低下の原因のひとつとして挙げられるのが、実際に人間が話した音声(自然音声)と音声合成システムが生成した音声(合成音声)に差があることである。音声合成においては、通常テキストから人が聞くことのできる音声波形を作るのに必要な周波数スペクトル特徴量を予測するモデルを用いた後に、その周波数スペクトル特徴量を音声波形に変換するモデルを用いて、音声波形を生成する。周波数スペクトル特徴量は音声認識の訓練データとしても用いられ、生成された音声波形を再び周波数スペクトル特徴量に変換し、音声認識に用いる。音声波形に変換するモデルには自然音声と合成音声の差異を埋める効果があるが、この波形生成に非常に時間がかかるという問題がある。そこで今年度は音声波形に変換するモデルを用いずに周波数スペクトル特徴量上で直接差異を埋めるネットワークを構築した。提案手法では、生成された周波数スペクトル特徴量だけでなく、音声合成のタスクで利用可能な発話の音素系列情報も用いる。評価実験から、提案手法が音声波形に変換するよりも少ない処理時間で音声認識の拡張の効果が高いことを示し、また、発話の音素系列情報の利用も改善に重要であることを示した。
Research Progress Status	令和3年度が最終年度であるため、記入しない。
Strategy for Future Research Activity	令和3年度が最終年度であるため、記入しない。

Research Products
(6 results)

All 2022 2021

All Journal Article (1 results) (of which Peer Reviewed: 1 results, Open Access: 1 results) Presentation (5 results) (of which Int'l Joint Research: 2 results)

[Journal Article] Synthesizing waveform sequence-to-sequence to augment training data for sequence-to-sequence speech recognition2021
- Author(s)
  Sei Ueno, Masato Mimura, Shinsuke Sakai, Tatsuya Kawahara
- Journal Title
  
  Acoustical Science and Technology
  
  Volume: 42 Pages: 333--343
- DOI
  10.1250/ast.42.333
- Peer Reviewed / Open Access
[Presentation] Phone-informed refinement of synthesized Mel spectrogram for data augmentation in speech recognition2022
- Author(s)
  Sei Ueno and Tatsuya Kawahara
- Organizer
  IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
- Int'l Joint Research
[Presentation] 音声認識のデータ拡張のための音素情報を用いた合成音声の強調2022
- Author(s)
  上乃聖, 河原達也
- Organizer
  日本音響学会研究発表会講演論文集, 春季
[Presentation] Data augmentation for ASR using TTS via a discrete representation2021
- Author(s)
  Sei Ueno, Masato Mimura, Shinsuke Sakai, and Tatsuya Kawahara
- Organizer
  IEEE Workshop Automatic Speech Recognition & Understanding (ASRU)
- Int'l Joint Research
[Presentation] 音声認識のデータ拡張のための合成音声の周波数スペクトログラム強調2021
- Author(s)
  上乃聖, 河原達也
- Organizer
  研究報告音声言語情報処理（SLP）
[Presentation] wav2vec 2.0を用いた音声合成による音声認識のデータ拡張2021
- Author(s)
  上乃聖, 河原達也
- Organizer
  日本音響学会研究発表会講演論文集, 秋季

2021 Fiscal Year Annual Research Report

End-to-End音声合成とEnd-to-End音声認識の統合システム

Principal Investigator

上乃 聖 京都大学, 情報学研究科, 特別研究員(DC1)

Research Products

[Journal Article] Synthesizing waveform sequence-to-sequence to augment training data for sequence-to-sequence speech recognition2021

Author(s)

Journal Title

DOI

[Presentation] Phone-informed refinement of synthesized Mel spectrogram for data augmentation in speech recognition2022

Author(s)

Organizer

[Presentation] 音声認識のデータ拡張のための音素情報を用いた合成音声の強調2022

Author(s)

Organizer

[Presentation] Data augmentation for ASR using TTS via a discrete representation2021

Author(s)

Organizer

[Presentation] 音声認識のデータ拡張のための合成音声の周波数スペクトログラム強調2021

Author(s)

Organizer

[Presentation] wav2vec 2.0を用いた音声合成による音声認識のデータ拡張2021

Author(s)

Organizer

上乃聖京都大学, 情報学研究科, 特別研究員(DC1)