• Search Research Projects
  • Search Researchers
  • How to Use
  1. Back to previous page

人間の感覚と整合する音声特徴空間の構築

Research Project

Project/Area Number 22K19793
Research Category

Grant-in-Aid for Challenging Research (Exploratory)

Allocation TypeMulti-year Fund
Review Section Medium-sized Section 61:Human informatics and related fields
Research InstitutionToyohashi University of Technology

Principal Investigator

北岡 教英  豊橋技術科学大学, 工学(系)研究科(研究院), 教授 (10333501)

Co-Investigator(Kenkyū-buntansha) 入部 百合絵  愛知県立大学, 情報科学部, 准教授 (40397500)
西村 良太  徳島大学, 大学院社会産業理工学研究部(理工学域), 講師 (50635878)
太田 健吾  阿南工業高等専門学校, 創造技術工学科, 准教授 (80712801)
Project Period (FY) 2022-06-30 – 2026-03-31
Project Status Granted (Fiscal Year 2024)
Budget Amount *help
¥6,370,000 (Direct Cost: ¥4,900,000、Indirect Cost: ¥1,470,000)
Fiscal Year 2024: ¥2,340,000 (Direct Cost: ¥1,800,000、Indirect Cost: ¥540,000)
Fiscal Year 2023: ¥2,470,000 (Direct Cost: ¥1,900,000、Indirect Cost: ¥570,000)
Fiscal Year 2022: ¥1,560,000 (Direct Cost: ¥1,200,000、Indirect Cost: ¥360,000)
Keywords話者空間 / 音声合成 / x-vector / 音声特徴空間 / 音声認識 / 話者埋め込み / 音声 / 特徴量 / 距離
Outline of Research at the Start

「人間の感覚と整合する音声特徴空間の構築」を目的とする。例えば、音声合成である人と別の人の中間の声を、その特徴空間での内挿で表現できるような空間である。そのために、音声の主観評価を現実的な量で収集し、主観評価と相関する物理量を推定するモデルをPre-trainingし、最後に主観評価データでFine-tuningする。これは自然言語処理のシンボリックな処理でのPre-trainingとFine-tuningによる特定処理への適応をパターン処理の分野に拡張することになる。

Outline of Annual Research Achievements

音声の個人性・話者性を表現するベクトル、いわゆる話者埋め込み表現は様々に検討されており、例えば音声認識ではその表現で表されて話者の音声を選択的に認識することが可能であったり、音声合成では特定の話者を指定してその声で音声を生成することが可能になってきている。しかし、特定のベクトルを指定すれば個人をほぼ特定することが可能であるが、例えば2名の話者の声が直感的に「似ている」か「似ていない」かと、話者埋め込みベクトル間の距離が近いか遠いかとは、直接的な関係は存在しない。そのため、2名の話者の中間的な声を合成したい、といった場合に、埋め込みベクトルを平均するれ場実現できるかと言えば、必ずしもそうではない。そのようなことから、話者埋め込み空間を人の直感と一致する空間とする方法を検討することとした。
数百名レベルの音声合成用データベースJVSが公開されているが、この音声について、人手によって「似ている」「似ていない」をラベリングしたデータベースが存在する。そこで、話者埋め込みベクトル(X-vector)の学習機構に、似ている・似ていないと和車間距離との相関を表現するロスを導入することで、この実現を図った。その結果、音質的な類似性を意図通りに操作できるまでには至っていないが、例えば声の高さや話速などの一部の特徴については、話者間の中間を表現する合成が可能となった。

Current Status of Research Progress
Current Status of Research Progress

2: Research has progressed on the whole more than it was originally planned.

Reason

意図したロスの定式化を行えた。このロスを利用した学習方法も開発し、一部の特徴についてはその効果も確認できた。

Strategy for Future Research Activity

データの拡充と、開発したロス関数のより効果的な利用法の検討を進めて、空間の直感との一致性を向上させる。

Report

(3 results)
  • 2024 Research-status Report
  • 2023 Research-status Report
  • 2022 Research-status Report
  • Research Products

    (2 results)

All 2024

All Presentation (2 results)

  • [Presentation] x-vectorの話者空間を利用した2話者間の中間話者音声合成2024

    • Author(s)
      細井颯太,木内貴浩,若林佑幸,北岡教英
    • Organizer
      SPEASIPワークショップ
    • Related Report
      2024 Research-status Report
  • [Presentation] x-vectorの話者空間を利用した2話者間の中間話者音声合成2024

    • Author(s)
      細井颯太,木内貴浩,若林佑幸,北岡教英
    • Organizer
      SPEASIPワークショップ2024
    • Related Report
      2023 Research-status Report

URL: 

Published: 2022-07-05   Modified: 2025-12-26  

Information User Guide FAQ News Terms of Use Attribution of KAKENHI

Powered by NII kakenhi