• Search Research Projects
  • Search Researchers
  • How to Use
  1. Back to previous page

Development of a foundation model for processing various dialects that enables analysis and retrieval of dialect speech data

Research Project

Project/Area Number 24K00450
Research Category

Grant-in-Aid for Scientific Research (B)

Allocation TypeMulti-year Fund
Section一般
Review Section Basic Section 09070:Educational technology-related
Research InstitutionShizuoka University

Principal Investigator

甲斐 充彦  静岡大学, 工学部, 准教授 (60283496)

Co-Investigator(Kenkyū-buntansha) 中川 聖一  中部大学, 工学部, 客員教授 (20115893)
小林 彰夫  大和大学, 情報学部, 教授 (10741168)
岡久 太郎  静岡大学, 情報学部, 助教 (50973848)
ナハル ラウフン  阿南工業高等専門学校, 創造技術工学科, 特命助教 (31004583)
Project Period (FY) 2024-04-01 – 2027-03-31
Project Status Granted (Fiscal Year 2024)
Budget Amount *help
¥18,590,000 (Direct Cost: ¥14,300,000、Indirect Cost: ¥4,290,000)
Fiscal Year 2026: ¥3,900,000 (Direct Cost: ¥3,000,000、Indirect Cost: ¥900,000)
Fiscal Year 2025: ¥8,320,000 (Direct Cost: ¥6,400,000、Indirect Cost: ¥1,920,000)
Fiscal Year 2024: ¥6,370,000 (Direct Cost: ¥4,900,000、Indirect Cost: ¥1,470,000)
Keywords日本語諸方言 / 自己教師あり学習 / 深層学習モデル / 方言地域識別 / 韻律的特徴 / 地域間距離 / 2発話間類似度 / 音声言語モデル / 基盤モデル / 諸方言 / 音声検索 / 長期収録
Outline of Research at the Start

日本の方言の話し言葉の文字化資料は限定的であり、標準語のように一貫した書き起こしが難しい課題がある。本研究では、諸方言の音声メディアに対して分析・検索しやすい仕組みを実現するため、アクセントと標準語単語の推論を含む諸方言に普遍な音声言語処理の基盤モデルを構築し、内容検索とラベリング支援を行う仕組みを開発する。また、方言音声の収集では録音品質が本質的に不均一となりやすいため、TVメディアやオンライン会議等のデータを継続的に拡充し、録音品質の多様性を含むデータを用いて基盤モデル構築を改善する。このように構築した諸方言に普遍な音声言語処理基盤モデルを利用して方言特徴分析への応用可能性を検証する。

Outline of Annual Research Achievements

本研究課題は、1)日本語諸方言に普遍な音声特徴表現基盤モデルを構築し、2)その基盤モデルを用いて内容検索とラベリング支援の仕組みの開発と、3)方言の特徴分析と評価を行うことを目的とする。研究実施計画で挙げたこれら3項目について計画に従って研究を実施したが、特に項目1と3の研究実績を中心に以下にまとめる。

項目1の関連では、大規模多言語音声を利用して自己教師あり学習(SSL)で構築されたモデルを基盤として、研究代表者等が既に提案していた諸方言音声認識モデルへのアダプタ導入など構築方法の改善を図った。日本語諸方言音声コーパス(COJADS)から約60時間分を使用し、標準語で最先端の性能を示す大規模多言語音声認識モデルを適応学習する場合と比較した。その結果、提案したSSLモデルの3段階学習によるモデルは同等以上の認識精度を得た。また、方言音声の扱いとして重要な超高齢者音声の扱いのためWhisperモデルを適応する方法も検討し有効性を示した。(論文誌1件、国際会議4件、国内1件発表)

項目3の関連では、当初の計画通り他の音声資料の活用を図った。具体的には、全国の地域の韻律的特徴の違いの分析に注目して杉藤らが収録・公開した日本語音声データベースを入手し、項目1と同様に大規模事前学習モデルを基盤として地域間の識別モデルを構築した。学習では、全国9地域のべ158話者による同一文(天気予報に関する文)の音声データを利用した。このモデルを利用した他話者の評価用音声に対する地域識別タスクで75%の識別率を得た。また、このモデルを用いて発話間の類似度を算出し可視化する方法を提案し、地域性分析への応用可能性を調査した。その結果、杉藤らがアクセント特徴に基づいて示した地域間類似性と関連する傾向と共に異なる傾向もみられ、アクセント特徴以外の違いがデータから獲得された可能性が示された。(国内発表予定)

Current Status of Research Progress
Current Status of Research Progress

2: Research has progressed on the whole more than it was originally planned.

Reason

研究実績の概要に記載したとおり、初年度に順次進行を予定していた3つの課題項目についてほぼ予定通り研究を進めて国内外で成果発表を行うことができた。初年度の計画の中で、課題項目1の進捗にあわせて実施予定であった課題項目2の方言音声の検索についても研究を進め、成果発表を行なった。しかし、利用した音声データベースの録音品質や対話音声としての扱いの影響が大きいことが明らかになったため、課題項目3で予定していた地域間の音声特徴の対比分析に利用できる音声データベースを新たに入手して並行して研究を開始し、一定の成果が得られた。この後者の成果についても国内発表を予定している。

Strategy for Future Research Activity

本研究の当初の実施計画に挙げていた3つの課題項目について、それぞれ大きな計画変更を要する状況は起きていないため、ほぼ当初の計画のとおり継続して研究を進める。
課題項目1としての日本語諸方言の音声言語処理基盤モデルの構築では、当初予定していたとおりラベルなしの音声資料を新たに拡充する計画を進め、自己教師あり学習による基盤モデルの改善を図るとともに、標準語の同時推論を考慮したモデル改善に関する研究を開始する。
課題項目2としての方言音声検索とラベリング支援システムの開発については、初年度においてデータの録音品質や対話音声としての扱いの影響が大きいことがわかっているため、課題項目1で実施するラベルなし音声資料の拡充による基盤モデルの改善を優先し、その成果を反映する。そして、その有用性を確認するため、検索タスクの新たな設計・評価とラベリング支援システムのプロトタイプの開発を開始する。
課題項目3としての音声言語処理基盤モデルを用いた方言音声の特徴分析と評価については、これまでに構築したモデルによる音声の地域性分析によって、同データで以前に調査されていたアクセント特徴の比較としての知見との比較が一部可能となった。そして、この分析結果ではアクセント特徴による地域性の比較事例と傾向が異なる地域があることも確認された。そこで、アクセント特徴以外の特徴が地域間の違いとしてデータから獲得された可能性があるため、どのような特徴の違いが影響しているか詳細に調査分析を進める。そして、その分析結果に基づいてより有効な特徴分析・評価を得るための方法への改善を継続して進める。

Report

(1 results)
  • 2024 Research-status Report
  • Research Products

    (7 results)

All 2025 2024

All Journal Article (1 results) (of which Peer Reviewed: 1 results,  Open Access: 1 results) Presentation (6 results) (of which Int'l Joint Research: 4 results)

  • [Journal Article] Adapting Large-Scale Pre-trained Models for Unified Dialect Speech Recognition Model2024

    • Author(s)
      Toyama T.、Kai A.、Kamiya Y.、Takahashi N.
    • Journal Title

      Acta Physica Polonica A

      Volume: 146 Issue: 4 Pages: 413-418

    • DOI

      10.12693/aphyspola.146.413

    • Related Report
      2024 Research-status Report
    • Peer Reviewed / Open Access
  • [Presentation] ろう・難聴者による読み上げ文の明瞭度評価2025

    • Author(s)
      小林彰夫, 安啓一
    • Organizer
      日本音響学会2025年春季研究発表会
    • Related Report
      2024 Research-status Report
  • [Presentation] 日本語諸方言コーパスを利用した全国地域方言の言語モデルおよび識別モデルの構築と比較分析2024

    • Author(s)
      神谷悠太, 甲斐充彦, Raufun Nahar, 中川聖一
    • Organizer
      日本音響学会2024年秋季研究発表会
    • Related Report
      2024 Research-status Report
  • [Presentation] Comparative Analysis of Nationwide Dialect-region Identification Models and ASR Models using Corpus of Japanese Dialects2024

    • Author(s)
      Yuta Kamiya, Atsuhiko Kai, Raufun Nahar, Seiichi Nakagawa
    • Organizer
      2024 APSIPA China-Japan Joint Symposium on Speech and Language Processing
    • Related Report
      2024 Research-status Report
    • Int'l Joint Research
  • [Presentation] A Parameter-Efficient Multi-Step Fine-Tuning of Multilingual and Multi-Task Learning Model for Japanese Dialect Speech Recognition2024

    • Author(s)
      Yuta Kamiya, Shogo Miwa, Atsuhiko Kai
    • Organizer
      2024 27th Conference of the Oriental COCOSDA International Committee for the Co-ordination and Standardisation of Speech Databases and Assessment Techniques (O-COCOSDA)
    • Related Report
      2024 Research-status Report
    • Int'l Joint Research
  • [Presentation] Comparison of Large Pre-trained Models and Adaptation Methods for Japanese Dialects ASR2024

    • Author(s)
      Naoki Takahashi, Shogo Miwa, Yuta Kamiya, Takumi Toyama, Raufun Nahar, Atsuhiko Kai
    • Organizer
      2024 IEEE 13th Global Conference on Consumer Electronics (GCCE)
    • Related Report
      2024 Research-status Report
    • Int'l Joint Research
  • [Presentation] Elderly speech recognition using Whisper and speaker adaptation2024

    • Author(s)
      Kazumasa Yamamoto, Kosei Fukuhara, Seiichi Nakagawa
    • Organizer
      2024 IEEE 13th Global Conference on Consumer Electronics (GCCE)
    • Related Report
      2024 Research-status Report
    • Int'l Joint Research

URL: 

Published: 2024-04-11   Modified: 2025-12-26  

Information User Guide FAQ News Terms of Use Attribution of KAKENHI

Powered by NII kakenhi