| 研究課題/領域番号 |
23K28378
|
| 補助金の研究課題番号 |
23H03689 (2023)
|
| 研究種目 |
基盤研究(B)
|
| 配分区分 | 基金 (2024) 補助金 (2023) |
| 応募区分 | 一般 |
| 審査区分 |
小区分90020:図書館情報学および人文社会情報学関連
|
| 研究機関 | 東京大学 |
研究代表者 |
宮田 玲 東京大学, 大学院教育学研究科(教育学部), 講師 (70804300)
|
| 研究分担者 |
藤田 篤 国立研究開発法人情報通信研究機構, ユニバーサルコミュニケーション研究所先進的音声翻訳研究開発推進センター, 主任研究員 (10402801)
阪本 章子 関西大学, 外国語学部, 教授 (40964705)
香川 璃奈 国立研究開発法人産業技術総合研究所, 情報・人間工学領域, 主任研究員 (10824675)
|
| 研究期間 (年度) |
2024-04-01 – 2027-03-31
|
| 研究課題ステータス |
交付 (2024年度)
|
| 配分額 *注記 |
17,810千円 (直接経費: 13,700千円、間接経費: 4,110千円)
2026年度: 3,120千円 (直接経費: 2,400千円、間接経費: 720千円)
2025年度: 4,420千円 (直接経費: 3,400千円、間接経費: 1,020千円)
2024年度: 5,200千円 (直接経費: 4,000千円、間接経費: 1,200千円)
2023年度: 5,070千円 (直接経費: 3,900千円、間接経費: 1,170千円)
|
| キーワード | 自治体情報発信 / 対訳用語集 / 翻訳の規準・ガイドライン / 聞き取り調査 / 機械翻訳研究用データセット / 翻訳資源 / 機械翻訳 / 自治体支援 / 文書アーカイブ / 翻訳メモリ / 翻訳テクノロジー / 多言語用語集 |
| 研究開始時の研究の概要 |
本研究では、自治体による住民向けの多言語情報発信を支援するために、自治体横断的に利用できる翻訳資源を構築し、公開する。 翻訳資源は、翻訳文書アーカイブ(各種の情報を付与し、整理した対訳文書の集合)、拡張翻訳メモリ(内容・スタイル・用語を統制し、テンプレート化した対訳文の集合)、統制対訳用語集(標準的な表記を定めた対訳用語集)の3つから構成され、文書・文・用語の各レベルでのテキストの再利用と統制を可能とする。また、翻訳資源を訓練データとして活用した機械翻訳を実装する。構築した翻訳資源は、多面的に評価・検証した 上で、その利用ツール・ガイドとともに公開する。
|
| 研究実績の概要 |
2024年度は、以下の研究を進めた。 (1)自治体文書の基礎データの収集:前年度に引き続き、日本の自治体ウェブサイトを広く対象として、機械学習・統計的分析用データを収集した。 (2)自治体向け聞き取り調査:前年度に準備した、自治体における翻訳業務の課題・ニーズに関する調査アンケートを、2つの自治体で実施した。また、アンケートを実施した自治体を含む3自治体を対象に、翻訳業務担当部署へのインタビュー調査を行い、翻訳業務や翻訳技術の活用に関する具体的な課題を整理した。 (3)情報発信状況の調査:日本の自治体ウェブサイトを対象に、自治体住民向けに発信されている情報の網羅性の調査(対象:10自治体)と多言語化状況の調査(対象:全1788自治体)を行った。 (4)翻訳資源の構築:(a)被災者支援分野の日中用語集を作成・整備した。その際、用語集翻訳の規準として、規範性、正確性、形式的妥当性、理解容易性、参照可能性、用語性、通用性、一貫性、識別性を定めた。各用語にはこれらの規準をそれぞれどれだけ満たしているかの評価情報も付与した。(b)自治体分野の用語集に対する付加情報として、各用語の定義文を日本の法令や省庁・自治体サイトから収集した。また、翻訳・文書作成等の実務での活用可能性をさらに高めるために、定義文の平易な説明方法を検討した。(c)自治体情報に関する文書テンプレートである「ユニバーサルメニュー標準テンプレート」の日英翻訳結果を分析し、翻訳ガイドラインの作成を進めた。 (5)機械翻訳研究用データセットの構築:前年度に構築した機械翻訳文と人手後編集文のデータセット(MTPEdocs)に対して、翻訳イシューラベルを人手で付与したデータセット(MTPEdocs-MQM)を作成し、クリエイティブコモンズライセンス(CC BY-NC-SA)で公開した。
|
| 現在までの達成度 |
現在までの達成度
2: おおむね順調に進展している
理由
自治体での聞き取り調査が進み、自治体における翻訳技術の活用に関する課題やニーズの洗い出しに一定の目処が立った。 用語集を中心に翻訳資源の構築も着実に進展している。著作権の処理の都合で文・文書レベルの翻訳資源の選定に想定以上の時間がかかっているが、大規模言語モデルを活用することで、テキストデータの加工・整備の効率化を図ることができた。 また、次年度に本格化する応用課題に向けて、機械学習・統計解析用の自治体分野テキストデータの大規模な収集も進んでいる。
|
| 今後の研究の推進方策 |
基本的に当初の計画に基づき、今後は主に翻訳資源の活用に関する研究を進める。 自治体分野に特化した機械翻訳の構築を進める。従来型のニューラル機械翻訳手法だけでなく、大規模言語モデルを用いた機械翻訳手法を試す。これまで構築した翻訳資源は、モデルの微調整や検索拡張生成のデータとして活用できる。 また、自治体の協力のもとで、構築した翻訳資源とツールを実務翻訳フローで活用するモデルの提案と検証を行う。 構築・検証した翻訳資源とツールは、順次公開を進める。研究成果を国内外の学会・ 論文誌で発表することに加え、自治体向けのアウトリーチ活動にも取り組む。
|