• 研究課題をさがす
  • 研究者をさがす
  • KAKENの使い方
  1. 課題ページに戻る

2024 年度 実績報告書

科学技術論文における長く複雑な文の構文解析

研究課題

研究課題/領域番号 22K17957
研究機関国立研究開発法人理化学研究所

研究代表者

寺西 裕紀  国立研究開発法人理化学研究所, 革新知能統合研究センター, 特別研究員 (50899408)

研究期間 (年度) 2022-04-01 – 2025-03-31
キーワード構文解析 / 文書エンコーディング / 文脈拡張 / 文書検索
研究実績の概要

最終年度となる2024年度は昨年度に引き続き、文書を対象に効率的かつ一貫した構文解析を行うための文書エンコーディングの開発を進めた。具体的には、文書をセグメントに分割してTransformerを用いてベクトル表現に変換・統合することで文書単位の表現を得る手法について、継続して検証を行った。本エンコーディング法がLongformerと呼ばれる長文脈処理手法と比べて、特定タスク・設定において高い性能を示すことが昨年度までに確認できた。2024年度は本アプローチに特化した事前学習モデルの開発に着手し、文書収集および学習を実施した。しかし、LongEmbedと呼ばれる類似研究が公開され、我々のモデルと比較して性能面で明確な優位性を示した。また、大規模言語モデル(LLM)の長文脈処理性能が大きく向上したことに加え、LLMを文書エンコーディングに転用する研究が発展し、関連するモデルおよびベンチマークの大規模化・多様化が進んだ。これらの状況を踏まえ、文書エンコーダの独自開発は中止し、新規手法を活用した構文解析手法の開発に注力する方針に転換した。文書エンコーディングを用いた構文解析の方法として、解析対象の文書に加えて類似文書の解析事例を補助的な入力とする文脈拡張を試行し、今年度は類似文書の検索方法および入力方法について設計・検証を行った。
研究期間全体を通じて、事前学習モデルの大規模化や生成AIと呼ばれる汎用的なLLMの進展により、文の長文化・複雑化要因に着目した構文解析の意義や設計について再評価する契機となった。本研究で得られた知見・発想は、LLMの推論能力や思考過程を補強・拡張する形で構文解析を組み込むといった、新たな応用・展開の可能性の提示に資するものとなった。

URL: 

公開日: 2025-12-26  

サービス概要 検索マニュアル よくある質問 お知らせ 利用規程 科研費による研究の帰属

Powered by NII kakenhi