[Long Review] Hurdles to Progress in Long Form Question Answering

Tutorials

[ロングレビュー] 長形式質問応答における進捗の障害

長形式質問応答は、リーダーボード上では印象的に見えますが、顕微鏡で見ると不安になるようなベンチマークの1つです。

長形式質問応答は、リーダーボード上では印象的に見えますが、顕微鏡で見ると不安になるようなベンチマークの1つです。Jeff Deanの2021年Google研究レトロスペクティブで取り上げられたこの論文は、ELI5スタイルの質問に対するc-REALMシステムを分析し、いわゆる多くの改善が実際の推論の利得ではなく、評価の人工物、検索ノイズ、およびデータセット重複の結果であることを発見しています。

このロングレビューは、特定の障害について説明します: 流暢な幻覚に報酬を与える自動メトリクス、生成された回答にほとんど影響を与えない検索コンポーネント、スコアを膨らませる訓練テスト間の汚染です。会話エージェントやRAGを活用した音声アシスタントを構築する音声AIチームでは、ユーザーが厄介でオープンエンドの質問を尋ねる場合、これらの知見は直接的に重要です。なぜなら、TTSボイスがもっともらしいが誤った長形式の回答を読む場合、それはユニークに危険だからです。検索拡張QAをベンチマークしており、後で撤回しなければならない数字の公開を避けたい場合は、この論文をあなたの読書リストに追加すべきです。