[Long Review] Hurdles to Progress in Long Form Question Answering

Tutorials

[长篇评论] 长篇问答进展中的障碍

长篇问答是那些在排行榜上看起来令人印象深刻、在显微镜下令人不安的基准之一。

长篇问答是那些在排行榜上看起来令人印象深刻、在显微镜下令人不安的基准之一。这篇论文在Jeff Dean的2021年Google研究回顾中被指出,解剖了ELI5风格问题上的c-REALM系统,并发现许多所谓的改进是评估制品、检索噪声和数据集重叠的结果,而不是真正的推理收益。

长篇评论揭示了具体的障碍:奖励流畅幻觉的自动指标、几乎不影响生成答案的检索组件,以及导致分数膨胀的训练-测试污染。对于构建对话代理或由RAG驱动的语音助手的语音AI团队来说(用户在其中提出混乱的开放式问题),这些要点直接相关,因为TTS语音阅读看似合理但错误的长篇答案是独特危险的。如果你正在基准测试检索增强QA,并想避免发布稍后必须撤回的数字,请在阅读列表中为其分配一个位置。