[Long Review] 장문 질의응답 진전의 장애물
장문 질의응답은 리더보드에서는 인상적으로 보이지만 자세히 살펴보면 불안한 벤치마크 중 하나입니다.
장문 질의응답은 리더보드에서는 인상적으로 보이지만 자세히 살펴보면 불안한 벤치마크 중 하나입니다. Jeff Dean의 2021 Google 연구 회고에서 언급된 이 논문은 ELI5 스타일 질문에 대한 c-REALM 시스템을 분석하고, 소위 개선이라고 불리는 많은 것들이 실제 추론 이득이 아니라 평가, 검색 노이즈, 그리고 데이터 세트 겹침의 인공물임을 발견합니다.
장문 리뷰는 구체적인 장애물을 풀어냅니다: 유창한 환각에 보상하는 자동 메트릭, 생성된 답변에 거의 영향을 주지 않는 검색 구성 요소, 그리고 점수를 부풀리는 훈련-테스트 오염. 대화형 에이전트를 구축하거나 사용자가 복잡한 개방형 질문을 하는 RAG 기반 음성 보조를 구축하는 음성 AI 팀들을 위해, 요점은 직접 중요합니다. TTS 음성이 그럴듯하지만 틀린 장문 답변을 읽는 것은 유일하게 위험하기 때문입니다. 검색 증강 QA를 벤치마킹하고 나중에 돌아가야 할 숫자를 게시하는 것을 피하려면 읽기 목록에 이를 포함시키세요.
