[10 mins] Explain Why OpenAI's Whisper API Isn't As Good As ChatGPT

Tutorials

[10분] OpenAI의 Whisper API가 ChatGPT만큼 좋지 않은 이유 설명

Whisper는 큰 성공을 거두었지만, GPT-3이 NLP를 재편했던 방식으로 ASR을 재편하지는 못했습니다. 이 10분짜리 리뷰는 그 이유가 논문 자체에 내재되어 있다고 주장합니다.

Whisper는 큰 성공을 거두었지만, GPT-3이 NLP를 재편했던 방식으로 ASR을 재편하지는 못했습니다. 이 10분짜리 리뷰는 그 이유가 논문 자체에 내재되어 있다고 주장합니다. 이 모델은 웹에서 스크래핑한 680,000시간의 다국어, 다중 작업 지도 학습 데이터로 훈련되었으며, 악센트, 배경 소음, 기술 어휘에 대한 견고성을 진정으로 향상시키면서 영어로의 번역을 보너스로 추가했습니다. 그러나 그 도약은 ChatGPT가 텍스트에 대해 한 일과 비교하면 점진적으로 느껴졌습니다.

동영상은 이유를 자세히 살펴봅니다: 웹 전사의 약한 지도는 깨끗한 레이블이 있는 데이터와 다른 실패 모드를 가지며, ASR 한계는 다음 토큰 예측이 아닌 방식으로 음향 모호성에 의해 설정되며, 모델의 제로샷 일반화는 LLM의 인컨텍스트 학습처럼 복합되지 않습니다. Whisper를 미세 조정할지, NeMo 또는 ESPnet 모델로 바꿀지, 또는 다음 세대의 음성 기초 모델을 기다릴지 결정하는 모든 사람에게 여기서의 프레이밍이 유용합니다. 프로덕션에서 ASR을 출시하는 경우 5분의 가치가 있는 빠르고 의견이 담긴 견해입니다.