從OpenAI Whisper到您的自研ASR服務:識別名稱實體和特定領域術語
Whisper開箱即用令人印象深刻,但任何實際將其投入生產的人都知道痛點:它在專有名詞、產品名稱、醫學術語、法律術語和整個領域詞彙的長尾上表現不佳
Olewave 在 ICASSP 2024
我們是 IEEE ICASSP 2024 在首爾的贊助商和參展商,我們的創始人兼 CEO Wei Chu 發表了一場關於從野生、網路來源資料訓練語音模型的聚焦演講。
變分自編碼器(VAE)和重新參數化技巧 - 重溫經典生成模型
在擴散模型出現之前,在正規化流出現之前,在潛在擴散模型悄悄地將 VAE 編碼器融入每個認真的生成堆棧之前——有 Kingma 和 Welling 在 2013 年發表的論文介紹變分自編碼
Microsoft+OpenAI、Google、Meta 和 Nvidia 開源大型語音模型用於 ASR 的評論
每個主要人工智能實驗室現在都發布了用於 ASR 的開源大型語音模型,為生產環境選擇合適的模型已成為一個真正的決策。
Tycho:用於構建高 ROI 自研語音相關服務(ASR/TTS/翻譯)的工具包:概述
大多數希望擁有自研 ASR、TTS 或語音翻譯服務的團隊面臨相同的混亂選擇:將 ESPnet、NeMo、k2 和 HuggingFace 的片段粘合在一起,或將一切交給雲 API 並按分鐘支付費用
從 OpenAI 的 Whisper 模型到自研 ASR 服務:後處理和語言建模
原始 Whisper 輸出開箱即用確實令人印象深刻,但任何將其部署給真實用戶的人都知道演示轉錄文本和下游系統實際可以消費的東西之間存在差距。
從 OpenAI 的 Whisper 模型到自研 ASR 服務:長音訊和串流(第三部分)
Whisper 是在 30 秒的音訊片段上訓練的,當你給它一個兩小時的播客或試圖將其連接到即時字幕管道時,這一點就顯而易見了。
從 OpenAI 的 Whisper 模型到自研 ASR 服務:投資回報率(第二部分)
ASR 的建設與購買問題通常被框架為精度與便利性,但真正的決定因素是產品生命週期內的投資回報率。
為什麼 OpenAI Whisper 生成的詞級時間戳不準確?如何讓它們再次準確?
向 Whisper 索取詞級時間戳,你會得到數字返回——但如果你曾經嘗試將它們與實際音頻對齐進行卡拉OK、字幕或配音,你就知道它們會漂移、對齐到錯誤的邊界,並偶爾
SpeechT5 回顾:将 Google 的 T5 引入语音(ASR、TTS、SID 等)任务
T5 在单一的编码器-解码器预训练框架下统一了文本到文本的任务,成为 NLP 的主力。
HiFi-GAN 回顾:高效且高保真语音合成的生成对抗网络
长期以来,神经声码器迫使您选择立场:像 WaveNet 这样的自回归模型给您华丽的音频但速度惊人地缓慢,而基于 GAN 的波形生成器速度快但质量明显更低。
VALL-E 深度評測:神經編解碼語言模型是零樣本文本轉語音合成器
從三秒參考音頻剪輯實現零樣本 TTS 曾聽起來不太可能,直到 VALL-E 推出,這篇深度評測正好揭示了 Microsoft 如何實現這一點。
用於帶口音ASR的非碰撞誤讀音添加(NCMA)
帶口音和非母語語音會以悄無聲息的方式破壞發音詞典,進而毒害您的聲學模型對齊,而這項Interspeech 2021的工作提出了一個看似簡單的問題:如果我們只是添加了de
[短篇評論] Conformer:用於語音識別的卷積增強型 Transformer
Conformer 通過做一件幾乎平凡的事震撼了 ASR 世界:將卷積模組粘合到每個 Transformer 區塊中,使模型一次性捕捉全域文脈和局部聲學細節。
博士大叔使用計算機作弊降維打擊2022高考數學壓軸大題 博士用計算機作弊解決2022年大學入學數學考試
當你使用研究級計算機代數工具包來解決2022年中國高考數學考試最難的問題時會發生什麼?
[長評論] Wav2Seq:使用偽語言預訓練語音轉文本編碼器-解碼器模型
大多數語音預訓練集中在編碼器端,wav2vec、HuBERT、WavLM,但序列到序列ASR也需要預訓練的解碼器。
[長篇評論] 資料去重複使語言模型更優秀
資料去重複聽起來很無聊,直到你發現 C4 中單句 61 字的句子出現超過 60,000 次,以及在這樣語料庫訓練的語言模型會以令人不安的方式向使用者吐出訓練集文本的一部分
像三胞胎一樣的俄羅斯花滑運動員:Kullback-Leibler 散度能用來區別他們嗎?
說話者自適應是那種 ASR 問題之一,聽起來已經解決,直到你實際嘗試在不破壞編碼器苦心獲得的聲學表示的情況下自適應序列到序列模型。
HuBERT:通過隱藏單位的掩蓋預測進行自監督語音表示學習
wav2vec 2.0 通過對比自監督改變了遊戲規則,但 HuBERT 提出了一個更尖銳的問題:如果我們完全跳過對比技巧,只在語音上進行 BERT 風格的掩蓋預測會怎樣?
