評測 Microsoft 的 VALL-E 2(在零樣本 TTS 中達到人類均等性)
零樣本 TTS 剛剛跨越了許多人認為還需要數年才能達到的界線:Microsoft 的 VALL-E 2 是首個在 LibriSpeech 和 VCTK 上同時達到人類均等性的神經編解碼語言模型,涵蓋穩健性、自然性和說話人
從OpenAI Whisper到您的自研ASR服務:識別名稱實體和特定領域術語
Whisper開箱即用令人印象深刻,但任何實際將其投入生產的人都知道痛點:它在專有名詞、產品名稱、醫學術語、法律術語和整個領域詞彙的長尾上表現不佳
Google 的通用語音模型在 100+ 語言上擊敗 OpenAI 的 Whisper 模型
Google 的通用語音模型悄悄做了一件非凡的事:在 100+ 語言上的 ASR 方面與 OpenAI 的 Whisper 相當或超越,同時使用大約七分之一的標記訓練資料。
長評:Apple的MM1:多模態LLM預訓練的方法、分析與洞察
Apple發佈資料很少,當MM1論文發佈並附帶對多模態LLM預訓練的完整消融研究時,它成為今年對任何構建MLLMs的人來說最有用的數據發佈之一。
快速評論:Apple的SOTA多模態LLM:MM1
如果您沒有時間進行完整的MM1分析,這個快速評論在幾分鐘內為您提供要點:Apple構建的內容、他們從架構和數據的消融中學到的知識,以及哪些設計決策
Claude 3勝過GPT-4的秘密
當Claude 3 Opus在MMLU、GPQA、GSM8K和大多數前沿評估基準上勝過GPT-4時,有趣的問題不是Anthropic是否只是進行了更大規模的擴展——而是什麼訓練時間的秘密醬料
Microsoft+OpenAI、Google、Meta 和 Nvidia 開源大型語音模型用於 ASR 的評論
每個主要人工智能實驗室現在都發布了用於 ASR 的開源大型語音模型,為生產環境選擇合適的模型已成為一個真正的決策。
從 OpenAI 的 Whisper 模型到自研 ASR 服務:後處理和語言建模
原始 Whisper 輸出開箱即用確實令人印象深刻,但任何將其部署給真實用戶的人都知道演示轉錄文本和下游系統實際可以消費的東西之間存在差距。
從 OpenAI 的 Whisper 模型到自研 ASR 服務:長音訊和串流(第三部分)
Whisper 是在 30 秒的音訊片段上訓練的,當你給它一個兩小時的播客或試圖將其連接到即時字幕管道時,這一點就顯而易見了。
從 OpenAI 的 Whisper 模型到自研 ASR 服務:投資回報率(第二部分)
ASR 的建設與購買問題通常被框架為精度與便利性,但真正的決定因素是產品生命週期內的投資回報率。
為什麼 OpenAI Whisper 生成的詞級時間戳不準確?如何讓它們再次準確?
向 Whisper 索取詞級時間戳,你會得到數字返回——但如果你曾經嘗試將它們與實際音頻對齐進行卡拉OK、字幕或配音,你就知道它們會漂移、對齐到錯誤的邊界,並偶爾
SpeechT5 回顾:将 Google 的 T5 引入语音(ASR、TTS、SID 等)任务
T5 在单一的编码器-解码器预训练框架下统一了文本到文本的任务,成为 NLP 的主力。
揭露OpenAI GPT-4的視覺+文本模型、數據和訓練成本(推測)
OpenAI以拒絕披露GPT-4的架構、參數計數、訓練數據或計算預算而聞名,這使該技術報告成為ML社區的羅夏測試。
OpenAI的GPT-3深度評論:語言模型是少樣本學習者(第3/3部分:結果和其他)
這個三部分GPT-3深度探討的最終部分達到了回報:當您向基準套件投入1750億個參數並完全跳過微調時,實際會發生什麼。
[10 分鐘] 解釋為什麼 OpenAI 的 Whisper API 不如 ChatGPT
Whisper 橫空出世,但它沒有像 GPT-3 改造 NLP 那樣重塑 ASR,這份十分鐘的評論認為原因都在論文本身。
OpenAI GPT-3 的深度評論:語言模型是小樣本學習者(第 1/3 部分:介紹與方法)
這份三部分 GPT-3 評論的開篇為那篇將規模從研究賭注變成行業聖經的論文奠定了基礎。
VALL-E 深度評測:神經編解碼語言模型是零樣本文本轉語音合成器
從三秒參考音頻剪輯實現零樣本 TTS 曾聽起來不太可能,直到 VALL-E 推出,這篇深度評測正好揭示了 Microsoft 如何實現這一點。
三分鐘了解 Microsoft 的 VALL-E(SOTA 零樣本 TTS)
VALL-E 是 TTS 停止像信號迴歸一樣發展、開始像語言建模一樣發展的時刻,這個快速講解器能讓你快速上手。
ChatGPT/ChatGPT Plus/InstructGPT:使用人類反饋訓練語言模型來遵循指令
在 ChatGPT 產品背後是 InstructGPT 論文,這篇詳細評測拆解了將原始 GPT-3 轉變為人們真正想要對話的東西的管道。
三分鐘內解釋 ChatGPT/ChatGPT Plus 如何運作
ChatGPT 從外面看起來像魔法,但其配方是有據可查的(如果你知道去哪裡找的話),這個三分鐘的講解器濃縮了核心思想。
[Olewave的評論] Branchformer:並行MLP-注意力架構和E-Branchformer
多年來,Conformer一直是最難超越的ASR編碼器,但Branchformer及其後續作品E-Branchformer令人信服地表明,順序卷積加注意力並不是唯一的路徑。
[Olewave的評論] OpenAI的Whisper ASR:通過大規模弱監督進行強大的語音識別
當OpenAI推出Whisper時,ASR社區不得不面對一個在680,000小時多語言、多任務、網絡爬取音頻上訓練的系統,該系統開箱即用,跨越口音、背景噪音和技術
Olewave 最詳細的 RNN-T 說明:使用遞迴神經網路的序列轉導
Alex Graves 的 RNN-T 論文是當今幾乎每個上線串流 ASR 系統的無聲先驅,從 Google 的裝置內辨識器到 NeMo、ESPnet 及其他眾多開源轉導器堆疊。
