評測 Microsoft 的 VALL-E 2(在零樣本 TTS 中達到人類均等性)
零樣本 TTS 剛剛跨越了許多人認為還需要數年才能達到的界線:Microsoft 的 VALL-E 2 是首個在 LibriSpeech 和 VCTK 上同時達到人類均等性的神經編解碼語言模型,涵蓋穩健性、自然性和說話人
從OpenAI Whisper到您的自研ASR服務:識別名稱實體和特定領域術語
Whisper開箱即用令人印象深刻,但任何實際將其投入生產的人都知道痛點:它在專有名詞、產品名稱、醫學術語、法律術語和整個領域詞彙的長尾上表現不佳
推導 OpenAI GPT-4o 的神經網路架構
OpenAI 尚未發表關於 GPT-4o 的論文,所以這段影片做了次好的事:根據 OpenAI 實際展示的能力,反向工程推導神經網路架構幾乎肯定是什麼樣子
Google 的通用語音模型在 100+ 語言上擊敗 OpenAI 的 Whisper 模型
Google 的通用語音模型悄悄做了一件非凡的事:在 100+ 語言上的 ASR 方面與 OpenAI 的 Whisper 相當或超越,同時使用大約七分之一的標記訓練資料。
長評:Apple的MM1:多模態LLM預訓練的方法、分析與洞察
Apple發佈資料很少,當MM1論文發佈並附帶對多模態LLM預訓練的完整消融研究時,它成為今年對任何構建MLLMs的人來說最有用的數據發佈之一。
快速評論:Apple的SOTA多模態LLM:MM1
如果您沒有時間進行完整的MM1分析,這個快速評論在幾分鐘內為您提供要點:Apple構建的內容、他們從架構和數據的消融中學到的知識,以及哪些設計決策
Claude 3勝過GPT-4的秘密
當Claude 3 Opus在MMLU、GPQA、GSM8K和大多數前沿評估基準上勝過GPT-4時,有趣的問題不是Anthropic是否只是進行了更大規模的擴展——而是什麼訓練時間的秘密醬料
Microsoft+OpenAI、Google、Meta 和 Nvidia 開源大型語音模型用於 ASR 的評論
每個主要人工智能實驗室現在都發布了用於 ASR 的開源大型語音模型,為生產環境選擇合適的模型已成為一個真正的決策。
從 OpenAI 的 Whisper 模型到自研 ASR 服務:後處理和語言建模
原始 Whisper 輸出開箱即用確實令人印象深刻,但任何將其部署給真實用戶的人都知道演示轉錄文本和下游系統實際可以消費的東西之間存在差距。
從 OpenAI 的 Whisper 模型到自研 ASR 服務:長音訊和串流(第三部分)
Whisper 是在 30 秒的音訊片段上訓練的,當你給它一個兩小時的播客或試圖將其連接到即時字幕管道時,這一點就顯而易見了。
從 OpenAI 的 Whisper 模型到自研 ASR 服務:投資回報率(第二部分)
ASR 的建設與購買問題通常被框架為精度與便利性,但真正的決定因素是產品生命週期內的投資回報率。
為什麼 OpenAI Whisper 生成的詞級時間戳不準確?如何讓它們再次準確?
向 Whisper 索取詞級時間戳,你會得到數字返回——但如果你曾經嘗試將它們與實際音頻對齐進行卡拉OK、字幕或配音,你就知道它們會漂移、對齐到錯誤的邊界,並偶爾
SpeechT5 回顾:将 Google 的 T5 引入语音(ASR、TTS、SID 等)任务
T5 在单一的编码器-解码器预训练框架下统一了文本到文本的任务,成为 NLP 的主力。
[10 分鐘] 解釋為什麼 OpenAI 的 Whisper API 不如 ChatGPT
Whisper 橫空出世,但它沒有像 GPT-3 改造 NLP 那樣重塑 ASR,這份十分鐘的評論認為原因都在論文本身。
OpenAI GPT-3 的深度評論:語言模型是小樣本學習者(第 1/3 部分:介紹與方法)
這份三部分 GPT-3 評論的開篇為那篇將規模從研究賭注變成行業聖經的論文奠定了基礎。
VALL-E 深度評測:神經編解碼語言模型是零樣本文本轉語音合成器
從三秒參考音頻剪輯實現零樣本 TTS 曾聽起來不太可能,直到 VALL-E 推出,這篇深度評測正好揭示了 Microsoft 如何實現這一點。
三分鐘了解 Microsoft 的 VALL-E(SOTA 零樣本 TTS)
VALL-E 是 TTS 停止像信號迴歸一樣發展、開始像語言建模一樣發展的時刻,這個快速講解器能讓你快速上手。
[Olewave的評論] OpenAI的Whisper ASR:通過大規模弱監督進行強大的語音識別
當OpenAI推出Whisper時,ASR社區不得不面對一個在680,000小時多語言、多任務、網絡爬取音頻上訓練的系統,該系統開箱即用,跨越口音、背景噪音和技術
Olewave 最詳細的 RNN-T 說明:使用遞迴神經網路的序列轉導
Alex Graves 的 RNN-T 論文是當今幾乎每個上線串流 ASR 系統的無聲先驅,從 Google 的裝置內辨識器到 NeMo、ESPnet 及其他眾多開源轉導器堆疊。
[Olewave 的長評] 語音辨識神經轉導器的有效訓練
神經轉導器是串流 ASR 的主力,但有效地訓練它們有名地困難:RNN-T 損失在序列長度上具有立方記憶、對齐格點在長話語上爆炸,而單一
[長篇評論] Conformer:用於語音識別的卷積增強型 Transformer
Conformer 是悄然佔據端到端 ASR 的模型,其方法是在每個 Transformer 區塊加入卷積模組,這個看似簡單卻非常有效的想法被證實就是有效的。
[長篇評論] Fully Sharded Data Parallel:用更少 GPU 進行更快的 AI 訓練
在有限的 GPU 預算上訓練十億參數的語音或語言模型曾經意味著要在管道並行、張量並行或 ZeRO 風格的優化器分片之間做出選擇。
[短篇評論] Fully Sharded Data Parallel:用更少 GPU 進行更快的 AI 訓練
Fully Sharded Data Parallel 是 Meta 對每個語音和語言團隊最終都會提出的問題的答案:我們如何在不提供數量級更多 GPU 的情況下訓練數量級更大的模型?
