HiFi-GAN 回顾:高效且高保真语音合成的生成对抗网络
长期以来,神经声码器迫使您选择立场:像 WaveNet 这样的自回归模型给您华丽的音频但速度惊人地缓慢,而基于 GAN 的波形生成器速度快但质量明显更低。
揭露OpenAI GPT-4的視覺+文本模型、數據和訓練成本(推測)
OpenAI以拒絕披露GPT-4的架構、參數計數、訓練數據或計算預算而聞名,這使該技術報告成為ML社區的羅夏測試。
OpenAI的GPT-3深度評論:語言模型是少樣本學習者(第3/3部分:結果和其他)
這個三部分GPT-3深度探討的最終部分達到了回報:當您向基準套件投入1750億個參數並完全跳過微調時,實際會發生什麼。
[10 分鐘] 解釋為什麼 OpenAI 的 Whisper API 不如 ChatGPT
Whisper 橫空出世,但它沒有像 GPT-3 改造 NLP 那樣重塑 ASR,這份十分鐘的評論認為原因都在論文本身。
OpenAI GPT-3 的深度評論:語言模型是小樣本學習者(第 1/3 部分:介紹與方法)
這份三部分 GPT-3 評論的開篇為那篇將規模從研究賭注變成行業聖經的論文奠定了基礎。
VALL-E 深度評測:神經編解碼語言模型是零樣本文本轉語音合成器
從三秒參考音頻剪輯實現零樣本 TTS 曾聽起來不太可能,直到 VALL-E 推出,這篇深度評測正好揭示了 Microsoft 如何實現這一點。
三分鐘了解 Microsoft 的 VALL-E(SOTA 零樣本 TTS)
VALL-E 是 TTS 停止像信號迴歸一樣發展、開始像語言建模一樣發展的時刻,這個快速講解器能讓你快速上手。
ChatGPT/ChatGPT Plus/InstructGPT:使用人類反饋訓練語言模型來遵循指令
在 ChatGPT 產品背後是 InstructGPT 論文,這篇詳細評測拆解了將原始 GPT-3 轉變為人們真正想要對話的東西的管道。
三分鐘內解釋 ChatGPT/ChatGPT Plus 如何運作
ChatGPT 從外面看起來像魔法,但其配方是有據可查的(如果你知道去哪裡找的話),這個三分鐘的講解器濃縮了核心思想。
[Olewave 評測] CLIP (3/3): 從自然語言監督學習可轉移的視覺模型
這份 CLIP 評測的最後部分著重於結果部分,這正是 OpenAI 的對比式影像-文字模型從一個有趣的想法轉變為整個多模態堆疊基礎層原始構件的地方。
[Olewave 評測] CLIP (2/3): 從自然語言監督學習可轉移的視覺模型
OpenAI 的 CLIP 通過拋棄固定標籤集並改為在從網際網路上抓取的 4 億個(影像、文字)配對上進行訓練,翻轉了計算機視覺的劇本。
[Olewave 評測] CLIP (1/3): 從自然語言監督學習可轉移的視覺模型
在有 BLIP、LLaVA 或任何值得一提的 speech-LLM 之前,有 CLIP,這正是故事開始的地方。
[Olewave的評論] Branchformer:並行MLP-注意力架構和E-Branchformer
多年來,Conformer一直是最難超越的ASR編碼器,但Branchformer及其後續作品E-Branchformer令人信服地表明,順序卷積加注意力並不是唯一的路徑。
用於帶口音ASR的非碰撞誤讀音添加(NCMA)
帶口音和非母語語音會以悄無聲息的方式破壞發音詞典,進而毒害您的聲學模型對齊,而這項Interspeech 2021的工作提出了一個看似簡單的問題:如果我們只是添加了de
[Olewave的評論] OpenAI的Whisper ASR:通過大規模弱監督進行強大的語音識別
當OpenAI推出Whisper時,ASR社區不得不面對一個在680,000小時多語言、多任務、網絡爬取音頻上訓練的系統,該系統開箱即用,跨越口音、背景噪音和技術
Olewave 最詳細的 RNN-T 說明:使用遞迴神經網路的序列轉導
Alex Graves 的 RNN-T 論文是當今幾乎每個上線串流 ASR 系統的無聲先驅,從 Google 的裝置內辨識器到 NeMo、ESPnet 及其他眾多開源轉導器堆疊。
Google 因 Blake Lemoine 說 AI 機器人具有感知能力而解僱他?LaMDA 或 ChatGPT 像人類一樣思考嗎?
當 Google 因 Blake Lemoine 公開聲稱 LaMDA 已變得具有感知能力而解僱他時,這個故事引起了轟動,但底層問題仍然存在:像 LaMDA 和 ChatGPT 這樣的大型語言模型是否真正思考,
[Olewave 的長評] 語音辨識神經轉導器的有效訓練
神經轉導器是串流 ASR 的主力,但有效地訓練它們有名地困難:RNN-T 損失在序列長度上具有立方記憶、對齐格點在長話語上爆炸,而單一
Boris Johnson 的興衰 - 麥克風分析
政治新聞通常不是聲音 AI 工程師在週五下午準備的東西,但 Boris Johnson 的辭職聲明是在一排麥克風前發表的,當時他的政黨因一系列醜聞而背叛
[Olewave 長評論] Xception:深度學習與深度可分離卷積
Xception 將 Inception 假說推向邏輯極端,通過將跨通道和空間相關性推入完全分離的操作,其所推廣的深度可分離卷積現已隨處可見
中國航空母艦福建 003 上的相控陣雷達及其與語音波束形成的聯繫
中國最新航空母艦福建 003 上安裝的相控陣雷達和讓你的智能音箱在嘈雜房間裡聽到你說話的麥克風陣列實際上基於相同的底層數學。
