評測 Microsoft 的 VALL-E 2(在零樣本 TTS 中達到人類均等性)
零樣本 TTS 剛剛跨越了許多人認為還需要數年才能達到的界線:Microsoft 的 VALL-E 2 是首個在 LibriSpeech 和 VCTK 上同時達到人類均等性的神經編解碼語言模型,涵蓋穩健性、自然性和說話人
評測 DiTAR:用於語音生成的擴散 Transformer 自迴歸建模 ~ Seed-TTS
Seed-TTS 團隊帶著 DiTAR 回來了,這是對現代語音生成中最尷尬的權衡之一的乾淨答案:你如何在保持連續語音表示的靈活性而不支付計算
評測 ByteDance/Tiktok 的 Seed-TTS:一系列高質量的通用語音生成模型
ByteDance 的 Seed-TTS 是迄今為止最強烈的信號之一,表明 TTS 正在從組件升級為真正的基礎模型。
是什麼讓Olewave的語音資料清理管道有效且獨特
Olewave的Olign管道如何將原始音訊轉變為可投入生產的ASR/TTS訓練資料——經過驗證的轉錄、詞級時間戳和置信度分數,無需人工標記。
從OpenAI Whisper到您的自研ASR服務:識別名稱實體和特定領域術語
Whisper開箱即用令人印象深刻,但任何實際將其投入生產的人都知道痛點:它在專有名詞、產品名稱、醫學術語、法律術語和整個領域詞彙的長尾上表現不佳
Meta的Movie Gen與OpenAI的Sora:詳細評測
Meta最終對Sora出牌,Movie Gen不僅僅是一個影片生成器——它是一批基礎模型,可跨多個長寬比產生1080p高清影片,具有同步音訊,支援精確
推導 OpenAI GPT-4o 的神經網路架構
OpenAI 尚未發表關於 GPT-4o 的論文,所以這段影片做了次好的事:根據 OpenAI 實際展示的能力,反向工程推導神經網路架構幾乎肯定是什麼樣子
Google 的通用語音模型在 100+ 語言上擊敗 OpenAI 的 Whisper 模型
Google 的通用語音模型悄悄做了一件非凡的事:在 100+ 語言上的 ASR 方面與 OpenAI 的 Whisper 相當或超越,同時使用大約七分之一的標記訓練資料。
Olewave 在 ICASSP 2024
我們是 IEEE ICASSP 2024 在首爾的贊助商和參展商,我們的創始人兼 CEO Wei Chu 發表了一場關於從野生、網路來源資料訓練語音模型的聚焦演講。
利用野生資料進行高投資回報率語音 R&D——我們的 ICASSP 2024 聚焦演講
我們的創始人兼 CEO Wei Chu 的 ICASSP 2024 聚焦演講,關於為什麼傳統語音服務構建的投資回報率低——以及過濾野生資料 + 使用大型開源語音模型自動標記私有資料如何改變局面。
長評:Apple的MM1:多模態LLM預訓練的方法、分析與洞察
Apple發佈資料很少,當MM1論文發佈並附帶對多模態LLM預訓練的完整消融研究時,它成為今年對任何構建MLLMs的人來說最有用的數據發佈之一。
快速評論:Apple的SOTA多模態LLM:MM1
如果您沒有時間進行完整的MM1分析,這個快速評論在幾分鐘內為您提供要點:Apple構建的內容、他們從架構和數據的消融中學到的知識,以及哪些設計決策
Claude 3勝過GPT-4的秘密
當Claude 3 Opus在MMLU、GPQA、GSM8K和大多數前沿評估基準上勝過GPT-4時,有趣的問題不是Anthropic是否只是進行了更大規模的擴展——而是什麼訓練時間的秘密醬料
變分自編碼器(VAE)和重新參數化技巧 - 重溫經典生成模型
在擴散模型出現之前,在正規化流出現之前,在潛在擴散模型悄悄地將 VAE 編碼器融入每個認真的生成堆棧之前——有 Kingma 和 Welling 在 2013 年發表的論文介紹變分自編碼
Microsoft+OpenAI、Google、Meta 和 Nvidia 開源大型語音模型用於 ASR 的評論
每個主要人工智能實驗室現在都發布了用於 ASR 的開源大型語音模型,為生產環境選擇合適的模型已成為一個真正的決策。
[詳細論文閱讀] Zipformer:用於自動語音識別的更快更好的編碼器
Conformer 多年來一直是默認的 ASR 編碼器,但 k2/icefall 團隊的 Zipformer 在保持更快和更輕的同時,悄悄奪得了 LibriSpeech、Aishell-1 和 WenetSpeech 上的 WER 冠軍。
Tycho:用於構建高 ROI 自研語音相關服務(ASR/TTS/翻譯)的工具包:概述
大多數希望擁有自研 ASR、TTS 或語音翻譯服務的團隊面臨相同的混亂選擇:將 ESPnet、NeMo、k2 和 HuggingFace 的片段粘合在一起,或將一切交給雲 API 並按分鐘支付費用
從 OpenAI 的 Whisper 模型到自研 ASR 服務:後處理和語言建模
原始 Whisper 輸出開箱即用確實令人印象深刻,但任何將其部署給真實用戶的人都知道演示轉錄文本和下游系統實際可以消費的東西之間存在差距。
從 OpenAI 的 Whisper 模型到自研 ASR 服務:長音訊和串流(第三部分)
Whisper 是在 30 秒的音訊片段上訓練的,當你給它一個兩小時的播客或試圖將其連接到即時字幕管道時,這一點就顯而易見了。
從 OpenAI 的 Whisper 模型到自研 ASR 服務:投資回報率(第二部分)
ASR 的建設與購買問題通常被框架為精度與便利性,但真正的決定因素是產品生命週期內的投資回報率。
為什麼 OpenAI Whisper 生成的詞級時間戳不準確?如何讓它們再次準確?
向 Whisper 索取詞級時間戳,你會得到數字返回——但如果你曾經嘗試將它們與實際音頻對齐進行卡拉OK、字幕或配音,你就知道它們會漂移、對齐到錯誤的邊界,並偶爾
SpeechT5 回顾:将 Google 的 T5 引入语音(ASR、TTS、SID 等)任务
T5 在单一的编码器-解码器预训练框架下统一了文本到文本的任务,成为 NLP 的主力。
DeepMind WaveNet TTS/音频合成回顾(看起来像 GPT 吗?)
在 Tacotron 之前,在 VALL-E 之前,在神经编码器将音频转换为令牌之前,DeepMind 的 WaveNet 是展示神经网络可以逐样本生成原始音频波形并击败所有参数化和
