从OpenAI Whisper到您的自研ASR服务:识别命名实体和特定领域术语
开箱即用的Whisper令人印象深刻,但任何真正将其投入生产的人都知道其中的痛点:它在处理专有名词、产品名称、医学术语、法律术语和整个特定领域词汇的长尾部分时容易出错
Olewave 参加 ICASSP 2024
我们是 IEEE ICASSP 2024 在首尔的赞助商和参展商,我们的创始人兼首席执行官韦楚进行了一场关于从野生、网络数据训练语音模型的聚焦演讲
变分自编码器(VAE)与重参数化技巧 - 重温经典生成模型
扩散模型出现前,标准化流出现前,潜在扩散模型悄悄地将VAE编码器植入每一个严肃的生成堆栈之前——有Kingma和Welling在2013年发表的论文介绍了变分自编码器
Microsoft+OpenAI、Google、Meta和Nvidia开源大型语音模型ASR评测
如今每个主要的AI实验室都推出了开源大型语音模型用于ASR,为生产系统选择合适的一个已成为真正的决策问题。
Tycho:用于构建高ROI自研语音相关服务(ASR/TTS/Translation)的工具包:概述
大多数想要自研ASR、TTS或语音翻译服务的团队面临同样混乱的选择:将ESPnet、NeMo、k2和HuggingFace的片段粘合在一起,或将一切交给云API并按分钟付费
从OpenAI的Whisper模型到自研ASR服务:后处理和语言建模
原始Whisper输出开箱即用,令人印象深刻,但任何真正将其交付给用户的人都知道演示转录和下游系统能实际使用的内容之间的差距。
从OpenAI的Whisper模型到自研ASR服务:长音频和流式处理(第3部分)
Whisper在30秒的数据块上进行了训练,当您向其馈送两小时的播客或尝试将其连接到实时字幕管道时,这一点就显而易见了。
从OpenAI的Whisper模型到自研ASR服务:ROI(投资回报率)(第2部分)
对于ASR,'自建还是购买'的问题通常被框架化为准确性与便利性的权衡,但真正的决定因素是产品生命周期内的ROI。
为什么OpenAI Whisper生成的词时间戳不准确?如何再次使其准确?
向Whisper请求词时间戳,你会得到数字——但如果你曾经尝试将它们与实际音频对齐以进行卡拉OK、字幕或配音,你就知道它们漂移、卡在错误的边界上,有时会
HiFi-GAN评述:用于高效和高保真语音合成的生成对抗网络
长期以来,神经声码器迫使你选择一方:像WaveNet这样的自回归模型给你华丽的音频但速度缓慢,而基于GAN的波形生成器很快但质量明显较低。
VALL-E 深度评测:神经编解码语言模型零样本文本转语音合成器
从三秒参考音频片段实现零样本 TTS 曾看似不可能,直到 VALL-E 问世。这篇深度评测深入揭示了微软是如何做到的。
非冲突误发音添加(NCMA)用于口音ASR
带口音和非母语的语音会以隐蔽的方式破坏发音字典,从而污染你的声学模型对齐,这项Interspeech 2021的工作提出了一个看似简单的问题:如果我们只是将检测到的
[短评论] Conformer: 用于语音识别的卷积增强 Transformer
Conformer 通过做一件几乎无聊的事——在每个 Transformer 块中添加卷积模块,使模型一次性捕捉全局上下文和局部声学细节——震撼了 ASR 世界。
[长评] Wav2Seq:使用伪语言预训练语音到文本编码器-解码器模型
大多数语音预训练集中在编码器侧,wav2vec、HuBERT、WavLM,但序列到序列ASR也需要预训练的解码器。
[长篇评论] 数据去重使语言模型更好
数据去重听起来很无聊,直到你了解到一个61词的句子在C4中出现了超过60,000次,以及用这些语料库训练的语言模型会以令人不安的方式向用户吐出训练集中的文本
三胞胎般的俄罗斯花样滑冰运动员:Kullback-Leibler 散度能用来区分他们吗?
说话人自适应是那些 ASR 问题之一,听起来似乎已经解决,直到你实际尝试自适应一个序列到序列模型而不破坏编码器来之不易的声学表示。
HuBERT:通过隐藏单元掩蔽预测进行自监督语音表示学习
wav2vec 2.0 通过对比自监督改变了一切,但 HuBERT 提出了一个更尖锐的问题:如果我们完全跳过对比技巧,只在语音上进行 BERT 风格的掩蔽预测呢?
