iOS 16 全新听写功能如何工作?一位语音研究员揭秘苹果的秘制配方!
苹果 iOS 16 的听写功能完全在设备本地运行,这一设计选择对延迟、隐私以及手机上可行的 ASR 架构类型产生连锁影响。
[长评论] Conformer: 用于语音识别的卷积增强 Transformer
Conformer 是那个悄悄接管端到端 ASR 的模型,其配方——在每个 Transformer 块上添加卷积模块——被证明是那些看似简单但行之有效的想法之一。
[短评论] Conformer: 用于语音识别的卷积增强 Transformer
Conformer 通过做一件几乎无聊的事——在每个 Transformer 块中添加卷积模块,使模型一次性捕捉全局上下文和局部声学细节——震撼了 ASR 世界。
[长评] 级联扩散模型高保真图像生成
在Imagen和DALL-E 2将扩散模型作为生成图像的默认选择之前,这篇Google Brain论文阐述了许多后来的文本到图像系统悄悄借鉴的级联扩散方案:从小
[长评] 多维Transformer中的Axial Attention
对图像或视频进行完整自注意力的计算成本太高,那么你如何在不产生二次计算爆炸的情况下保持Transformer的表达能力呢?
[短评] 多维Transformer中的Axial Attention
Axial Attention是使Transformer在高维数据上保持可处理性的优雅想法之一:你不是一次对所有像素或所有时间-频率箱进行注意力计算,而是一次沿一个轴进行。
[长评] 从说话人验证迁移学习到多说话人Text-To-Speech合成
这是使零样本声音克隆实用化的论文:在具有数千个嘈杂、无转录的声音上训练说话人编码器以进行判别验证任务,然后将这些嵌入馈送到Tacotron 2 s
[短评] 从说话人验证迁移学习到多说话人Text-To-Speech合成
启动现代零样本声音克隆浪潮的Google论文具有美观简洁的架构:基于验证训练的说话人编码器、将文本加说话人嵌入转化的Tacotron 2合成器
[长评] Wav2Seq:使用伪语言预训练语音到文本编码器-解码器模型
大多数语音预训练集中在编码器侧,wav2vec、HuBERT、WavLM,但序列到序列ASR也需要预训练的解码器。
[短评] Wav2Seq:使用伪语言预训练语音到文本编码器-解码器模型
像wav2vec 2.0这样的自监督预训练给了我们很好的语音编码器,但如果您想要一个完整的编码器-解码器ASR系统,解码器仍然从零开始。
[短评] 完全分片数据并行:用更少的GPU进行更快的AI训练
完全分片数据并行是Meta对每个语音和语言团队最终都会提出的问题的答案:我们如何能够训练大一个数量级的模型,而无需配置大一个数量级的GPU?
[长篇评论] 数据去重使语言模型更好
数据去重听起来很无聊,直到你了解到一个61词的句子在C4中出现了超过60,000次,以及用这些语料库训练的语言模型会以令人不安的方式向用户吐出训练集中的文本
[长评] 经过微调的语言模型是零样本学习器
在 InstructGPT 将指令微调变成家喻户晓的术语之前,Google 的 FLAN 论文主张,通过对自然语言指令进行适度的多任务微调,可以将一个普通的 LM 变成一个出人意料的 c
[长评] 'GShard':使用条件计算和自动分片扩展巨大模型
将 Transformer 扩展到数千亿参数以上会很快变成哲学问题:你是激活整个网络来处理每个 token,还是将每个 token 路由给真正需要看到它的专家?
三胞胎般的俄罗斯花样滑冰运动员:Kullback-Leibler 散度能用来区分他们吗?
说话人自适应是那些 ASR 问题之一,听起来似乎已经解决,直到你实际尝试自适应一个序列到序列模型而不破坏编码器来之不易的声学表示。
Nathan Chen 的 4 周跳是由 Mixture-of-Experts 评判的吗?第 1 部分:Switch Transformers:稀疏 MoE 模型
带着对 Nathan Chen 四周跳评分的眨眼暗示,这次演讲详细讲述了 Switch Transformer,这是 Google 对 Mixture-of-Experts 扩展的简洁而激进的简化。
Nathan Chen的四周跳是由Mixture-of-Experts评分的吗?第2部分:GLaM:使用MoE的LMs高效扩展
MoE迷你系列的第2部分转向GLaM,Google的1.2万亿参数Mixture-of-Experts语言模型,在零样本、单样本和少样本基准上与GPT-3相当或超越,同时仅激活其约8%的参
Transformer:Attention is All You Need和Listen, Attend and Spell——从语音视角
两份论文,一个故事。"Attention Is All You Need"为世界带来了Transformer,改变了序列建模的方式,而"Listen, Attend and Spell"(LAS)一年前对端到端语音
HuBERT:通过隐藏单元掩蔽预测进行自监督语音表示学习
wav2vec 2.0 通过对比自监督改变了一切,但 HuBERT 提出了一个更尖锐的问题:如果我们完全跳过对比技巧,只在语音上进行 BERT 风格的掩蔽预测呢?
