OpenAI 的 GPT-3 深度评论:语言模型是少次学习者(第 3/3 部分:结果和其他)
这个三部分 GPT-3 深度讨论的最后一部分到达了精彩部分:当您在基准套件上投入 1750 亿个参数并完全跳过微调时实际会发生什么。
[10分钟] 解释为什么OpenAI的Whisper API不如ChatGPT
Whisper引起了轰动,但它并没有像GPT-3改造NLP那样改造ASR,这个十分钟的评论论证原因就在论文本身。
VALL-E 深度评测:神经编解码语言模型零样本文本转语音合成器
从三秒参考音频片段实现零样本 TTS 曾看似不可能,直到 VALL-E 问世。这篇深度评测深入揭示了微软是如何做到的。
ChatGPT/ChatGPT Plus/InstructGPT:用人类反馈训练语言模型以遵循指令
ChatGPT 产品背后是 InstructGPT 论文,这次详细评测拆解了如何将原始 GPT-3 转变为人们真正想对话的系统的流程。
[Olewave评论] CLIP (3/3): 从自然语言监督学习可转移的视觉模型
CLIP评论的最后一部分聚焦于结果部分,这是OpenAI对比图文模型从有趣想法转变为整个多模态堆栈基础原语的时刻。
[Olewave评论] CLIP (2/3): 从自然语言监督学习可转移的视觉模型
OpenAI的CLIP通过抛弃固定标签集,转而在从互联网上抓取的4亿个(图像、文本)对上进行训练,改变了计算机视觉的游戏规则。
[Olewave评论] 使用组合式端到端模型进行SLU的Token级序列标签
端到端SLU正在蓬勃发展,但将序列标签视为序列预测却悄悄地丢弃了数十年来被充分理解的token级标签机制。
[Olewave的评论] Branchformer:并行MLP-注意力架构和E-Branchformer
Conformer多年来一直是ASR编码器的标杆,但Branchformer及其后续产品E-Branchformer有力地论证了顺序卷积加注意力并不是唯一的路径。
非冲突误发音添加(NCMA)用于口音ASR
带口音和非母语的语音会以隐蔽的方式破坏发音字典,从而污染你的声学模型对齐,这项Interspeech 2021的工作提出了一个看似简单的问题:如果我们只是将检测到的
[Olewave的评论] OpenAI的Whisper ASR:通过大规模弱监督实现鲁棒语音识别
当OpenAI发布Whisper时,ASR社区不得不面对一个在680,000小时的多语言、多任务、网络爬取音频上训练的系统,该系统在口音、背景噪音和技术方面开箱即用
Olewave的最详细RNN-T说明:使用递归神经网络进行序列转导
Alex Graves的RNN-T论文是如今几乎所有流式ASR系统的隐形祖先,从Google的设备端识别器到NeMo、ESPnet等中的无数开源转导器堆栈。
Google因Blake Lemoine声称AI机器人有意识而解雇他?LaMDA或ChatGPT能像人类一样思考吗?
当Google因Blake Lemoine公开声称LaMDA已具备意识而解雇他时,这个故事火遍网络,但根本问题却挥之不去:LaMDA和ChatGPT这样的大型语言模型真的会思考吗,
[Olewave的长篇评论] 语音识别神经转导器的高效训练
神经转导器是流式ASR的主力,但有效地训练它们是出了名的痛苦:RNN-T损失在序列长度上具有立方内存,对齐格在长语音上爆炸,而单
[Olewave长评] Xception: 具有深度可分卷积的深度学习
Xception将Inception假设推向了逻辑极端,通过将跨通道和空间相关性分解为完全独立的操作,而它推广的深度可分卷积现在随处可见
iOS 16 全新听写功能如何工作?一位语音研究员揭秘苹果的秘制配方!
苹果 iOS 16 的听写功能完全在设备本地运行,这一设计选择对延迟、隐私以及手机上可行的 ASR 架构类型产生连锁影响。
[长评论] Conformer: 用于语音识别的卷积增强 Transformer
Conformer 是那个悄悄接管端到端 ASR 的模型,其配方——在每个 Transformer 块上添加卷积模块——被证明是那些看似简单但行之有效的想法之一。
[短评论] Conformer: 用于语音识别的卷积增强 Transformer
Conformer 通过做一件几乎无聊的事——在每个 Transformer 块中添加卷积模块,使模型一次性捕捉全局上下文和局部声学细节——震撼了 ASR 世界。
