HiFi-GAN评述:用于高效和高保真语音合成的生成对抗网络
长期以来,神经声码器迫使你选择一方:像WaveNet这样的自回归模型给你华丽的音频但速度缓慢,而基于GAN的波形生成器很快但质量明显较低。
披露 OpenAI GPT-4 的视觉+文本模型、数据和训练成本(推测)
众所周知,OpenAI 拒绝披露 GPT-4 的架构、参数数量、训练数据或计算预算,这使得技术报告成为 ML 社区的罗夏测试。
OpenAI 的 GPT-3 深度评论:语言模型是少次学习者(第 3/3 部分:结果和其他)
这个三部分 GPT-3 深度讨论的最后一部分到达了精彩部分:当您在基准套件上投入 1750 亿个参数并完全跳过微调时实际会发生什么。
[10分钟] 解释为什么OpenAI的Whisper API不如ChatGPT
Whisper引起了轰动,但它并没有像GPT-3改造NLP那样改造ASR,这个十分钟的评论论证原因就在论文本身。
VALL-E 深度评测:神经编解码语言模型零样本文本转语音合成器
从三秒参考音频片段实现零样本 TTS 曾看似不可能,直到 VALL-E 问世。这篇深度评测深入揭示了微软是如何做到的。
ChatGPT/ChatGPT Plus/InstructGPT:用人类反馈训练语言模型以遵循指令
ChatGPT 产品背后是 InstructGPT 论文,这次详细评测拆解了如何将原始 GPT-3 转变为人们真正想对话的系统的流程。
[Olewave评论] CLIP (3/3): 从自然语言监督学习可转移的视觉模型
CLIP评论的最后一部分聚焦于结果部分,这是OpenAI对比图文模型从有趣想法转变为整个多模态堆栈基础原语的时刻。
[Olewave评论] CLIP (2/3): 从自然语言监督学习可转移的视觉模型
OpenAI的CLIP通过抛弃固定标签集,转而在从互联网上抓取的4亿个(图像、文本)对上进行训练,改变了计算机视觉的游戏规则。
[Olewave评论] 使用组合式端到端模型进行SLU的Token级序列标签
端到端SLU正在蓬勃发展,但将序列标签视为序列预测却悄悄地丢弃了数十年来被充分理解的token级标签机制。
[Olewave的评论] Branchformer:并行MLP-注意力架构和E-Branchformer
Conformer多年来一直是ASR编码器的标杆,但Branchformer及其后续产品E-Branchformer有力地论证了顺序卷积加注意力并不是唯一的路径。
非冲突误发音添加(NCMA)用于口音ASR
带口音和非母语的语音会以隐蔽的方式破坏发音字典,从而污染你的声学模型对齐,这项Interspeech 2021的工作提出了一个看似简单的问题:如果我们只是将检测到的
[Olewave的评论] OpenAI的Whisper ASR:通过大规模弱监督实现鲁棒语音识别
当OpenAI发布Whisper时,ASR社区不得不面对一个在680,000小时的多语言、多任务、网络爬取音频上训练的系统,该系统在口音、背景噪音和技术方面开箱即用
Olewave的最详细RNN-T说明:使用递归神经网络进行序列转导
Alex Graves的RNN-T论文是如今几乎所有流式ASR系统的隐形祖先,从Google的设备端识别器到NeMo、ESPnet等中的无数开源转导器堆栈。
Google因Blake Lemoine声称AI机器人有意识而解雇他?LaMDA或ChatGPT能像人类一样思考吗?
当Google因Blake Lemoine公开声称LaMDA已具备意识而解雇他时,这个故事火遍网络,但根本问题却挥之不去:LaMDA和ChatGPT这样的大型语言模型真的会思考吗,
[Olewave的长篇评论] 语音识别神经转导器的高效训练
神经转导器是流式ASR的主力,但有效地训练它们是出了名的痛苦:RNN-T损失在序列长度上具有立方内存,对齐格在长语音上爆炸,而单
[Olewave长评] Xception: 具有深度可分卷积的深度学习
Xception将Inception假设推向了逻辑极端,通过将跨通道和空间相关性分解为完全独立的操作,而它推广的深度可分卷积现在随处可见
