评测 Microsoft 的 VALL-E 2(在零样本 TTS 中实现人类水平)
零样本 TTS 刚刚越过了许多人认为还需要多年才能跨越的界线:Microsoft 的 VALL-E 2 是首个在 LibriSpeech 和 VCTK 上在鲁棒性、自然性和说话人
从OpenAI Whisper到您的自研ASR服务:识别命名实体和特定领域术语
开箱即用的Whisper令人印象深刻,但任何真正将其投入生产的人都知道其中的痛点:它在处理专有名词、产品名称、医学术语、法律术语和整个特定领域词汇的长尾部分时容易出错
推断 OpenAI GPT-4o 的神经网络架构
OpenAI 尚未发布关于 GPT-4o 的论文,所以这个视频做了次优选择:根据 OpenAI 实际展示的能力反向工程推断神经网络架构
Google 通用语音模型胜过 OpenAI 的 Whisper 模型,支持 100+ 种语言
Google 通用语音模型悄然做了一件了不起的事情:在 100+ 种语言的 ASR 上与 OpenAI 的 Whisper 相当或超过,同时使用大约七分之一的标注训练数据
长篇评测:Apple的MM1:多模态LLM预训练的方法、分析和见解
Apple不经常发表论文,所以当MM1论文发布时,其中包含了关于多模态LLM预训练的完整消融研究,这是今年对任何构建MLLM的人来说最有用的数据发布之一。
Apple的SOTA多模态LLM快速评测:MM1
如果你没有时间进行完整的MM1分解,这个快速评测会在几分钟内为你提供要点:Apple构建了什么,他们从架构和数据消融中学到了什么,以及哪些设计决策
让Claude 3超越GPT-4的秘密
当Claude 3 Opus在MMLU、GPQA、GSM8K和大多数前沿评测基准上击败GPT-4时,有趣的问题不是Anthropic是否只是规模更大——而是什么秘诀真正让他们做到了这一点。
Microsoft+OpenAI、Google、Meta和Nvidia开源大型语音模型ASR评测
如今每个主要的AI实验室都推出了开源大型语音模型用于ASR,为生产系统选择合适的一个已成为真正的决策问题。
从OpenAI的Whisper模型到自研ASR服务:后处理和语言建模
原始Whisper输出开箱即用,令人印象深刻,但任何真正将其交付给用户的人都知道演示转录和下游系统能实际使用的内容之间的差距。
从OpenAI的Whisper模型到自研ASR服务:长音频和流式处理(第3部分)
Whisper在30秒的数据块上进行了训练,当您向其馈送两小时的播客或尝试将其连接到实时字幕管道时,这一点就显而易见了。
从OpenAI的Whisper模型到自研ASR服务:ROI(投资回报率)(第2部分)
对于ASR,'自建还是购买'的问题通常被框架化为准确性与便利性的权衡,但真正的决定因素是产品生命周期内的ROI。
为什么OpenAI Whisper生成的词时间戳不准确?如何再次使其准确?
向Whisper请求词时间戳,你会得到数字——但如果你曾经尝试将它们与实际音频对齐以进行卡拉OK、字幕或配音,你就知道它们漂移、卡在错误的边界上,有时会
[10分钟] 解释为什么OpenAI的Whisper API不如ChatGPT
Whisper引起了轰动,但它并没有像GPT-3改造NLP那样改造ASR,这个十分钟的评论论证原因就在论文本身。
VALL-E 深度评测:神经编解码语言模型零样本文本转语音合成器
从三秒参考音频片段实现零样本 TTS 曾看似不可能,直到 VALL-E 问世。这篇深度评测深入揭示了微软是如何做到的。
[Olewave的评论] OpenAI的Whisper ASR:通过大规模弱监督实现鲁棒语音识别
当OpenAI发布Whisper时,ASR社区不得不面对一个在680,000小时的多语言、多任务、网络爬取音频上训练的系统,该系统在口音、背景噪音和技术方面开箱即用
Olewave的最详细RNN-T说明:使用递归神经网络进行序列转导
Alex Graves的RNN-T论文是如今几乎所有流式ASR系统的隐形祖先,从Google的设备端识别器到NeMo、ESPnet等中的无数开源转导器堆栈。
[Olewave的长篇评论] 语音识别神经转导器的高效训练
神经转导器是流式ASR的主力,但有效地训练它们是出了名的痛苦:RNN-T损失在序列长度上具有立方内存,对齐格在长语音上爆炸,而单
[长评论] Conformer: 用于语音识别的卷积增强 Transformer
Conformer 是那个悄悄接管端到端 ASR 的模型,其配方——在每个 Transformer 块上添加卷积模块——被证明是那些看似简单但行之有效的想法之一。
[短评] 完全分片数据并行:用更少的GPU进行更快的AI训练
完全分片数据并行是Meta对每个语音和语言团队最终都会提出的问题的答案:我们如何能够训练大一个数量级的模型,而无需配置大一个数量级的GPU?
