评测 Microsoft 的 VALL-E 2(在零样本 TTS 中实现人类水平)
零样本 TTS 刚刚越过了许多人认为还需要多年才能跨越的界线:Microsoft 的 VALL-E 2 是首个在 LibriSpeech 和 VCTK 上在鲁棒性、自然性和说话人
从OpenAI Whisper到您的自研ASR服务:识别命名实体和特定领域术语
开箱即用的Whisper令人印象深刻,但任何真正将其投入生产的人都知道其中的痛点:它在处理专有名词、产品名称、医学术语、法律术语和整个特定领域词汇的长尾部分时容易出错
Google 通用语音模型胜过 OpenAI 的 Whisper 模型,支持 100+ 种语言
Google 通用语音模型悄然做了一件了不起的事情:在 100+ 种语言的 ASR 上与 OpenAI 的 Whisper 相当或超过,同时使用大约七分之一的标注训练数据
长篇评测:Apple的MM1:多模态LLM预训练的方法、分析和见解
Apple不经常发表论文,所以当MM1论文发布时,其中包含了关于多模态LLM预训练的完整消融研究,这是今年对任何构建MLLM的人来说最有用的数据发布之一。
Apple的SOTA多模态LLM快速评测:MM1
如果你没有时间进行完整的MM1分解,这个快速评测会在几分钟内为你提供要点:Apple构建了什么,他们从架构和数据消融中学到了什么,以及哪些设计决策
让Claude 3超越GPT-4的秘密
当Claude 3 Opus在MMLU、GPQA、GSM8K和大多数前沿评测基准上击败GPT-4时,有趣的问题不是Anthropic是否只是规模更大——而是什么秘诀真正让他们做到了这一点。
Microsoft+OpenAI、Google、Meta和Nvidia开源大型语音模型ASR评测
如今每个主要的AI实验室都推出了开源大型语音模型用于ASR,为生产系统选择合适的一个已成为真正的决策问题。
从OpenAI的Whisper模型到自研ASR服务:后处理和语言建模
原始Whisper输出开箱即用,令人印象深刻,但任何真正将其交付给用户的人都知道演示转录和下游系统能实际使用的内容之间的差距。
从OpenAI的Whisper模型到自研ASR服务:长音频和流式处理(第3部分)
Whisper在30秒的数据块上进行了训练,当您向其馈送两小时的播客或尝试将其连接到实时字幕管道时,这一点就显而易见了。
从OpenAI的Whisper模型到自研ASR服务:ROI(投资回报率)(第2部分)
对于ASR,'自建还是购买'的问题通常被框架化为准确性与便利性的权衡,但真正的决定因素是产品生命周期内的ROI。
为什么OpenAI Whisper生成的词时间戳不准确?如何再次使其准确?
向Whisper请求词时间戳,你会得到数字——但如果你曾经尝试将它们与实际音频对齐以进行卡拉OK、字幕或配音,你就知道它们漂移、卡在错误的边界上,有时会
披露 OpenAI GPT-4 的视觉+文本模型、数据和训练成本(推测)
众所周知,OpenAI 拒绝披露 GPT-4 的架构、参数数量、训练数据或计算预算,这使得技术报告成为 ML 社区的罗夏测试。
OpenAI 的 GPT-3 深度评论:语言模型是少次学习者(第 3/3 部分:结果和其他)
这个三部分 GPT-3 深度讨论的最后一部分到达了精彩部分:当您在基准套件上投入 1750 亿个参数并完全跳过微调时实际会发生什么。
[10分钟] 解释为什么OpenAI的Whisper API不如ChatGPT
Whisper引起了轰动,但它并没有像GPT-3改造NLP那样改造ASR,这个十分钟的评论论证原因就在论文本身。
VALL-E 深度评测:神经编解码语言模型零样本文本转语音合成器
从三秒参考音频片段实现零样本 TTS 曾看似不可能,直到 VALL-E 问世。这篇深度评测深入揭示了微软是如何做到的。
ChatGPT/ChatGPT Plus/InstructGPT:用人类反馈训练语言模型以遵循指令
ChatGPT 产品背后是 InstructGPT 论文,这次详细评测拆解了如何将原始 GPT-3 转变为人们真正想对话的系统的流程。
[Olewave的评论] Branchformer:并行MLP-注意力架构和E-Branchformer
Conformer多年来一直是ASR编码器的标杆,但Branchformer及其后续产品E-Branchformer有力地论证了顺序卷积加注意力并不是唯一的路径。
[Olewave的评论] OpenAI的Whisper ASR:通过大规模弱监督实现鲁棒语音识别
当OpenAI发布Whisper时,ASR社区不得不面对一个在680,000小时的多语言、多任务、网络爬取音频上训练的系统,该系统在口音、背景噪音和技术方面开箱即用
Olewave的最详细RNN-T说明:使用递归神经网络进行序列转导
Alex Graves的RNN-T论文是如今几乎所有流式ASR系统的隐形祖先,从Google的设备端识别器到NeMo、ESPnet等中的无数开源转导器堆栈。
