评测 Microsoft 的 VALL-E 2(在零样本 TTS 中实现人类水平)
零样本 TTS 刚刚越过了许多人认为还需要多年才能跨越的界线:Microsoft 的 VALL-E 2 是首个在 LibriSpeech 和 VCTK 上在鲁棒性、自然性和说话人
评测 DiTAR:语音生成的扩散 Transformer 自回归建模 ~ Seed-TTS
Seed-TTS 团队回归了 DiTAR,这是对现代语音生成中最尴尬权衡之一的简洁答案:如何在不支付混合扩散加自回归堆栈通常要求的计算成本的情况下保持连续语音表示的灵活性,同时不接受这些组
评测 ByteDance/Tiktok 的 Seed-TTS:一系列高质量多功能语音生成模型
ByteDance 的 Seed-TTS 是 TTS 从组件升级为真正基础模型的最强信号之一。
是什么使Olewave的语音数据清洗管道有效且独特
Olewave的Olign管道如何将原始音频转变为生产就绪的ASR/TTS训练数据——经过验证的转录文本、词级时间戳和置信度分数,无需人工标注员。
从OpenAI Whisper到您的自研ASR服务:识别命名实体和特定领域术语
开箱即用的Whisper令人印象深刻,但任何真正将其投入生产的人都知道其中的痛点:它在处理专有名词、产品名称、医学术语、法律术语和整个特定领域词汇的长尾部分时容易出错
Meta的Movie Gen对比OpenAI的Sora:详细评测
Meta终于亮出了对抗Sora的底牌,Movie Gen不仅仅是一个视频生成器——它是一组基础模型,可以生成1080p高清视频,支持多种宽高比和同步音频,支持精确的指令基础视频编辑
推断 OpenAI GPT-4o 的神经网络架构
OpenAI 尚未发布关于 GPT-4o 的论文,所以这个视频做了次优选择:根据 OpenAI 实际展示的能力反向工程推断神经网络架构
Google 通用语音模型胜过 OpenAI 的 Whisper 模型,支持 100+ 种语言
Google 通用语音模型悄然做了一件了不起的事情:在 100+ 种语言的 ASR 上与 OpenAI 的 Whisper 相当或超过,同时使用大约七分之一的标注训练数据
Olewave 参加 ICASSP 2024
我们是 IEEE ICASSP 2024 在首尔的赞助商和参展商,我们的创始人兼首席执行官韦楚进行了一场关于从野生、网络数据训练语音模型的聚焦演讲
利用野生数据进行高投资回报率的语音研发——我们的 ICASSP 2024 聚焦演讲
我们的创始人兼首席执行官韦楚的 ICASSP 2024 聚焦演讲,讲述为什么传统语音服务构建的投资回报率较低——以及如何通过过滤野生数据 + 使用大型开源语音模型自动标注私有数据来扭转局面
长篇评测:Apple的MM1:多模态LLM预训练的方法、分析和见解
Apple不经常发表论文,所以当MM1论文发布时,其中包含了关于多模态LLM预训练的完整消融研究,这是今年对任何构建MLLM的人来说最有用的数据发布之一。
Apple的SOTA多模态LLM快速评测:MM1
如果你没有时间进行完整的MM1分解,这个快速评测会在几分钟内为你提供要点:Apple构建了什么,他们从架构和数据消融中学到了什么,以及哪些设计决策
让Claude 3超越GPT-4的秘密
当Claude 3 Opus在MMLU、GPQA、GSM8K和大多数前沿评测基准上击败GPT-4时,有趣的问题不是Anthropic是否只是规模更大——而是什么秘诀真正让他们做到了这一点。
变分自编码器(VAE)与重参数化技巧 - 重温经典生成模型
扩散模型出现前,标准化流出现前,潜在扩散模型悄悄地将VAE编码器植入每一个严肃的生成堆栈之前——有Kingma和Welling在2013年发表的论文介绍了变分自编码器
Microsoft+OpenAI、Google、Meta和Nvidia开源大型语音模型ASR评测
如今每个主要的AI实验室都推出了开源大型语音模型用于ASR,为生产系统选择合适的一个已成为真正的决策问题。
[详细论文解读] Zipformer:自动语音识别的更快更优编码器
Conformer多年来一直是默认的ASR编码器,但k2/icefall团队的Zipformer在LibriSpeech、Aishell-1和WenetSpeech上悄悄夺得WER冠军,同时更快更轻。
Tycho:用于构建高ROI自研语音相关服务(ASR/TTS/Translation)的工具包:概述
大多数想要自研ASR、TTS或语音翻译服务的团队面临同样混乱的选择:将ESPnet、NeMo、k2和HuggingFace的片段粘合在一起,或将一切交给云API并按分钟付费
从OpenAI的Whisper模型到自研ASR服务:后处理和语言建模
原始Whisper输出开箱即用,令人印象深刻,但任何真正将其交付给用户的人都知道演示转录和下游系统能实际使用的内容之间的差距。
从OpenAI的Whisper模型到自研ASR服务:长音频和流式处理(第3部分)
Whisper在30秒的数据块上进行了训练,当您向其馈送两小时的播客或尝试将其连接到实时字幕管道时,这一点就显而易见了。
从OpenAI的Whisper模型到自研ASR服务:ROI(投资回报率)(第2部分)
对于ASR,'自建还是购买'的问题通常被框架化为准确性与便利性的权衡,但真正的决定因素是产品生命周期内的ROI。
为什么OpenAI Whisper生成的词时间戳不准确?如何再次使其准确?
向Whisper请求词时间戳,你会得到数字——但如果你曾经尝试将它们与实际音频对齐以进行卡拉OK、字幕或配音,你就知道它们漂移、卡在错误的边界上,有时会
DeepMind的WaveNet用于TTS/音频合成的评述(看起来像GPT吗?)
在Tacotron之前,在VALL-E之前,在神经编解码器将音频转换为令牌之前,DeepMind的WaveNet是展示神经网络可以逐个样本生成原始音频波形并击败所有参数化和
