Meta的Movie Gen对比OpenAI的Sora:详细评测
Meta终于亮出了对抗Sora的底牌,Movie Gen不仅仅是一个视频生成器——它是一组基础模型,可以生成1080p高清视频,支持多种宽高比和同步音频,支持精确的指令基础视频编辑
推断 OpenAI GPT-4o 的神经网络架构
OpenAI 尚未发布关于 GPT-4o 的论文,所以这个视频做了次优选择:根据 OpenAI 实际展示的能力反向工程推断神经网络架构
Google 通用语音模型胜过 OpenAI 的 Whisper 模型,支持 100+ 种语言
Google 通用语音模型悄然做了一件了不起的事情:在 100+ 种语言的 ASR 上与 OpenAI 的 Whisper 相当或超过,同时使用大约七分之一的标注训练数据
披露 OpenAI GPT-4 的视觉+文本模型、数据和训练成本(推测)
众所周知,OpenAI 拒绝披露 GPT-4 的架构、参数数量、训练数据或计算预算,这使得技术报告成为 ML 社区的罗夏测试。
OpenAI 的 GPT-3 深度评论:语言模型是少次学习者(第 3/3 部分:结果和其他)
这个三部分 GPT-3 深度讨论的最后一部分到达了精彩部分:当您在基准套件上投入 1750 亿个参数并完全跳过微调时实际会发生什么。
[10分钟] 解释为什么OpenAI的Whisper API不如ChatGPT
Whisper引起了轰动,但它并没有像GPT-3改造NLP那样改造ASR,这个十分钟的评论论证原因就在论文本身。
ChatGPT/ChatGPT Plus/InstructGPT:用人类反馈训练语言模型以遵循指令
ChatGPT 产品背后是 InstructGPT 论文,这次详细评测拆解了如何将原始 GPT-3 转变为人们真正想对话的系统的流程。
[Olewave评论] CLIP (3/3): 从自然语言监督学习可转移的视觉模型
CLIP评论的最后一部分聚焦于结果部分,这是OpenAI对比图文模型从有趣想法转变为整个多模态堆栈基础原语的时刻。
[Olewave评论] CLIP (2/3): 从自然语言监督学习可转移的视觉模型
OpenAI的CLIP通过抛弃固定标签集,转而在从互联网上抓取的4亿个(图像、文本)对上进行训练,改变了计算机视觉的游戏规则。
[Olewave的评论] OpenAI的Whisper ASR:通过大规模弱监督实现鲁棒语音识别
当OpenAI发布Whisper时,ASR社区不得不面对一个在680,000小时的多语言、多任务、网络爬取音频上训练的系统,该系统在口音、背景噪音和技术方面开箱即用
[长评] 级联扩散模型高保真图像生成
在Imagen和DALL-E 2将扩散模型作为生成图像的默认选择之前,这篇Google Brain论文阐述了许多后来的文本到图像系统悄悄借鉴的级联扩散方案:从小
